{"as_of":"2026-08-08T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eebbd218bc87fcab489ea4f13f83bc7573544201d7a7f257dbdb6c6ecce0dcc7","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:33:35.646519Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:33:30.642947Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:33:35.965089Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"cited_work":{"arxiv_id":"2505.24304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24304","snapshot_observed_at":"2026-08-07T12:33:35.965089Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","venue":"eess.AS","work_id":"be952c41-3119-4cf8-a9f7-d5af381141a5","year":2025},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.642947Z"},"links":{"cited_paper":"/paper/2505.24304","citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:492ad055c97f2036a697575c80e5f36f1aacef05da0c5487ffdcd73076703d53","observation_id":"cde97161-02ae-432f-ba31-bf5f4f03bb9d","resolution":{"observed_at":"2026-08-07T12:33:36.027874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24304/citation-record","integrity":"/paper/2505.24304/integrity","json":"/paper/2505.24304/citation-record.json","paper":"/paper/2505.24304"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:41.587858Z","title":"Many studies indicate that mispronunciations or ac- cents do not necessarily result in unintelligible speech","venue":null,"work_id":"aa6fed57-49c2-4795-9a85-e0abef93c077","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.040409Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:77f3a4e66edb837049776f70259f75e44bf7cfafda026aef9287deec5e76ce73","observation_id":"ceb65992-6e8b-4765-992f-0953e80accdb","resolution":{"observed_at":"2026-08-07T12:33:41.661959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:41.412235Z","title":null,"venue":null,"work_id":"b5a758aa-df3e-43ea-86d3-54d5f139f34f","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.215094Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:2b618db7ca320c60746268ec7f9fdd30948c926da451fa0120903d88193d2bdc","observation_id":"bc515151-7793-415b-91f5-b9385b9ba46a","resolution":{"observed_at":"2026-08-07T12:33:41.496378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:41.254552Z","title":null,"venue":null,"work_id":"df6503db-fb3f-4220-8238-56e25ffa567a","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.375322Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:7c29ee5035bbe61fe0877b1203abea3a469dbcd7e92367cc8ce5d1091d15e03b","observation_id":"bada1b72-a801-4b5d-84cf-a5d7547e7331","resolution":{"observed_at":"2026-08-07T12:33:41.325568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:41.124252Z","title":null,"venue":null,"work_id":"5f42952b-63ae-41c7-956e-342158359b08","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.508333Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:ea4dd1a2fb6fd807d19d8b76f4bb9d608216a1106958c20be1270bebd2b706eb","observation_id":"1775ba2e-1f36-4fc8-af6f-eed32c5282e4","resolution":{"observed_at":"2026-08-07T12:33:41.187046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"cited_work":{"arxiv_id":"2505.24304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24304","snapshot_observed_at":"2026-08-07T12:33:35.965089Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","venue":"eess.AS","work_id":"be952c41-3119-4cf8-a9f7-d5af381141a5","year":2025},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.642947Z"},"links":{"cited_paper":"/paper/2505.24304","citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:492ad055c97f2036a697575c80e5f36f1aacef05da0c5487ffdcd73076703d53","observation_id":"cde97161-02ae-432f-ba31-bf5f4f03bb9d","resolution":{"observed_at":"2026-08-07T12:33:36.027874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:40.989820Z","title":"The first approach leverages alignment failure to mimic rater perception break- downs, thereby identifying segments of unintelligibility","venue":null,"work_id":"b460ff1a-a11e-430d-b777-ddd9af258af7","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.795084Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:08330026c9d0283320dee69091887a621bbaa5d76b47e8d810730002bbd8726b","observation_id":"ab5df6ad-f6fe-4a41-8c28-293ea430f122","resolution":{"observed_at":"2026-08-07T12:33:41.060914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:40.771373Z","title":"Dataset We utilized the shadowing dataset described in [8, 9]","venue":null,"work_id":"0e57d328-cf0b-40da-b9f4-4bcdf8fe2244","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:30.967041Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:9f696ef3dbbe06c6063ee55cc9cdcc97abaf74a0342a968f7230bbc968fa6d55","observation_id":"beae64d7-b867-4fde-b0fd-50cd464d0b1a","resolution":{"observed_at":"2026-08-07T12:33:40.859656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:40.611694Z","title":"Objective evaluation We present our objective evaluation results in Table 1","venue":null,"work_id":"0b3ed4cf-93b1-46a3-a657-172c54ac7c13","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:31.198920Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:ea30c92d5fd8ef54ed5818fd56f12aaca3a51d6f4b8d4b6951389837d7a68f68","observation_id":"db5efe47-995d-4571-bc45-e12848c6aeec","resolution":{"observed_at":"2026-08-07T12:33:40.680004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:40.431677Z","title":null,"venue":null,"work_id":"a134ccc0-ab3b-4416-9b92-d12870eefa71","year":null},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:31.428329Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:bc5d1fe0bfcdc9b0ba1c6eb15a13ec6769060f4adb9075143d65de37efd5ce11","observation_id":"e890fa12-5a4a-4c9f-a6e6-923cb4bc7dbc","resolution":{"observed_at":"2026-08-07T12:33:40.533961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:40.296385Z","title":"Pronunciation accuracy and intelligibil- ity of non-native speech,","venue":null,"work_id":"a5fbfe8d-d131-4940-812a-b5bd38b24469","year":2015},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:31.587232Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:1d0b8d3a20456a99e8df73630a152f6602a358bcbf5bef440b08388c78fe91f5","observation_id":"fcedb63f-6e73-4f9d-9048-79d3da23ec78","resolution":{"observed_at":"2026-08-07T12:33:40.344835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:40.122629Z","title":"Evaluating openai’s whisper asr: Perfor- mance analysis across diverse accents and speaker traits,","venue":null,"work_id":"fef6833d-9fce-48d7-80c4-8cecd0f5a7fe","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:31.707443Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:2239c6d21cfe599a5ac00e0447b23559a66356a0f9b77245eca8209ddc834f0f","observation_id":"266632e3-1e75-4b5f-917d-dc6a159e575a","resolution":{"observed_at":"2026-08-07T12:33:40.229956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:39.972539Z","title":"The most spoken languages in the world,","venue":null,"work_id":"d40d6e26-57bc-4199-ba58-b6382e39e985","year":2023},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:31.838551Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:871e13818229a40ac1f576eb60f5eb467d9b7c3852d763604211577591e66547","observation_id":"7914e4c3-c38c-4f99-a075-51dbf0d99269","resolution":{"observed_at":"2026-08-07T12:33:40.034036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:39.789294Z","title":"Accent, intelligibility, and com- prehensibility: Evidence from four l1s,","venue":null,"work_id":"169f8876-d098-4a9c-aa59-10ad6b2f924b","year":1997},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.011407Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:2e4466846e4fb6e76f2cbae4d7bd252d0e8759e93dffd1d7a0c8466bdecb1c55","observation_id":"2515b06a-d78e-44ac-b0f3-ef924c469355","resolution":{"observed_at":"2026-08-07T12:33:39.864803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:39.588369Z","title":"Foreign accent, comprehensi- bility, and intelligibility in the speech of second language learn- ers,","venue":null,"work_id":"7c65c584-dda0-455f-9174-1c2c0cd5d4cb","year":1995},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.148355Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:68c40f632c05c1e271ada418b2040153e4c69e9888f384ce2a088f8a68bed7ad","observation_id":"38b9c451-7dea-409b-bf55-21ad8f829423","resolution":{"observed_at":"2026-08-07T12:33:39.697393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:39.416738Z","title":"A Study of Objective Measurement of Com- prehensibility through Native Speakers’ Shadowing of Learners’ Utterances,","venue":null,"work_id":"fcade952-6f16-443e-98f4-b42050b32c2f","year":2018},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.286405Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:26283de6e37f85661ac88919f842c5da04cf39390e324045a65c3f5e5775d9ef","observation_id":"f8716ce3-8a94-48dc-9eb4-b1dc673751fc","resolution":{"observed_at":"2026-08-07T12:33:39.481789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:39.272553Z","title":"Shadowability annotation with fine granularity on l2 utterances and its improvement with native listeners’ script-shadowing","venue":null,"work_id":"a05dc6c0-5fae-4df8-b1d1-4c6f4810c3d0","year":2020},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.445386Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:d4d79e17d68ea041c03ce18f61b5048ebf2911e36f3f800453a68e500b3e826b","observation_id":"6c4c2b3b-342d-459a-bd55-4a884ba3fd8d","resolution":{"observed_at":"2026-08-07T12:33:39.334120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:39.100479Z","title":"Multi-granularity annotation of instantaneous intelligibility of learners’ utterances based on shadowing tech- niques,","venue":null,"work_id":"910c2240-c9d8-40bd-947d-5e09ed7990cd","year":2021},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.555258Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:042a6b991eb97e566209563dd60b635772f26233c43bb93a5eb141b0a3a667b2","observation_id":"a8b55d44-a483-4986-b37e-8ee1212df668","resolution":{"observed_at":"2026-08-07T12:33:39.183081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:38.944272Z","title":"Automatic Scoring of Shadowing Speech Based on DNN Posteriors and Their DTW,","venue":null,"work_id":"20cdc860-e3f3-4959-97d1-35a89ac1dafc","year":2017},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.764027Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:2b290fb00b7f78e2518701fc33546166475caba05721efa35f8d05866011d9d7","observation_id":"7a5280e9-7c3a-474f-91b6-fb151b201410","resolution":{"observed_at":"2026-08-07T12:33:39.012459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:38.682472Z","title":"V oice Transformer Network: Sequence-to-Sequence V oice Con- version Using Transformer with Text-to-Speech Pretraining,","venue":null,"work_id":"7f15bc3a-b223-4845-826d-20fc8e7f8686","year":2020},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:32.960281Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:88aff4b92d253ecdea4a01369bcd2932f8ee1451ed9dffe540b24f0e6b7d05bf","observation_id":"ca6f6d4f-b29e-42a2-9ca8-182dac65fc91","resolution":{"observed_at":"2026-08-07T12:33:38.834132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:38.479593Z","title":"Non- autoregressive sequence-to-sequence voice conversion,","venue":null,"work_id":"a8361ab8-c208-4092-b03d-c698b5e6fc64","year":2021},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.116230Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:f7b5e7dbfc72f964161f137a9b3a6a620412c419a20ed70c2052dea963cd7e03","observation_id":"9688e119-a869-416b-87cf-8b6e803432ce","resolution":{"observed_at":"2026-08-07T12:33:38.556646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:38.346701Z","title":"E2e-s2s-vc: End-to-end sequence-to-sequence voice conversion,","venue":null,"work_id":"9e28db13-230f-4fcc-9d37-7bdf932f698e","year":2023},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.294538Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:71e9f5d57d9b278e9d738c107bfa0ae39548d960e8e7169569cee1005f3c7d32","observation_id":"dc9b86c0-fbe6-4317-b286-8f37854a8dd0","resolution":{"observed_at":"2026-08-07T12:33:38.406295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07598","last_updated":"2023-09-15T10:47:52Z","snapshot_observed_at":"2026-07-06T16:18:25.480941Z","submitted_at":"2023-09-14T10:59:29Z","title":"AAS-VC: On the Generalization Ability of Automatic Alignment Search based Non-autoregressive Sequence-to-sequence Voice Conversion","version":2},"cited_work":{"arxiv_id":"2309.07598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07598","snapshot_observed_at":"2026-08-07T12:33:35.777226Z","title":"AAS-VC: On the Generalization Ability of Automatic Alignment Search based Non-autoregressive Sequence-to-sequence Voice Conversion","venue":"cs.SD","work_id":"0bacca10-b95b-488e-a5d9-86c61c98e56f","year":2023},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.432799Z"},"links":{"cited_paper":"/paper/2309.07598","citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:f55c4a8321af7a5a5269d89ed2bd189bdd2f63df1e50a1efdf101f04da0ece91","observation_id":"f6f45039-c807-488c-aa52-e0b9ebd9bc5c","resolution":{"observed_at":"2026-08-07T12:33:35.875733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:38.212217Z","title":"wav2vec 2.0: a framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"63317097-6a21-4425-81b8-f194f754f46a","year":2020},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.541631Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:1292dcfb343aaf1da16ffb3162b802955113c8f086e290a3d4da3b9d1c7b28cf","observation_id":"d93960e8-c812-4d9d-97e3-ba0b78b51ba7","resolution":{"observed_at":"2026-08-07T12:33:38.258277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:33.717195Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.717195Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:23f6287e1b50ef45f4821bcfbbb06edf342302aafb40ebd1031b4d59ee98d0e3","observation_id":"790c48f5-d668-4728-9959-956755d9ef10","resolution":{"observed_at":"2026-08-07T12:33:33.717195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:38.061865Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"609a37f3-69e0-4648-894c-de2012b0ae9e","year":2022},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.837511Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:d0f6219a9af39a2923a0a27b937269289f128f4a37965a479ed72e56fbfb9225","observation_id":"76c9f06f-8c79-4c6d-abef-2847d2802e92","resolution":{"observed_at":"2026-08-07T12:33:38.136887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:37.916988Z","title":"A large-scale evaluation of speech foundation models,","venue":null,"work_id":"ef4b3711-544d-4819-b1ec-43a1e721ebdd","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:33.908915Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:cbe68863ec14b160b1404ad8978af07a92e82448e106dd7aa16dca4cd275f1ec","observation_id":"2c2aafa3-a28f-416d-ac5b-4883a187cac1","resolution":{"observed_at":"2026-08-07T12:33:37.976801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:37.729376Z","title":"Pretraining and adaptation techniques for electrolaryngeal speech recognition,","venue":null,"work_id":"396972b8-3d87-43e3-ae47-c8f92e195680","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.035074Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:96688ec41465df4376015a6ffcba07d359de73e943980a35bfbbc0e8726b4b2e","observation_id":"bc44c133-4669-42eb-af49-6944ced40a9e","resolution":{"observed_at":"2026-08-07T12:33:37.823772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:37.589198Z","title":"Electrolaryngeal speech intelligibility enhancement through robust linguistic encoders,","venue":null,"work_id":"4f01b891-ed9f-4ce3-bc1a-ea3241bbb941","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.172483Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:acf5cfc7fff8b9d70d2167abfd26d6fcc7b1eb029fb63f3d71582c8219f1c875","observation_id":"834f8faf-46d1-4b3d-bfd5-ebd004433f1d","resolution":{"observed_at":"2026-08-07T12:33:37.641297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:37.401029Z","title":"A pilot study of applying sequence-to-sequence voice conversion to evaluate the intelligi- bility of l2 speech using a native speaker’s shadowings,","venue":null,"work_id":"7bc4053e-90c8-4574-a762-6963f2088979","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.348622Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:1abf0f4d79990efd4a4fcc9a2e668edefbdf3ff53df73c0673a0f31a4d40ebf7","observation_id":"c5dcafb3-057f-4127-a919-59051beac77b","resolution":{"observed_at":"2026-08-07T12:33:37.481214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:37.245260Z","title":"Rad-tts: Parallel flow-based TTS with robust alignment learning and diverse synthesis,","venue":null,"work_id":"6bfea00d-f990-4703-8791-a7c84b5952c6","year":2021},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.492075Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:3bbcce125a5026173928624b1459ec62084a113dccb0ad780467c3f0672fe423","observation_id":"53e955a5-4ba0-4a3b-80ef-1c4a0ff61da3","resolution":{"observed_at":"2026-08-07T12:33:37.295733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:37.081122Z","title":"One tts alignment to rule them all,","venue":null,"work_id":"4ea427a9-b7c4-48b1-b704-2435bb9b5896","year":2022},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.600392Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:16e18ee2b7bb536b151c7d353dfff7c5bb691bdbab81a3f75f5eb50fc6529962","observation_id":"83f208d4-0fb0-4b51-8eb2-c4ee17ff0ab2","resolution":{"observed_at":"2026-08-07T12:33:37.140225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:36.886361Z","title":"Focal loss for dense object detection,","venue":null,"work_id":"ba038ca5-418c-474d-a43d-146ea85edc3b","year":2017},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.752116Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:ca788f0947360d7eb7d0a9088d16636cec4c37467532390065c92431b77989a3","observation_id":"df436d14-f100-4723-a3a8-acd983ff24bc","resolution":{"observed_at":"2026-08-07T12:33:36.985028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:36.732174Z","title":"Any-to-many voice conversion with location-relative sequence- to-sequence modeling,","venue":null,"work_id":"92810bf7-6205-441d-82f7-dc76382307b9","year":2021},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:34.917483Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:d426b57f05c2246dddd49fbb2bad4cf69dc2c405557e150770042a8c6a17ca6f","observation_id":"78586f09-d5dc-454c-892b-a0836e4a6421","resolution":{"observed_at":"2026-08-07T12:33:36.807434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:36.596216Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":"f2f441d1-8ae7-4506-bfba-4013142e6ec2","year":2015},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:35.087485Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:b910db735c767d92572556c2fb196726000a181b17c8511676dda6c57de46ff0","observation_id":"963ae5e1-8ae8-4396-bb26-786499f75f33","resolution":{"observed_at":"2026-08-07T12:33:36.660696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:36.434479Z","title":"Exploring impact of pausing and lexical stress patterns on l2 english com- prehensibility in real time,","venue":null,"work_id":"ce29f5e8-f4a8-4aa7-90b2-14af6d7fa414","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:35.223435Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:3e09d161b724ac79256d8d71ffb4caa75c8a6c085c269a92659744a05fab3209","observation_id":"6faf63e6-6d73-461a-9564-380ee2adecd5","resolution":{"observed_at":"2026-08-07T12:33:36.513937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:36.261333Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"908d59e5-ed1a-4ea3-aff8-08b869aa4081","year":2022},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:35.362647Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:a9f335450c728df792bead314d1fa03e6f731311c2d9e003902b40ee05711c73","observation_id":"6d750411-31ae-4637-8e4e-9d115b93df0d","resolution":{"observed_at":"2026-08-07T12:33:36.330502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:36.108618Z","title":"The voicemos challenge 2024: Beyond speech quality prediction,","venue":null,"work_id":"b2078f80-c8cf-4189-9771-393ec78d4e30","year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:35.506941Z"},"links":{"citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:826d71cda88a07ad17c8098bf7d9b31a40828e478b8a34655da99bf2757574fb","observation_id":"6ba410ff-6c6c-4a00-8099-5e770fcc8bf3","resolution":{"observed_at":"2026-08-07T12:33:36.174482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-04T18:12:22.604177Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-07T12:33:35.646519Z","title":"Versa: A versatile evaluation toolkit for speech, audio, and music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:35.646519Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2505.24304"},"observation_digest":"sha256:c3f5bd2fd108743f0ddcd6f528b786ba2fbdceda2f1500b99e6d10bc1e46cdd8","observation_id":"fd93df1e-f37e-4e32-87c0-85a1ab98ceeb","resolution":{"observed_at":"2026-08-07T12:33:35.646519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24304","last_updated":"2025-05-30T07:35:40Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T12:23:41.728446Z","submitted_at":"2025-05-30T07:35:40Z","title":"A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":30},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2505.24304."}