{"as_of":"2026-08-14T01:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:449862dfc7bea1c1bd4cb249a4eebbe27a04c95223c7249c269755e9d4fb331f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":98,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:42:39.900727Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T20:34:09.715401Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:49:52.184932Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2210.13438"},"observation_digest":"sha256:f37b601d8d2e1e2ad0033a7efce106fa052412eddb159f27edf7e2b01bbef02e","observation_id":"87d70c28-3dcf-4566-9713-5d67ff848de3","resolution":{"observed_at":"2026-05-13T21:49:52.212568Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:23c1c031a806bff26413301b0997451166332307f54cb34683f8eb1086fbbdac","observation_id":"d7ebdee7-0e41-4c7c-89d6-d2cb89f158a1","resolution":{"observed_at":"2026-05-15T12:26:37.422301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:0545133181710d5ca485fcb07937504ed367e46430771514b10f498891498640","observation_id":"0193b1ef-cf8c-4438-bfde-1bb999c3fee4","resolution":{"observed_at":"2026-05-16T06:06:41.464496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T20:42:39.900727Z","title":"arXiv preprint arXiv:1912.06670 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.09431","last_updated":"2024-11-14T13:29:09Z","snapshot_observed_at":"2026-08-13T20:26:10.529303Z","submitted_at":"2024-11-14T13:29:09Z","title":"Everyone deserves their voice to be heard: Analyzing Predictive Gender Bias in ASR Models Applied to Dutch Speech Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:42:39.900727Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.09431"},"observation_digest":"sha256:bde34e5abeef39e4842388b628311978636bf10e801796ada28abc4b59edeb92","observation_id":"8484836c-7d02-49a9-b0a0-c48bc5308321","resolution":{"observed_at":"2026-08-12T20:42:39.900727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T16:27:34.226624Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.13453","last_updated":"2024-11-20T16:59:41Z","snapshot_observed_at":"2026-08-13T05:37:29.273825Z","submitted_at":"2024-11-20T16:59:41Z","title":"LIMBA: An Open-Source Framework for the Preservation and Valorization of Low-Resource Languages using Generative Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:34.226624Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.13453"},"observation_digest":"sha256:52b908c8b221d1ed4888650bd0bc2f4337a96a19be6f4c0b981e30013802c34c","observation_id":"34702040-3119-4a93-9df6-9688a1d41e76","resolution":{"observed_at":"2026-08-12T16:27:34.226624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T20:13:56.996509Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.996509Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8342d8fb051f8a82a0cab655b39b784a68a7bfbbf9556af955828c0afaf00341","observation_id":"956ed686-9594-4924-b517-422a317da9f2","resolution":{"observed_at":"2026-08-12T20:13:56.996509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T14:53:50.193004Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-13T15:54:06.885977Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.193004Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:9200401abf715f2f7fa967890e514a27482fd9fb20d61338cf498b71cd6b0a71","observation_id":"cc86c316-5d8f-44fe-a60a-5e5e3d4e7047","resolution":{"observed_at":"2026-08-12T14:53:50.193004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T18:08:22.362702Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-13T23:38:56.976289Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.362702Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:05aae617c96b6262769032c38e9b2925e93ba24c29e6faf547cc566f8b8d3fce","observation_id":"1ba52b68-e7f6-4832-9721-4ba82c72dc29","resolution":{"observed_at":"2026-08-11T18:08:22.362702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T16:56:05.972313Z","title":"Com- mon voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:05.972313Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.09596"},"observation_digest":"sha256:57091163bf6ee94b5695c7707a6d84be757b7d3a5877b9922c66b027f71947aa","observation_id":"433c683d-8d92-4f14-85ee-792f70a05c4a","resolution":{"observed_at":"2026-08-11T16:56:05.972313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T12:51:45.584508Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.13788","last_updated":"2024-12-18T12:31:31Z","snapshot_observed_at":"2026-08-12T21:10:19.487705Z","submitted_at":"2024-12-18T12:31:31Z","title":"Open Universal Arabic ASR Leaderboard","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:51:45.584508Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.13788"},"observation_digest":"sha256:ee2de5fd5cf79cafa8cefcb793295f25f4152e36f6350ec581459ac5c8115d37","observation_id":"069f4b31-69c7-48b8-9e71-9f8df2d5b3ec","resolution":{"observed_at":"2026-08-11T12:51:45.584508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T11:18:34.696506Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.15622","last_updated":"2024-12-20T07:28:04Z","snapshot_observed_at":"2026-08-13T18:08:12.828161Z","submitted_at":"2024-12-20T07:28:04Z","title":"TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:34.696506Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.15622"},"observation_digest":"sha256:eb740cbe526e26d86a464050590cf09f9ceb6cf244bd21bb5c74400e23cbc9d0","observation_id":"c6431d14-40bc-4618-97ec-5dacb1f90ac8","resolution":{"observed_at":"2026-08-11T11:18:34.696506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T11:18:39.639543Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:39.639543Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.15649"},"observation_digest":"sha256:cdbde9011048e3a2c6bb0ea476f5b155e549fb4f30c8f742c45502dfd908f042","observation_id":"9bedda1e-26fe-4ac7-9716-f8d7f61661de","resolution":{"observed_at":"2026-08-11T11:18:39.639543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T05:41:33.080449Z","title":"Com- mon voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-13T13:51:46.753556Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.080449Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:2eaa163fc97f1eb03a65392a0aa8fb4950fe3d9b3dde62049691a39c7ffd28f3","observation_id":"91b55cb7-7ec2-419a-9915-154f9b0191c5","resolution":{"observed_at":"2026-08-11T05:41:33.080449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T12:18:37.455322Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-11T15:06:50.062800Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.455322Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:99e6d35be8c1f396ce07262269611156f8e2f6d5e844a2ce16cbde73d8abe1ac","observation_id":"4bad7737-d010-4bdb-8af7-b4f872455d9b","resolution":{"observed_at":"2026-08-11T12:18:37.455322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T00:50:14.391612Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-13T19:05:18.330108Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.391612Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:970855cf183a6344c6525591bf63224f3363a42f5d325854415823df920fd216","observation_id":"eb003fc7-c6f4-4ad0-8706-355b6141c441","resolution":{"observed_at":"2026-08-11T00:50:14.391612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T22:54:41.272845Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.00425","last_updated":"2024-12-31T13:03:20Z","snapshot_observed_at":"2026-08-10T22:49:09.575066Z","submitted_at":"2024-12-31T13:03:20Z","title":"Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:54:41.272845Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.00425"},"observation_digest":"sha256:5b388f4919167ba4199284335ac773de643bfc77a4932c4af5a4bdc897292504","observation_id":"aa485003-a78d-4b0c-920b-5c604ec2c12c","resolution":{"observed_at":"2026-08-10T22:54:41.272845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T21:10:52.761839Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.06051","last_updated":"2025-06-15T16:51:53Z","snapshot_observed_at":"2026-08-13T17:45:25.333618Z","submitted_at":"2025-01-10T15:30:46Z","title":"Benchmarking Rotary Position Embeddings for Automatic Speech Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:52.761839Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.06051"},"observation_digest":"sha256:d56484b7fe19cfc3e04b462af0a4e80166c51025d298e51f7a1c9e0e35f3bec7","observation_id":"8822f781-c07d-4f46-8fbb-655b88e1ed4a","resolution":{"observed_at":"2026-08-10T21:10:52.761839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T21:10:56.614639Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-13T18:35:10.938726Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:10:56.614639Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.06282"},"observation_digest":"sha256:cdc90ed09604466dc593c2318f62fb9bfb9beb7868b7fb1102eaf7d404d891bd","observation_id":"c7a839c8-45f7-4aad-af85-79b48f825d85","resolution":{"observed_at":"2026-08-10T21:10:56.614639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T20:34:20.595842Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.07875","last_updated":"2025-01-14T06:33:40Z","snapshot_observed_at":"2026-08-11T01:41:54.248756Z","submitted_at":"2025-01-14T06:33:40Z","title":"Continual Learning with Embedding Layer Surgery and Task-wise Beam Search using Whisper","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:20.595842Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.07875"},"observation_digest":"sha256:b1948eb63ee6d9330fb5d4889fcddf69982cb9f2f61977b2e89dc2608c927d2f","observation_id":"e76a2dad-6511-442d-98a5-0d93d246afa1","resolution":{"observed_at":"2026-08-10T20:34:20.595842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T20:24:34.024941Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.08696","last_updated":"2025-01-15T10:09:38Z","snapshot_observed_at":"2026-08-13T23:06:11.286332Z","submitted_at":"2025-01-15T10:09:38Z","title":"Deep Learning-Based Feature Fusion for Emotion Analysis and Suicide Risk Differentiation in Chinese Psychological Support Hotlines","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:24:34.024941Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.08696"},"observation_digest":"sha256:074c3585394409a808a72b0587825ae3184a97397cc5e1944a9235405ba12725","observation_id":"b2eb1122-4a9a-44b3-9555-1dc409910eeb","resolution":{"observed_at":"2026-08-10T20:24:34.024941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T20:03:12.651296Z","title":"Com- mon voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-08-10T19:55:29.245089Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:03:12.651296Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.09502"},"observation_digest":"sha256:ab93203d3cbb5a49d7692c3ec7841d5f49482dbdcb2f716d2d3f7ee8c964a49a","observation_id":"beb4ae5f-7384-4bd6-ab7c-16cfd379af47","resolution":{"observed_at":"2026-08-10T20:03:12.651296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T20:00:24.493040Z","title":"& Weber, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09512","last_updated":"2025-01-21T10:39:27Z","snapshot_observed_at":"2026-08-14T01:19:27.746345Z","submitted_at":"2025-01-16T12:57:33Z","title":"PIER: A Novel Metric for Evaluating What Matters in Code-Switching","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:00:24.493040Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.09512"},"observation_digest":"sha256:ec38d7603b86fb80225ca83a77b7be9e8d59de1bf7f9db32e5fe39a3f8b12337","observation_id":"fb80b939-254c-44d0-a589-6401fb6b00cf","resolution":{"observed_at":"2026-08-10T20:00:24.493040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T19:06:00.182562Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.10734","last_updated":"2025-01-18T11:53:22Z","snapshot_observed_at":"2026-08-12T11:20:02.697287Z","submitted_at":"2025-01-18T11:53:22Z","title":"GEC-RAG: Improving Generative Error Correction via Retrieval-Augmented Generation for Automatic Speech Recognition Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:06:00.182562Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.10734"},"observation_digest":"sha256:9f4086d907dfeb09e564092e7eb5bdf4336ddc00fdea6dc9e2d17b26d8c90897","observation_id":"e45163ec-a30c-4ba3-9c74-163985ba9022","resolution":{"observed_at":"2026-08-10T19:06:00.182562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T18:43:47.039372Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.11065","last_updated":"2025-01-19T14:49:43Z","snapshot_observed_at":"2026-08-10T18:38:12.309382Z","submitted_at":"2025-01-19T14:49:43Z","title":"Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:43:47.039372Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.11065"},"observation_digest":"sha256:fb4ace4ed83015ed0f86756993ee38e9272271d8adae7078932d2787683603a8","observation_id":"9d73cbc9-6125-4053-9972-51c881cd0a5e","resolution":{"observed_at":"2026-08-10T18:43:47.039372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T21:35:03.015272Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.14788","last_updated":"2025-02-07T07:21:50Z","snapshot_observed_at":"2026-08-10T21:27:32.141232Z","submitted_at":"2025-01-08T15:18:42Z","title":"Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:35:03.015272Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.14788"},"observation_digest":"sha256:c2c3450e2dfc5875c3b5325beb7af77040528695ec5a031710bf8fbfdeffebdd","observation_id":"9794c380-5dd9-4569-a695-f8ce81a29f3f","resolution":{"observed_at":"2026-08-10T21:35:03.015272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T14:21:56.679058Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.679058Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:78be0877a744c784ba7d1116c94e2840832511342a1e1c9faae14eaa6202d0f9","observation_id":"f20de216-c0fa-4ae2-9415-b9ade29e7593","resolution":{"observed_at":"2026-08-10T14:21:56.679058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T12:30:52.006659Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-08-10T22:41:16.294643Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T12:30:52.006659Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.17202"},"observation_digest":"sha256:460938ab815d7e33555fc0c96c9739295a5f90f04c9eac6177f98ca021cdfdd3","observation_id":"a820f333-86f3-46f8-b3e8-c2ec82ea625a","resolution":{"observed_at":"2026-08-10T12:30:52.006659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-09T05:54:18.398909Z","title":"M., and Weber, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-13T03:10:13.532495Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.398909Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:07cb6d970040dd49fbb2e6efec0c3f0a7a6891a4f9d0a5a5e3e728cebb6a1b79","observation_id":"02251048-9c56-4018-b48c-6bc4fd013b8d","resolution":{"observed_at":"2026-08-09T05:54:18.398909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-08T19:07:00.575954Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-09T19:41:17.737989Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.575954Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:542000ca18faedce6ce72b8099f30912d604d1d95aea71b2b6c87e8b89fbb764","observation_id":"278b1ffd-223a-4ed5-b5d0-e5c554b3a460","resolution":{"observed_at":"2026-08-08T19:07:00.575954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:44a1ff0370f37b96700b22e86e3de6bbb0287857ccfa9cf1575f09bbfaf28135","observation_id":"f9fc609c-8aac-4ee2-b428-e7c5142a8e11","resolution":{"observed_at":"2026-05-11T19:21:27.174181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T15:16:34.180674Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.15646","last_updated":"2025-05-21T15:24:29Z","snapshot_observed_at":"2026-08-13T23:33:04.765561Z","submitted_at":"2025-05-21T15:24:29Z","title":"Word Level Timestamp Generation for Automatic Speech Recognition and Translation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:34.180674Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.15646"},"observation_digest":"sha256:22cdf98258aeb18fa2100a0d2d6d859dc5fdc6bbd55d68b85610af77cb1e5f61","observation_id":"2530e5b1-52e4-485b-a0c5-2e93f5dc27e0","resolution":{"observed_at":"2026-08-07T15:16:34.180674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:58:55.919987Z","title":"Preprint, arXiv:1912.06670","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:55.919987Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:728ed43964b0105d180aeb2b9365dc86bba1ef2bc0969689720369c26ba0c3bb","observation_id":"49016cc0-d922-442c-819a-db771d2bb707","resolution":{"observed_at":"2026-08-07T14:58:55.919987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:55:53.700409Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-09T09:32:42.256193Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:53.700409Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:e001f148c3cdfa6f0a705047e3c25a256ed74a305e2c4a76ba781fb57c8745ac","observation_id":"51065def-f9b0-4641-bc23-c1fe90918aba","resolution":{"observed_at":"2026-08-07T14:55:53.700409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-13T01:08:56.872280Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:ba00656825cd6fcb8aecd7e7aa59af9f5394f08ad5fb4067a72923aae6e84ec1","observation_id":"ead80c36-0dca-484d-8c5c-2884a276e6e4","resolution":{"observed_at":"2026-05-16T05:27:25.601064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:42:03.646387Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.17841","last_updated":"2025-05-23T12:55:33Z","snapshot_observed_at":"2026-08-12T13:38:39.613227Z","submitted_at":"2025-05-23T12:55:33Z","title":"TEDI: Trustworthy and Ethical Dataset Indicators to Analyze and Compare Dataset Documentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:03.646387Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.17841"},"observation_digest":"sha256:ea60c70f254ac16e13c2426ace669236209245e22b92712a88a527fc7e757b60","observation_id":"822593e5-f9d0-44e6-af48-be096195ce24","resolution":{"observed_at":"2026-08-07T14:42:03.646387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:30:33.640309Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-14T00:00:01.317180Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.640309Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:59ef7e4a013887be981bf72cf1fd537992397b66580959e8c4981fb990d2b67b","observation_id":"e30882b3-e03d-401d-80b8-addefa9bd630","resolution":{"observed_at":"2026-08-07T14:30:33.640309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:25:01.031221Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.19119","last_updated":"2025-05-25T12:22:00Z","snapshot_observed_at":"2026-08-09T08:08:38.091653Z","submitted_at":"2025-05-25T12:22:00Z","title":"CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:01.031221Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.19119"},"observation_digest":"sha256:7b17f7b4df906b92a3b1922ea07c424fa7d0828e64ed55656454e77b27415d04","observation_id":"77e558dc-80be-43d2-aa3a-a3b4ef0300ee","resolution":{"observed_at":"2026-08-07T14:25:01.031221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:12:48.384304Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-13T06:46:27.502820Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.384304Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:0dea2cc8dba7a5eeb7077bb5150bc620fb2d9ea7a84c177a205ac0476672b038","observation_id":"8907619b-305c-480c-bbdf-d9ac1a0a2de7","resolution":{"observed_at":"2026-08-07T14:12:48.384304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T13:42:53.941399Z","title":"arXiv preprint arXiv:1912.06670 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21230","last_updated":"2025-05-27T14:14:55Z","snapshot_observed_at":"2026-08-11T02:47:56.666671Z","submitted_at":"2025-05-27T14:14:55Z","title":"PSRB: A Comprehensive Benchmark for Evaluating Persian ASR Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:53.941399Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.21230"},"observation_digest":"sha256:6a415216ae8e061a7840e0224aa756e8a620899b825a2b6ef79ec64ace1a097a","observation_id":"511f7089-1cab-4aa8-82d5-f460ace0b40d","resolution":{"observed_at":"2026-08-07T13:42:53.941399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T13:49:21.198546Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.198546Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:0a8513d6ab6a4383cff2cfb42ae3fd4152046529f30cc864b5f984abeed0f9ca","observation_id":"9dc565a7-c1be-46a6-9342-50d71a9f83fe","resolution":{"observed_at":"2026-08-07T13:49:21.198546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T12:39:09.436359Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.24115","last_updated":"2025-05-30T01:26:31Z","snapshot_observed_at":"2026-08-07T12:32:05.551561Z","submitted_at":"2025-05-30T01:26:31Z","title":"FeatureSense: Protecting Speaker Attributes in Always-On Audio Sensing System","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.436359Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.24115"},"observation_digest":"sha256:e904e9eb68ac57039f76695e41e04fd5a036b57e8fb1f4c1ed8a9eeb91914c2a","observation_id":"41670f95-1e15-4599-984b-269336e035e4","resolution":{"observed_at":"2026-08-07T12:39:09.436359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2505.24437","last_updated":"2026-05-07T16:01:45Z","snapshot_observed_at":"2026-08-11T08:48:59.548957Z","submitted_at":"2025-05-30T10:20:04Z","title":"SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T13:10:14.839742Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.24437"},"observation_digest":"sha256:9f5f4ade97d30a98378a10e1d24944925996afdfddb22110656bab258ef746d2","observation_id":"0b96b370-57c2-41bb-860b-08283607a3cf","resolution":{"observed_at":"2026-05-19T13:12:18.238078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T12:12:20.661052Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-13T17:04:58.788393Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.661052Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:85e3b8da43a1119147aa448a70661ff63927454370e97b820015777c8e24be2a","observation_id":"39e7fa83-9333-474a-b8a6-85f1307ad3fb","resolution":{"observed_at":"2026-08-07T12:12:20.661052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T11:58:32.997075Z","title":"M., and Weber, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-11T23:05:47.501526Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.997075Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:94dd92da2bc2475ed3d6dfe03d2518a4de6bc95716caeb67db76a4b05b51c3f4","observation_id":"a1636c54-3f43-496b-9d53-5b339f20af2f","resolution":{"observed_at":"2026-08-07T11:58:32.997075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T10:18:50.628216Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.628216Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:e701959ad1e5dd533508a9e5bb6568f016c54eb47eb75c79a68d7f6649d35f76","observation_id":"801486c9-2bc7-4312-845a-bd11e17f897f","resolution":{"observed_at":"2026-08-07T10:18:50.628216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T10:19:28.765296Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.05891","last_updated":"2025-06-06T08:59:13Z","snapshot_observed_at":"2026-08-13T13:17:28.435594Z","submitted_at":"2025-06-06T08:59:13Z","title":"WAKE: Watermarking Audio with Key Enrichment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:28.765296Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.05891"},"observation_digest":"sha256:6a10c2af6cfd6560586642efade295644d86d64e76705809ac2b707973ee1792","observation_id":"b37e89de-19da-4527-81ff-4772d24a45b4","resolution":{"observed_at":"2026-08-07T10:19:28.765296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T05:37:55.440956Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07510","last_updated":"2025-06-09T07:37:50Z","snapshot_observed_at":"2026-08-10T19:43:50.323462Z","submitted_at":"2025-06-09T07:37:50Z","title":"DeRAGEC: Denoising Named Entity Candidates with Synthetic Rationale for ASR Error Correction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:55.440956Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.07510"},"observation_digest":"sha256:f22a42e43bf710a6bf007f035866035af41c103c774213e927bf26e735f0118f","observation_id":"1c04a5d4-acfa-4ff3-9d3a-f6b83235485a","resolution":{"observed_at":"2026-08-07T05:37:55.440956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T05:35:13.879732Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.07659","last_updated":"2025-06-09T11:31:24Z","snapshot_observed_at":"2026-08-10T04:57:01.985023Z","submitted_at":"2025-06-09T11:31:24Z","title":"Unified Semi-Supervised Pipeline for Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:13.879732Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.07659"},"observation_digest":"sha256:dbf4cf12db8a692074cbcfa156d89e34794cfecdf383ca3a24cb9b7db10edc99","observation_id":"68cb72eb-e85f-4ef2-beb9-ec13ed9b7923","resolution":{"observed_at":"2026-08-07T05:35:13.879732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T05:32:39.891475Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.07722","last_updated":"2025-06-12T15:11:52Z","snapshot_observed_at":"2026-08-07T05:24:50.909104Z","submitted_at":"2025-06-09T13:05:03Z","title":"Towards a Unified Benchmark for Arabic Pronunciation Assessment: Quranic Recitation as Case Study","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:32:39.891475Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.07722"},"observation_digest":"sha256:eeb15b351e12d6fdf499c16d2a31285472d97b0935878c2cc750575a4a92e4ec","observation_id":"106a614b-fb86-4a1a-8522-122a8f3ffcd0","resolution":{"observed_at":"2026-08-07T05:32:39.891475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2506.17185","last_updated":"2026-04-06T21:18:48Z","snapshot_observed_at":"2026-07-06T21:45:20.732169Z","submitted_at":"2025-06-20T17:40:05Z","title":"A Common Pool of Privacy Problems: Legal and Technical Lessons from a Large-Scale Web-Scraped Machine Learning Dataset","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T08:18:48.936867Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.17185"},"observation_digest":"sha256:e989da5901849f328831d4973363f28c46e3d1f932d33c4fa9c5d171af78a38f","observation_id":"2962894f-7c94-4b4a-a343-4ee1a5ee70f1","resolution":{"observed_at":"2026-05-19T08:22:11.038788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T23:14:37.444832Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19187","last_updated":"2025-06-23T23:22:11Z","snapshot_observed_at":"2026-08-08T05:07:37.542566Z","submitted_at":"2025-06-23T23:22:11Z","title":"Prompt, Translate, Fine-Tune, Re-Initialize, or Instruction-Tune? Adapting LLMs for In-Context Learning in Low-Resource Languages","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:14:37.444832Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.19187"},"observation_digest":"sha256:b45fce6c99abde568b80647efc11a937fa853958119ff780df0428861a60c6c7","observation_id":"076ba73f-35e0-40f5-b804-1de34f299adb","resolution":{"observed_at":"2026-08-06T23:14:37.444832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T22:18:11.785431Z","title":"Ardila, M","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.21990","last_updated":"2025-06-27T07:57:13Z","snapshot_observed_at":"2026-08-13T13:18:08.227597Z","submitted_at":"2025-06-27T07:57:13Z","title":"Analyzing and Fine-Tuning Whisper Models for Multilingual Pilot Speech Transcription in the Cockpit","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:11.785431Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.21990"},"observation_digest":"sha256:d6c1019823e2dee2a4929e850d2426b41b3b5e2acc997b6fa41283497f09bbfa","observation_id":"8ccdeccb-30cc-4b4d-8ca3-85e4de1a9633","resolution":{"observed_at":"2026-08-06T22:18:11.785431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T19:44:26.890986Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.04738","last_updated":"2025-07-07T08:10:26Z","snapshot_observed_at":"2026-08-11T12:48:44.793620Z","submitted_at":"2025-07-07T08:10:26Z","title":"Word stress in self-supervised speech models: A cross-linguistic comparison","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:26.890986Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.04738"},"observation_digest":"sha256:ec85a64e91b707e20dc9682a7dfee2f9fa1de8f917d5cb0ba6bc91e7ebdfe5a3","observation_id":"f262486c-a9d8-4205-a021-39119f2fe0fb","resolution":{"observed_at":"2026-08-06T19:44:26.890986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T18:33:16.667135Z","title":"Common V oice: A Massively-Multilingual Speech Corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.07877","last_updated":"2025-08-01T20:13:43Z","snapshot_observed_at":"2026-08-10T06:56:37.390961Z","submitted_at":"2025-07-10T16:00:27Z","title":"Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:16.667135Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.07877"},"observation_digest":"sha256:aee361344594a6abd2f48d8ca8e92d09885283b857192de731c18f9677c90888","observation_id":"6bc46688-aa9c-4cc9-8319-b95a644da6ff","resolution":{"observed_at":"2026-08-06T18:33:16.667135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T18:23:32.006992Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.08477","last_updated":"2025-07-11T10:38:51Z","snapshot_observed_at":"2026-08-08T07:08:51.038442Z","submitted_at":"2025-07-11T10:38:51Z","title":"ILT-Iterative LoRA Training through Focus-Feedback-Fix for Multilingual Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:23:32.006992Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.08477"},"observation_digest":"sha256:3d92bf9a8f80151730c07ec7780e33db70396a3fd9d34a0c498d7affef3de51a","observation_id":"6e892657-92d8-449e-a339-711e1027ca6e","resolution":{"observed_at":"2026-08-06T18:23:32.006992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T15:48:22.974182Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.974182Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:26ee2cfd8b5b3bef5a0d3f5cf7c4be3cc4b8331230a7e1894176c530b38ea605","observation_id":"1c8bd800-123e-4fda-8558-b0dd1ccf24ed","resolution":{"observed_at":"2026-08-06T15:48:22.974182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T15:17:30.385565Z","title":"M.; and Weber, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16247","last_updated":"2025-07-22T05:39:39Z","snapshot_observed_at":"2026-08-13T17:38:49.526559Z","submitted_at":"2025-07-22T05:39:39Z","title":"PRAC3 (Privacy, Reputation, Accountability, Consent, Credit, Compensation): Long Tailed Risks of Voice Actors in AI Data-Economy","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:30.385565Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.16247"},"observation_digest":"sha256:2db517d4520945e3572d39fdb05f711e5833a9723cb215ec6bd088c8637c520d","observation_id":"a56c7731-77f3-4b30-bc4d-519e45c14942","resolution":{"observed_at":"2026-08-06T15:17:30.385565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T15:14:29.110045Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.110045Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:88a047ccf1403d5e3f5db5961e0849797414f92853fdfd37653afb951857c965","observation_id":"a231c882-4e11-4c31-b255-050eb910fe15","resolution":{"observed_at":"2026-08-06T15:14:29.110045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T14:43:35.064625Z","title":"Ardila, M","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.21150","last_updated":"2025-07-23T21:16:08Z","snapshot_observed_at":"2026-08-09T18:01:51.954472Z","submitted_at":"2025-07-23T21:16:08Z","title":"WaveVerify: A Novel Audio Watermarking Framework for Media Authentication and Combatting Deepfakes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:35.064625Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.21150"},"observation_digest":"sha256:906e41b4d0ba3ff8cab7da400e5698a0b40ef607c3d8c57d0fd36fc3f0fc755b","observation_id":"8dc625b3-666a-4a08-9606-f8e326765323","resolution":{"observed_at":"2026-08-06T14:43:35.064625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T12:49:16.109262Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-10T15:09:41.229385Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:16.109262Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:91f4fa43bc32f1cc002d490a069a95af2198ee8ced5fb64a6bffc34d5e84b757","observation_id":"c9987e9c-dc00-46ec-9860-5cfaef5566e5","resolution":{"observed_at":"2026-08-06T12:49:16.109262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T22:52:07.674548Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06277","last_updated":"2025-08-08T12:54:09Z","snapshot_observed_at":"2026-08-09T17:01:49.896362Z","submitted_at":"2025-08-08T12:54:09Z","title":"Large Language Model Data Generation for Enhanced Intent Recognition in German Speech","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:07.674548Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.06277"},"observation_digest":"sha256:edadd168978fa15949966ceba6123c6b5025a4f2a03475e77414d97a9f45f304","observation_id":"a6762119-6952-44d1-ab89-8349a4d19939","resolution":{"observed_at":"2026-08-05T22:52:07.674548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2508.07285","last_updated":"2026-05-19T14:44:40Z","snapshot_observed_at":"2026-08-05T00:29:45.624756Z","submitted_at":"2025-08-10T10:46:14Z","title":"Non-Intrusive Automatic Speech Recognition Refinement: A Survey","version":3},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-21T23:34:52.249143Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.07285"},"observation_digest":"sha256:7efea7076a3c6bb70cde6bab71d4f05e55a987b2eaaffa1635a72c538afdf078","observation_id":"e7584f03-f959-4394-9e4f-b1583112fd27","resolution":{"observed_at":"2026-05-21T23:35:45.863198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T20:01:03.616409Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.14916","last_updated":"2025-08-15T10:39:05Z","snapshot_observed_at":"2026-08-13T00:10:18.689686Z","submitted_at":"2025-08-15T10:39:05Z","title":"Transsion Multilingual Speech Recognition System for MLC-SLM 2025 Challenge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:01:03.616409Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.14916"},"observation_digest":"sha256:044f91fafabfeff983a7b90da1cbfceb47997ea744a7330802d3242b3156661d","observation_id":"fe1ca944-0ce8-466f-ad70-fe641d73ffa2","resolution":{"observed_at":"2026-08-05T20:01:03.616409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T17:56:49.739464Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:49.739464Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:5007bddd59529146373bda6accedf2e46bde161d7ae96c6bdc84395844a8ebbc","observation_id":"422dde6d-0940-4250-a76b-d943a18ec09d","resolution":{"observed_at":"2026-08-05T17:56:49.739464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T14:22:33.923565Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-12T19:52:34.417656Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.923565Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:376a819fae59ee3123cb6966194df8764259d99d25e8160c16502ac8be9a5bc2","observation_id":"a2426604-3b6c-4168-a590-8cb736b79234","resolution":{"observed_at":"2026-08-05T14:22:33.923565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T12:37:05.779244Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.01419","last_updated":"2025-09-01T12:21:46Z","snapshot_observed_at":"2026-08-11T19:35:27.568562Z","submitted_at":"2025-09-01T12:21:46Z","title":"Characterization of Speech Similarity Between Australian Aboriginal and High-Resource Languages: A Case Study on Dharawal","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:05.779244Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2509.01419"},"observation_digest":"sha256:c7ea7507bea0abc8dbfd8c2c2d37ccc1660334c8fe35d10d9785a0ed58e3f398","observation_id":"ae85fb1a-5d31-4372-9235-8e5873baa5fc","resolution":{"observed_at":"2026-08-05T12:37:05.779244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T12:07:21.418220Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.01939","last_updated":"2025-09-02T04:20:12Z","snapshot_observed_at":"2026-08-07T18:39:10.295579Z","submitted_at":"2025-09-02T04:20:12Z","title":"Group Relative Policy Optimization for Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:21.418220Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2509.01939"},"observation_digest":"sha256:440ab5caad0b1805f351e0dc9ccda3ae87041b96c2fef76f802ae686b37fd060","observation_id":"1eb22567-2f8d-49a6-ad62-29353a903ebe","resolution":{"observed_at":"2026-08-05T12:07:21.418220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T11:40:58.811779Z","title":"M.; and Weber, G","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-12T18:52:33.134462Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:40:58.811779Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:81c1e50a270bf4e9bce9c6b832c6f6eaf443593909c2af7024cb5ea4899f85a0","observation_id":"ea11c561-6f19-4e29-8379-56498d8eca7d","resolution":{"observed_at":"2026-08-05T11:40:58.811779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T06:01:28.511141Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.04667","last_updated":"2025-09-04T21:30:25Z","snapshot_observed_at":"2026-08-12T17:04:05.742374Z","submitted_at":"2025-09-04T21:30:25Z","title":"DarkStream: real-time speech anonymization with low latency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T06:01:28.511141Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2509.04667"},"observation_digest":"sha256:4fd5bfa2e558ea9c537b175d0a255788aab509f7069e7b48e0fdde85b47076b4","observation_id":"dcb45fbf-76b2-4b23-9282-7c5e7b5d1de8","resolution":{"observed_at":"2026-08-05T06:01:28.511141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:08fde0d57fe7bc2d4a6e6accf112a6090a50b85783df900b69b7a3975131abe4","observation_id":"b032847c-892e-4e51-8698-b22636ca72b7","resolution":{"observed_at":"2026-05-18T13:01:24.413278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-04T10:17:43.634745Z","title":"Common voice: A massively-multilingual speech corpus, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-10T13:05:13.167836Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.634745Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:9acd87950e408cff504bc5196ab4db2fd7efcf870d8b79dc2bb5932d82802856","observation_id":"45a4395a-97e2-4646-939d-8f26357d7598","resolution":{"observed_at":"2026-08-04T10:17:43.634745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-03T21:06:07.490691Z","title":"Common voice: A massively-multilingual speech corpus.arXiv preprint arXiv:1912.06670,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-07T10:03:17.767830Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.490691Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:da6f22005eb3ccd6bcf1347bc25146a06d1c940c5e33fc3fdb7c38cf67df833c","observation_id":"d6b5de18-f890-4206-93bc-4bd68033e922","resolution":{"observed_at":"2026-08-03T21:06:07.490691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:26fbe5ef5caaf9ffbdc2b6b5ddf4c94177665cba6077df16099d7e14397fe2ef","observation_id":"7d369fb6-a3c9-4bf7-8fdd-983a32285256","resolution":{"observed_at":"2026-05-21T18:20:29.243328Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-03T12:01:59.035213Z","title":"M., and Weber, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-06T01:59:30.134013Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T12:01:59.035213Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:af0a4b1f6a093804292b6053c40b73149ac4fd5bd00b604a4e87e26962b627ea","observation_id":"7f940f57-c615-4b29-971a-b7a253b8a8ee","resolution":{"observed_at":"2026-08-03T12:01:59.035213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-03T04:48:05.360003Z","title":"Ardila, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.04101","last_updated":"2026-06-02T20:12:27Z","snapshot_observed_at":"2026-08-07T19:23:29.832952Z","submitted_at":"2026-02-04T00:36:37Z","title":"Interfaze: The Future of AI is built on Task-Specific Small Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T04:48:05.360003Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2602.04101"},"observation_digest":"sha256:97fb459e1b231ab6c26376b0ec1635d56787f101cbe6fe666dcbedb8f87d3813","observation_id":"63171c25-1032-49cb-b3f3-1a3814d33a8f","resolution":{"observed_at":"2026-08-03T04:48:05.360003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-15T00:03:31.986628Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2603.09725","last_updated":"2026-07-09T13:30:49Z","snapshot_observed_at":"2026-08-13T07:19:50.647086Z","submitted_at":"2026-03-10T14:32:12Z","title":"A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T00:03:31.986628Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2603.09725"},"observation_digest":"sha256:49de6340464c07dda34bcb4dc0d242aedb20e1b3cfa0defe6cf2c8c3b2271e02","observation_id":"5524b788-b888-421a-b675-65cc93c9bf0e","resolution":{"observed_at":"2026-07-15T00:03:31.986628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2603.14222","last_updated":"2026-04-22T04:03:14Z","snapshot_observed_at":"2026-08-11T04:07:37.581708Z","submitted_at":"2026-03-15T04:53:39Z","title":"Membership Inference for Contrastive Pre-training Models with Text-only PII Queries","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T12:09:32.204944Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2603.14222"},"observation_digest":"sha256:7c1911a97960ef06cf39e367beeb3f0942006140727b7ab93c4214c8850ca41b","observation_id":"7de6052c-8007-4a3a-ab65-7e072c95854e","resolution":{"observed_at":"2026-05-15T12:09:59.551459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2603.29087","last_updated":"2026-04-03T23:02:46Z","snapshot_observed_at":"2026-08-06T08:55:59.472116Z","submitted_at":"2026-03-31T00:05:07Z","title":"IQRA 2026: Interspeech Challenge on Automatic Pronunciation Assessment for Modern Standard Arabic (MSA)","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T00:15:10.797922Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2603.29087"},"observation_digest":"sha256:706d7231a4b4d72d904c36718653c8142767af2395ad67a013ad2dc4073fe18f","observation_id":"9e4644c7-a385-4738-a293-765d5fa09f60","resolution":{"observed_at":"2026-05-14T00:18:30.051019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2604.10736","last_updated":"2026-04-16T21:22:01Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:17:54Z","title":"BlasBench: An Open Benchmark for Irish Speech Recognition","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T15:53:54.092426Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2604.10736"},"observation_digest":"sha256:1318148e452eb8e0244ccf8d99bfda3df06e99c122fa527126f772051afcd3ad","observation_id":"10bc4ec0-7b9e-4e25-b5cc-045f77a37c64","resolution":{"observed_at":"2026-05-11T09:41:01.711718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2604.14186","last_updated":"2026-03-31T16:56:33Z","snapshot_observed_at":"2026-08-13T17:28:02.507712Z","submitted_at":"2026-03-31T16:56:33Z","title":"HARNESS: Lightweight Distilled Arabic Speech Foundation Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T02:17:14.045133Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2604.14186"},"observation_digest":"sha256:6932dfb5198dbc5c33519855d240a9386ebd855475164a27c8ac70ab77ac9777","observation_id":"1b71ebac-e480-422c-a3f4-c5c1c6a696fc","resolution":{"observed_at":"2026-05-11T22:56:14.209808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2604.22817","last_updated":"2026-04-14T20:56:24Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-14T20:56:24Z","title":"In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:50.524448Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2604.22817"},"observation_digest":"sha256:538fbc192adb1ce5f938aedc19513073cf2b0996e10c22bc2538ca6c688d33b1","observation_id":"522f620e-e0e9-4be2-b730-883459543836","resolution":{"observed_at":"2026-05-10T13:35:26.720991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2604.24770","last_updated":"2026-04-15T12:56:11Z","snapshot_observed_at":"2026-08-13T20:22:02.019910Z","submitted_at":"2026-04-15T12:56:11Z","title":"Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:59:47.796221Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2604.24770"},"observation_digest":"sha256:0ec71a800b91ec3ce565cbaa0f91dc23481325f0d2b3519909599f933ae5b0c6","observation_id":"dcb5a8e6-1466-41e5-8cd7-eec2813cb4b3","resolution":{"observed_at":"2026-05-10T14:00:27.996529Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2605.01224","last_updated":"2026-07-18T21:59:47Z","snapshot_observed_at":"2026-08-12T17:48:12.602569Z","submitted_at":"2026-05-02T03:39:12Z","title":"Lost in the Tower of Babel: The Adverse Effects of Incidental Multilingualism in LLMs","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-09T15:17:58.020698Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2605.01224"},"observation_digest":"sha256:784f552a80d4480f891b9efe629529ebe450363fc5bd7d799177fdbafbe4529c","observation_id":"f136c8b9-50e0-49a3-9d51-62b02c8a5089","resolution":{"observed_at":"2026-05-11T16:41:23.375304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2605.02928","last_updated":"2026-04-26T21:11:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-26T21:11:29Z","title":"Keyword spotting using convolutional neural network for speech recognition in Hindi","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T20:06:30.395199Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2605.02928"},"observation_digest":"sha256:d4b93c4a1c861461a55f3f8abce469a3f88cef362a696d30a440e38158c258e9","observation_id":"872903ab-40f3-421c-b4df-b32d44ece1d0","resolution":{"observed_at":"2026-05-11T15:26:05.900745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2605.15984","last_updated":"2026-05-15T14:17:19Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:17:19Z","title":"Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-19T18:36:34.351533Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2605.15984"},"observation_digest":"sha256:b4ae73548345c5f17855cbc782a202bdaf5a64dc4ee405efc877af2dbe5dd643","observation_id":"fc5c1070-dd68-4004-8cd4-c0fb07e20c0d","resolution":{"observed_at":"2026-05-19T18:37:42.805412Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2605.30107","last_updated":"2026-05-28T15:47:09Z","snapshot_observed_at":"2026-08-08T05:23:47.667022Z","submitted_at":"2026-05-28T15:47:09Z","title":"Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:55:17.832799Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2605.30107"},"observation_digest":"sha256:15b678c6e92cdb07cf56d6fdefc84a9fe92c5f84c79af70c0fbd51c53d9364b7","observation_id":"78f7ef53-1272-47b8-8317-1d3307895569","resolution":{"observed_at":"2026-06-29T08:03:14.633064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2606.21408","last_updated":"2026-06-19T13:20:16Z","snapshot_observed_at":"2026-08-05T01:38:43.388624Z","submitted_at":"2026-06-19T13:20:16Z","title":"Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T13:07:37.187581Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2606.21408"},"observation_digest":"sha256:397cb218efd7a4d9822df98758302cf8c75140a6abba3970695f13d65e6c2c46","observation_id":"6f04cc74-060f-4da5-ad2e-dc517202f40d","resolution":{"observed_at":"2026-07-04T07:39:39.270772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2606.22022","last_updated":"2026-06-20T12:52:25Z","snapshot_observed_at":"2026-08-02T08:21:57.046600Z","submitted_at":"2026-06-20T12:52:25Z","title":"Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T11:43:27.916617Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2606.22022"},"observation_digest":"sha256:5a545eba1baccdf552bc6b2b9f456b5e6c299a7b133a67a54189d83e9077ba03","observation_id":"f6011e6e-ed6b-4391-8251-7d67b61172d2","resolution":{"observed_at":"2026-07-04T08:29:41.251618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2606.22310","last_updated":"2026-06-21T02:35:22Z","snapshot_observed_at":"2026-08-08T09:00:50.074313Z","submitted_at":"2026-06-21T02:35:22Z","title":"Learning to Evade: Adaptive Attacks on Audio Watermarking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T10:10:18.351233Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2606.22310"},"observation_digest":"sha256:4f6263e755073498ded52526e21a628eba8bedce57686bd2f03442c7dbc08c8f","observation_id":"ab8dc48c-42bd-4bf8-b2af-870fa22a983d","resolution":{"observed_at":"2026-07-04T09:19:43.958897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:d037c238599b04655fc4d429ae2550459be0164aca6c0c22d3bfa7c913548a34","observation_id":"7047bc05-c243-4be1-81a6-650780d4da94","resolution":{"observed_at":"2026-07-01T11:45:47.265773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2607.05276","last_updated":"2026-07-06T16:21:34Z","snapshot_observed_at":"2026-08-02T01:15:17.727303Z","submitted_at":"2026-07-06T16:21:34Z","title":"ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-07T20:30:53.546267Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.05276"},"observation_digest":"sha256:081cd9845d2fc3509bc721672298437ff0336c79828afcc8c9bf0881b354a13b","observation_id":"1a6a08bd-188d-432f-b825-39d22a18e583","resolution":{"observed_at":"2026-07-07T20:34:09.719817Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":"1912.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-07T20:34:09.715401Z","title":"Sorokin, and et al","venue":"cs.CL","work_id":"2215ac34-dbe8-4874-8438-39b788ed0cae","year":2019},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-12T21:08:57.332743Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-07T14:52:35.127533Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:4f8164a83789c3ea92b5b5c25e90093cdfe2e1b93e2891a6897818ffec24548c","observation_id":"c790d5c2-fdba-44e9-a9d2-a68a4f1238c0","resolution":{"observed_at":"2026-07-07T14:53:55.894823Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-02T08:34:02.641142Z","title":"Com- mon V oice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-12T21:08:57.332743Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:34:02.641142Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:f4590976b329fd3ee47a776d69b0c388a8cd2b680c8e370e0b58084bd183beac","observation_id":"b3cbbfa1-9c6c-4a0a-ac99-8ca4a6c40ae0","resolution":{"observed_at":"2026-08-02T08:34:02.641142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-01T18:53:37.320627Z","title":", author Branson, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17164","last_updated":"2026-07-19T09:54:52Z","snapshot_observed_at":"2026-08-07T23:52:05.612809Z","submitted_at":"2026-07-19T09:54:52Z","title":"Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T18:53:37.320627Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.17164"},"observation_digest":"sha256:448c1be32810121f7bd4ddc2660ea58abb616372f2b261e01c61d3aecae0028d","observation_id":"e4380b62-0936-4e47-82a3-4bb94c3e055c","resolution":{"observed_at":"2026-08-01T18:53:37.320627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-01T11:43:06.600447Z","title":"arXiv preprint arXiv:1912.06670 , year=","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.19810","last_updated":"2026-07-22T06:42:20Z","snapshot_observed_at":"2026-08-07T23:49:52.327639Z","submitted_at":"2026-07-22T06:42:20Z","title":"SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision","version":1},"reference_index":185,"source":"arxiv_source","source_observed_at":"2026-08-01T11:43:06.600447Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.19810"},"observation_digest":"sha256:a98cbbadab42281e1bb74776a43414c291b6475c367e8e5ab06b85559ad8db90","observation_id":"95199efc-9c44-46ac-830e-f2c320f21ca5","resolution":{"observed_at":"2026-08-01T11:43:06.600447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-07-31T23:35:25.843132Z","title":"Common voice: A massively-multilingual speech corpus.arXiv preprint arXiv:1912.06670, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.23938","last_updated":"2026-07-27T02:30:15Z","snapshot_observed_at":"2026-08-13T03:00:03.090581Z","submitted_at":"2026-07-27T02:30:15Z","title":"Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:35:25.843132Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.23938"},"observation_digest":"sha256:716547addfd6f447595677fd7064b9eb17b5cccad6d6de44b42d8bc24549e299","observation_id":"ecd4ba63-4d6f-4dcf-9137-29f26b6533f3","resolution":{"observed_at":"2026-07-31T23:35:25.843132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-01T15:10:14.178271Z","title":"arXiv preprint arXiv:1912.06670 , year =","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.26472","last_updated":"2026-07-29T04:55:14Z","snapshot_observed_at":"2026-08-07T17:49:05.797860Z","submitted_at":"2026-07-29T04:55:14Z","title":"Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T15:10:14.178271Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.26472"},"observation_digest":"sha256:6eee532f68444d32144bb3ded9798f28bb313d95ca3b3c8bbb52acac8955e17a","observation_id":"0e9e35a7-7d5f-4727-a126-579c37965c3c","resolution":{"observed_at":"2026-08-01T15:10:14.178271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-03T09:46:27.897409Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.29299","last_updated":"2026-07-31T11:15:22Z","snapshot_observed_at":"2026-08-13T13:40:09.020344Z","submitted_at":"2026-07-31T11:15:22Z","title":"Leveraging Beam Search Information for Confidence Estimation in E2E ASR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:46:27.897409Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2607.29299"},"observation_digest":"sha256:46127f9bce5e5d89dc9b1971c7cebf060794f30a21e2e2453e2d10e27a8afe48","observation_id":"3476e971-3e6f-40ba-8731-b3c333b0d9d3","resolution":{"observed_at":"2026-08-03T09:46:27.897409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1912.06670/citation-record","integrity":"/paper/1912.06670/integrity","json":"/paper/1912.06670/citation-record.json","paper":"/paper/1912.06670"},"outbound":[],"paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 98 inbound Pith citation observations for arXiv:1912.06670."}