{"as_of":"2026-08-09T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7fa918bf5eae8c930edf88f89772bdce20d72aae14d8b12d8f4e6d784698c31","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":52,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:54:18.845300Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":112,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:72d85175ba5d09c5ba338dfe5f51a0327c7d8353d25f4ec410dcb2e64aa46d6b","observation_id":"6ac8d2d5-b915-4ac9-bc4a-e8f79f515d34","resolution":{"observed_at":"2026-05-16T07:07:57.909447Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-24T05:00:28.453838Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2312.11805"},"observation_digest":"sha256:e11c5e663064e3d01eb84855ce965022d9943d5168a25a784b469fa1d4db3fa3","observation_id":"53ccf5ab-dffe-411b-b761-9485a447d772","resolution":{"observed_at":"2026-05-24T05:03:55.455193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-12T08:13:21.962488Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2410.00037"},"observation_digest":"sha256:4f31413047deb721c6e66e03372aa579dae05b679dc08cc94d8e361b4b2eb8b9","observation_id":"85311310-be97-4427-974d-8a767e1eb694","resolution":{"observed_at":"2026-05-12T08:13:22.185653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2501.05465","last_updated":"2026-05-14T16:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T19:53:57Z","title":"Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-23T05:47:48.488826Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2501.05465"},"observation_digest":"sha256:addcf7a6e8a349f45c4d61eabf2fd6731569abbdd82ae9c3b32aed544d3b80be","observation_id":"541e5b64-f4bd-4067-85eb-02487c24564f","resolution":{"observed_at":"2026-05-23T05:52:37.677273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-09T05:54:18.845300Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.845300Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:817b78c6b2ec81a03be5a777dccb95b267cbae1149403d20b33deb6d57542db5","observation_id":"9f16420d-e4da-4bed-9af3-3f740a5cdd4b","resolution":{"observed_at":"2026-08-09T05:54:18.845300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T18:32:15.157420Z","title":"Google USM : Scaling automatic speech recognition beyond 100 languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10373","last_updated":"2025-02-14T18:51:40Z","snapshot_observed_at":"2026-08-07T18:16:58.485531Z","submitted_at":"2025-02-14T18:51:40Z","title":"OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:15.157420Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2502.10373"},"observation_digest":"sha256:1a39d9fc90aba713ea940794d307e7a7e3352af8f6175334529b8d0af3378f17","observation_id":"b00cafe7-f8bd-45a9-a2a9-ceaa16be63be","resolution":{"observed_at":"2026-08-07T18:32:15.157420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:477c93bd80774d9a6f46f8be634a2b094053b91c2624ec52649454a566f69c17","observation_id":"16597fcf-abb6-4a3c-bea0-5a3f9a1145e4","resolution":{"observed_at":"2026-05-22T20:45:08.124653Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:76570da9e513bee56c0f8068028b3ce67b9ac24a1f5ef479dcf971994811d4e7","observation_id":"a431a375-596e-4089-90d1-1ab2db9ec0e3","resolution":{"observed_at":"2026-05-11T19:21:27.168360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T15:39:29.177686Z","title":"Google usm: Scaling automatic speech recog- nition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-07T15:34:08.821122Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:29.177686Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:16cee5ff53e0b0e2df0940bde39b448591bcb20fa4ff406e7773111e3a2e4430","observation_id":"48b325f5-22a0-4758-bcab-bcf4935c0bb3","resolution":{"observed_at":"2026-08-07T15:39:29.177686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T15:10:49.929741Z","title":"Google usm: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16168","last_updated":"2025-05-22T03:13:40Z","snapshot_observed_at":"2026-08-07T15:03:54.031224Z","submitted_at":"2025-05-22T03:13:40Z","title":"Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:49.929741Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.16168"},"observation_digest":"sha256:b325a79c74c404c6b5d30e2106cab7d2157de18020ee2400b79d68a529b45739","observation_id":"ec704d4a-f35c-42d3-87e9-b3517eb435d4","resolution":{"observed_at":"2026-08-07T15:10:49.929741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T14:12:47.058460Z","title":"Available: https://arxiv.org/abs/2303.01037","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.058460Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:4831120a69a717e1a57c29fa6442928d45e1bb1eb9625e81552ce6bb1f0b91e9","observation_id":"1a5185df-5743-4224-b270-77f4de0e01cf","resolution":{"observed_at":"2026-08-07T14:12:47.058460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T13:45:15.871141Z","title":"Google usm: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-07T13:32:13.575214Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.871141Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:b4c2eb081c3e367bf95635a52845570a5bfd1cdd545b566a9a319f883a67f127","observation_id":"5aa3de75-d092-4a8b-b414-25c96d26b77d","resolution":{"observed_at":"2026-08-07T13:45:15.871141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T14:40:56.281578Z","title":"Google USM: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-07T14:35:24.196716Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.281578Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:534dc9f6b29f531d793c291ca9ab7b328dd562df5afd1cc1113c00ec31079ab3","observation_id":"5adc19bc-4bbb-4c92-a428-b302d83d4cb9","resolution":{"observed_at":"2026-08-07T14:40:56.281578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T12:52:39.598918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23420","last_updated":"2025-05-29T13:10:57Z","snapshot_observed_at":"2026-08-07T12:43:55.763562Z","submitted_at":"2025-05-29T13:10:57Z","title":"The Warmup Dilemma: How Learning Rate Strategies Impact Speech-to-Text Model Convergence","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:52:39.598918Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.23420"},"observation_digest":"sha256:42c22beda66e55a4df4ac0aec9f38c57cb7a4bdac825c2b0c0356cc5b4312539","observation_id":"a3224f44-2c51-44de-a819-e6ea0a11d0d2","resolution":{"observed_at":"2026-08-07T12:52:39.598918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T12:12:17.790407Z","title":"Google USM: Scal- ing automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.790407Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:c045e3e5e47d6e1cd18ef1341b31a97ab9443eb40cf809774a0f5399efedfce0","observation_id":"a49829e8-8114-4c2a-b598-09edd3f5f677","resolution":{"observed_at":"2026-08-07T12:12:17.790407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T11:58:42.528594Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.528594Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:956df1cd2e460b4c38fc01d87acfbc5cf017557100a6e4d77176f536df9dfecb","observation_id":"f1ef71db-56d8-4cd7-bc49-777c03c8b47a","resolution":{"observed_at":"2026-08-07T11:58:42.528594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T11:55:10.553872Z","title":"Available: https://arxiv.org/abs/2303.01037","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01192","last_updated":"2025-06-01T22:03:40Z","snapshot_observed_at":"2026-08-07T11:48:05.057966Z","submitted_at":"2025-06-01T22:03:40Z","title":"GigaAM: Efficient Self-Supervised Learner for Speech Recognition","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:10.553872Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.01192"},"observation_digest":"sha256:b1f173ae47504d105d4413cbd5213455c54dc5c71118dbda275708cddc955129","observation_id":"43890719-de93-4fd0-bea7-7fb8e72d6b50","resolution":{"observed_at":"2026-08-07T11:55:10.553872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T04:53:57.801970Z","title":"Google USM: Scaling automatic speech recognition beyond 100 lan- guages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09448","last_updated":"2025-06-11T06:53:40Z","snapshot_observed_at":"2026-08-07T19:22:57.303552Z","submitted_at":"2025-06-11T06:53:40Z","title":"OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:57.801970Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.09448"},"observation_digest":"sha256:34902a2be6da8ebc4bcd221b4c7e7f1ea0fe3c9d59bf4cfad2fbd645ebf39882","observation_id":"4f187dca-064d-4cd8-ab66-bb2d60499661","resolution":{"observed_at":"2026-08-07T04:53:57.801970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T05:02:43.054744Z","title":"Usm: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11130","last_updated":"2025-06-16T15:47:41Z","snapshot_observed_at":"2026-08-07T04:54:43.738701Z","submitted_at":"2025-06-10T17:30:32Z","title":"A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:43.054744Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.11130"},"observation_digest":"sha256:d64094b9dc2def8bed10836051991690932304bff22bae7fc8696cb45f872c5e","observation_id":"15f02759-05b4-497e-9bda-c790d208db1e","resolution":{"observed_at":"2026-08-07T05:02:43.054744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T23:50:40.931247Z","title":"Google USM : Scaling automatic speech recognition beyond 100 languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15912","last_updated":"2025-06-18T23:16:02Z","snapshot_observed_at":"2026-08-08T04:51:37.440732Z","submitted_at":"2025-06-18T23:16:02Z","title":"Early Attentive Sparsification Accelerates Neural Speech Transcription","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:50:40.931247Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.15912"},"observation_digest":"sha256:f91feaed7b7f54a6c77fc221de722793185cd0e725184c63fa40db8044f3f276","observation_id":"95397d90-3010-4bef-8bdb-cc5a507f6417","resolution":{"observed_at":"2026-08-06T23:50:40.931247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T23:34:54.366652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17525","last_updated":"2025-06-27T18:38:01Z","snapshot_observed_at":"2026-08-08T04:12:41.309353Z","submitted_at":"2025-06-21T00:34:18Z","title":"Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language Planning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T23:34:54.366652Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.17525"},"observation_digest":"sha256:5ce5b35737dad2fa1ae1d39f8dbf7973a3fc106fa37144530f74ea080034f93d","observation_id":"518fa8b1-c762-4f4b-b67a-bab509c1639b","resolution":{"observed_at":"2026-08-06T23:34:54.366652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T04:53:12.980349Z","title":"Google USM: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21555","last_updated":"2025-06-11T07:06:27Z","snapshot_observed_at":"2026-08-07T04:45:31.139952Z","submitted_at":"2025-06-11T07:06:27Z","title":"Efficient Multilingual ASR Finetuning via LoRA Language Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:12.980349Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.21555"},"observation_digest":"sha256:005677ccb8c0c95f2911d6a929067bd9cdc6838bbf85ac7f2d83d789fd3487b7","observation_id":"4fb310f8-f465-4fad-a2e9-64901f495397","resolution":{"observed_at":"2026-08-07T04:53:12.980349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T22:02:27.761816Z","title":"Google usm: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22810","last_updated":"2025-06-28T08:24:15Z","snapshot_observed_at":"2026-08-07T11:27:48.056037Z","submitted_at":"2025-06-28T08:24:15Z","title":"A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:02:27.761816Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.22810"},"observation_digest":"sha256:30661d6f5b69b136c652f4bab39a732d3738e644f8dd2ab4da885f0849561929","observation_id":"08cdef0c-3e3c-484e-ab24-2624ceee4be9","resolution":{"observed_at":"2026-08-06T22:02:27.761816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T21:19:28.630761Z","title":"Google USM: scaling automatic speech recogni- tion beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00534","last_updated":"2025-07-01T07:53:39Z","snapshot_observed_at":"2026-08-07T01:19:15.279279Z","submitted_at":"2025-07-01T07:53:39Z","title":"NIRANTAR: Continual Learning with New Languages and Domains on Real-world Speech Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:28.630761Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2507.00534"},"observation_digest":"sha256:6564074ca70176635a4a088c64c02025f31422f46842adafef436d20e24a2640","observation_id":"5762d61d-65b1-4767-ac42-aa0f67418fbd","resolution":{"observed_at":"2026-08-06T21:19:28.630761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T16:13:18.084243Z","title":"Google USM: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14129","last_updated":"2026-07-13T00:23:40Z","snapshot_observed_at":"2026-08-06T15:57:59.417863Z","submitted_at":"2025-07-18T17:57:46Z","title":"OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:13:18.084243Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2507.14129"},"observation_digest":"sha256:2b922cc53c6e81307474ad01abc25582f0445df6f1e962b73043595fea4ac58c","observation_id":"cb95bc1c-5fa2-47f9-a954-7e91f7579075","resolution":{"observed_at":"2026-08-06T16:13:18.084243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T10:41:18.090704Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23590","last_updated":"2025-07-31T14:26:57Z","snapshot_observed_at":"2026-08-08T07:42:56.467861Z","submitted_at":"2025-07-31T14:26:57Z","title":"Identifying Hearing Difficulty Moments in Conversational Audio","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:41:18.090704Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2507.23590"},"observation_digest":"sha256:92bdc376671f5870c7d3f6aa6c6fba566cb7814ca244b777c6d782510b77570f","observation_id":"e4edf93b-1b17-4d22-8e53-a22e7a2ede58","resolution":{"observed_at":"2026-08-06T10:41:18.090704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-06T01:10:15.649692Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03937","last_updated":"2025-08-13T18:58:04Z","snapshot_observed_at":"2026-08-06T01:10:15.255047Z","submitted_at":"2025-08-05T21:59:35Z","title":"LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T01:10:15.649692Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2508.03937"},"observation_digest":"sha256:6b70c7386b379eeaa3d6af9ead7b6a0cd37d2602d3c5ba9c0fbfc384e9d1206b","observation_id":"42b609ea-7c56-4341-b4fb-66f173c059f4","resolution":{"observed_at":"2026-08-06T01:10:15.649692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T17:06:13.310210Z","title":"Google USM: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17148","last_updated":"2025-08-23T21:49:27Z","snapshot_observed_at":"2026-08-08T10:14:27.572675Z","submitted_at":"2025-08-23T21:49:27Z","title":"Geolocation-Aware Robust Spoken Language Identification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:06:13.310210Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2508.17148"},"observation_digest":"sha256:2cde7aec73645b4d1aee4a9507e4c7347f65d436edbe11567973c5dcb103e6b4","observation_id":"09c581e2-35bf-45f6-987c-1413ba893253","resolution":{"observed_at":"2026-08-05T17:06:13.310210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T15:39:21.275265Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19721","last_updated":"2025-08-27T09:30:43Z","snapshot_observed_at":"2026-08-06T18:41:16.320515Z","submitted_at":"2025-08-27T09:30:43Z","title":"CAM\\~OES: A Comprehensive Automatic Speech Recognition Benchmark for European Portuguese","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:39:21.275265Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2508.19721"},"observation_digest":"sha256:ec4258cc69b358822a4791654b1a662c4e63ed7d935081f331216dc3dba1ef24","observation_id":"320834ef-cbe0-4226-9681-7cc23b4bb6c9","resolution":{"observed_at":"2026-08-05T15:39:21.275265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T14:49:35.963931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-09T00:02:22.746063Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.963931Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:f0e2d3300fc6461ab98d45b01e4bb117f2f6c7dfa643c73a5e3316185c0b07f0","observation_id":"7c66f95f-54e2-4129-8f2b-fcf6e94d283b","resolution":{"observed_at":"2026-08-05T14:49:35.963931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T14:11:07.418384Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21631","last_updated":"2025-08-29T13:46:41Z","snapshot_observed_at":"2026-08-05T14:11:05.557512Z","submitted_at":"2025-08-29T13:46:41Z","title":"Towards Improved Speech Recognition through Optimized Synthetic Data Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T14:11:07.418384Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2508.21631"},"observation_digest":"sha256:e9b396717f0a565ad3acb0e13302dc74b724ebc6d03d297a3a4d4a5e33290ef4","observation_id":"1fddbe4f-57f1-4a2c-8618-9ce03aa9efe8","resolution":{"observed_at":"2026-08-05T14:11:07.418384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-04T11:29:37.769261Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:37.769261Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:1ccc24f8ab0dcf47c5936a69656c183679646e1563742e0d6050844ec4321365","observation_id":"5cd6c1fe-12f6-46d5-9058-6cbcc06f8e41","resolution":{"observed_at":"2026-08-04T11:29:37.769261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2510.24570","last_updated":"2026-01-21T15:13:17Z","snapshot_observed_at":"2026-08-08T23:54:06.551378Z","submitted_at":"2025-10-28T16:01:24Z","title":"BEST-RQ-Based Self-Supervised Learning for Whisper Domain Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T02:57:03.681175Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2510.24570"},"observation_digest":"sha256:36dad6a7a362aa705609f68e8bb8346d832e2cd94893027e8fb2aa5ec9863fc8","observation_id":"e296ebd2-d033-4311-9d0f-5337db128193","resolution":{"observed_at":"2026-05-18T03:00:48.629522Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2601.20896","last_updated":"2026-04-23T07:03:51Z","snapshot_observed_at":"2026-08-08T22:09:13.849749Z","submitted_at":"2026-01-28T08:56:11Z","title":"A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T10:17:15.726726Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2601.20896"},"observation_digest":"sha256:ee91c6d7a633298cd1aab5f8633f26e83aa2e958cd44961d5b16e8043240a9ea","observation_id":"d90a938c-6437-4c1b-a526-e633096ec97a","resolution":{"observed_at":"2026-05-16T10:17:43.819953Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-07-15T00:03:31.986628Z","title":"Google USM: Scaling Automatic Speech Recog- nition Beyond 100 Languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.09725","last_updated":"2026-07-09T13:30:49Z","snapshot_observed_at":"2026-08-07T12:27:46.774534Z","submitted_at":"2026-03-10T14:32:12Z","title":"A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-15T00:03:31.986628Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2603.09725"},"observation_digest":"sha256:f7d8732465636846bb3ea0f301aef0c751f7969e5134f217732aa2f9b0667d4b","observation_id":"28af6dfc-fdeb-403b-a4aa-f7575db52074","resolution":{"observed_at":"2026-07-15T00:03:31.986628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2604.06129","last_updated":"2026-04-07T17:40:37Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:40:37Z","title":"PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T19:20:52.810648Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2604.06129"},"observation_digest":"sha256:1f54ae85f82d8605efd4d9ca3d6463380a407854f3b785fcadba55e427dd2882","observation_id":"36f3c996-20b4-449c-88be-33a3d04dd6cb","resolution":{"observed_at":"2026-05-10T23:05:49.268917Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2604.10736","last_updated":"2026-04-16T21:22:01Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:17:54Z","title":"BlasBench: An Open Benchmark for Irish Speech Recognition","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T15:53:54.092426Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2604.10736"},"observation_digest":"sha256:548ddb5e5fdf38ba94e5f1a37cc31ab535bf09f49bd235a2348c84e58e0f92dd","observation_id":"aab95778-cb03-4e83-9b20-f35d9465e0ba","resolution":{"observed_at":"2026-05-11T09:41:01.511355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-09T08:22:48.731691Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T10:18:16.972414Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:e6d6e8fba62595614e144530e863dd599ab581ea25d79c7be5f9a4812ae5f9d3","observation_id":"48146589-1f80-4847-9813-463959d8def0","resolution":{"observed_at":"2026-05-10T10:19:19.994947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-02T16:16:36.937293Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-09T08:22:48.731691Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T16:16:36.937293Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:f383cdfcee799ef00ba3063292bac68f247115dcf78035ffb81d2e4355f8dc4b","observation_id":"b772d669-7687-4bd8-9823-9a58468dbd54","resolution":{"observed_at":"2026-08-02T16:16:36.937293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2605.08961","last_updated":"2026-05-09T13:56:54Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:56:54Z","title":"Dolphin-CN-Dialect: Where Chinese Dialects Matter","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:13:42.268229Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2605.08961"},"observation_digest":"sha256:fe5096d72ec268a39d378b12b4b7c5e587d70211deef04a8de83fa616286e19e","observation_id":"109d954a-66ba-4253-b6d7-496cf7303ac3","resolution":{"observed_at":"2026-05-12T02:16:16.155299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:f6083640ac826b4a9449f795fb2cf859cc305faaae139ad6532955667db14780","observation_id":"a09ac056-8755-42b1-9c2e-d00b44e30b7f","resolution":{"observed_at":"2026-05-12T02:06:14.936678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2605.15442","last_updated":"2026-05-14T21:53:10Z","snapshot_observed_at":"2026-07-06T23:26:41.848219Z","submitted_at":"2026-05-14T21:53:10Z","title":"Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T14:39:27.382652Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2605.15442"},"observation_digest":"sha256:a47051178781267a74469b38974b01644a5ae77f6fcd9b9c348e651f813c1337","observation_id":"1abdcf3b-a987-42ad-9141-03dcbf4c7396","resolution":{"observed_at":"2026-05-19T14:42:37.457490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2605.27062","last_updated":"2026-05-26T14:14:37Z","snapshot_observed_at":"2026-07-06T23:36:48.467513Z","submitted_at":"2026-05-26T14:14:37Z","title":"FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T18:08:58.631775Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2605.27062"},"observation_digest":"sha256:bc0cf081b1df275075c6afa020c9b1a09322f87ad54bf7af0217ceb28e7a92f1","observation_id":"f0ee6108-8585-47a5-8092-0652071699b3","resolution":{"observed_at":"2026-06-29T18:13:48.543485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2606.21268","last_updated":"2026-06-19T09:46:42Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T09:46:42Z","title":"Online Predictive Coding for Dual-Mode Self-Supervised Speech Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T13:15:04.922107Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2606.21268"},"observation_digest":"sha256:2683496f22403d5f8fae134a68b92328b673b4f4578452659995345f55baf707","observation_id":"0537089c-ee9c-4be9-b377-e695f6d48450","resolution":{"observed_at":"2026-07-04T07:39:38.778504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2606.21854","last_updated":"2026-06-20T03:21:57Z","snapshot_observed_at":"2026-08-02T18:16:50.732892Z","submitted_at":"2026-06-20T03:21:57Z","title":"ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T11:54:08.457573Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2606.21854"},"observation_digest":"sha256:206471867ecb2b59629fc9b01c4dbe9954509aac8a50e4c3239cccfe0e744875","observation_id":"4b6e0059-ec66-4566-9414-6175ea0bd66e","resolution":{"observed_at":"2026-07-04T08:19:44.216294Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2606.24169","last_updated":"2026-06-23T05:51:35Z","snapshot_observed_at":"2026-08-06T14:53:10.347808Z","submitted_at":"2026-06-23T05:51:35Z","title":"Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T00:15:33.685313Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2606.24169"},"observation_digest":"sha256:29cebb05a190cd49fa27fc9de80f4b8693be0d57c4526be4fbcc4d520b02071f","observation_id":"2be08545-17ae-4b07-9ba5-c0be6153dbc1","resolution":{"observed_at":"2026-07-04T16:49:57.378232Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2606.30237","last_updated":"2026-06-29T12:47:20Z","snapshot_observed_at":"2026-08-03T14:00:21.467539Z","submitted_at":"2026-06-29T12:47:20Z","title":"Comparing Human and Automatic Recognition of Dutch Dysarthric Continuous Speech: A Case Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T06:33:01.811696Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2606.30237"},"observation_digest":"sha256:a0fa3fc90eb03fd9318774cacfbe07e23abc6d42bd68ff6c3730ad54f02feb75","observation_id":"32d94fb4-7f1f-42e8-a9f6-547dc20c817f","resolution":{"observed_at":"2026-06-30T06:34:18.648828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":"arXiv (Cornell University)","work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2606.30671","last_updated":"2026-06-24T15:32:47Z","snapshot_observed_at":"2026-08-07T08:15:41.432353Z","submitted_at":"2026-06-24T15:32:47Z","title":"Enhancing BEST-RQ Pseudo-Label Quality through Online Refinement for Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T06:51:41.995108Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2606.30671"},"observation_digest":"sha256:1b211cfe9035083bbf84ee4e7fc5d0097538e02cff2e4d337c504518ef17f161","observation_id":"1036fbf8-ea9a-4572-91ef-7a2975d37618","resolution":{"observed_at":"2026-07-01T06:55:29.107996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-07-12T07:10:06.281832Z","title":"Zhang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-07T07:26:54.689579Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T07:10:06.281832Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2607.02770"},"observation_digest":"sha256:0cd7ecfc092b387331587d287f37a365753319465170d4d7ed63e80930a12965","observation_id":"757e4a3a-12bf-40f3-9509-1fcef7226c86","resolution":{"observed_at":"2026-07-12T07:10:06.281832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-07-14T12:15:06.470439Z","title":"Google USM: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10371","last_updated":"2026-07-11T15:48:03Z","snapshot_observed_at":"2026-08-07T10:45:20.188896Z","submitted_at":"2026-07-11T15:48:03Z","title":"GigaAM Multilingual: Foundation Model for Underrepresented Languages","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T12:15:06.470439Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2607.10371"},"observation_digest":"sha256:0473f8ea019f05b2e52d31cd139de8541422a16733686677bb105177f6eaf675","observation_id":"e9f7d5bc-f704-408a-9c4b-c39d313442b4","resolution":{"observed_at":"2026-07-14T12:15:06.470439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-01T07:10:39.848318Z","title":"Zhang, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21540","last_updated":"2026-07-24T18:05:20Z","snapshot_observed_at":"2026-08-07T09:16:01.540251Z","submitted_at":"2026-07-23T17:25:08Z","title":"DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:10:39.848318Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2607.21540"},"observation_digest":"sha256:2ba03129b6dbceede2f5539a6aac10b443b5d068ad5ca8e5fe04c0beca99d6f6","observation_id":"f3c861d1-95eb-4c31-bbb6-2c589dd7f7b0","resolution":{"observed_at":"2026-08-01T07:10:39.848318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-07-31T23:18:49.234557Z","title":"Google USM: Scaling automatic speech recognition beyond 100 languages.arXiv preprint arXiv:2303.01037,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24030","last_updated":"2026-07-27T05:55:50Z","snapshot_observed_at":"2026-08-07T09:50:33.541075Z","submitted_at":"2026-07-27T05:55:50Z","title":"MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T23:18:49.234557Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2607.24030"},"observation_digest":"sha256:71bdffc26c1967212fab8e938a193abb3bb8599f0fa49e71868a80922b5c4972","observation_id":"a2914072-a04c-4beb-880d-1e0681699564","resolution":{"observed_at":"2026-07-31T23:18:49.234557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.01037/citation-record","integrity":"/paper/2303.01037/integrity","json":"/paper/2303.01037/citation-record.json","paper":"/paper/2303.01037"},"outbound":[],"paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 52 inbound Pith citation observations for arXiv:2303.01037."}