{"as_of":"2026-08-16T09:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9afc34c18f15603e6c419505a6950090c420010a96c6c10abb6505438db39a87","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:13:57.274992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:10:07.966776Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-12T20:13:57.274992Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.274992Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:1339febd002da1313d4494fec8c47bca2371cd00e422e8b4ba88119453ca47fd","observation_id":"424a669b-2016-4d62-a083-84d59e362c72","resolution":{"observed_at":"2026-08-12T20:13:57.274992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T14:12:48.463964Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-13T06:46:27.502820Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.463964Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:1b017bacf77000119f5ca1560c499c5b779354f2aedf7c2f134375319d811642","observation_id":"52b343b8-f89f-43d4-9dfa-e35a1fa2c00c","resolution":{"observed_at":"2026-08-07T14:12:48.463964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T13:49:20.652179Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-15T05:38:42.941028Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.652179Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:1d7e49d6f5f17a0b52269f07422d98ac8b1677b5df5ccdbd39d9b2797bd51fef","observation_id":"d94107cd-9278-4f9c-abfd-72870ccb72d7","resolution":{"observed_at":"2026-08-07T13:49:20.652179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T12:12:19.512688Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-15T09:38:11.036478Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.512688Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:c43ac29c4abf3d6ae51dc24a1840e1ba34d9d0c2a1016280ddf3b45d5ba860b9","observation_id":"9ec2465d-b686-4696-a457-74c0a22ec0aa","resolution":{"observed_at":"2026-08-07T12:12:19.512688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T11:52:13.381090Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for com- mercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-11T18:41:38.745527Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.381090Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:63f6c54a3e159fdc681aa38b4d3dcb63101ac4522883cb076485907cf66c7fb6","observation_id":"7b443f9f-0199-4440-9394-983dbf2e8ece","resolution":{"observed_at":"2026-08-07T11:52:13.381090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T04:58:07.524656Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage.arXiv preprint arXiv:2111.09344,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.524656Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:739d8ff500b6adc8a4c739c75463fcb416f95aca1a229a36f41fa0ceaa8a2214","observation_id":"007423dc-82e9-40c5-be88-0607471da412","resolution":{"observed_at":"2026-08-07T04:58:07.524656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T23:34:07.432916Z","title":"Preprint, arXiv:2111.09344","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-14T08:13:11.379123Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.432916Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:9e2cff696a85378c772004e2535cffd4409c227711e4faa18fe13b302553f886","observation_id":"82dc9500-d820-4672-8a3b-a1b4f3ff12c7","resolution":{"observed_at":"2026-08-06T23:34:07.432916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T22:18:12.458369Z","title":"Galvez, G","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21990","last_updated":"2025-06-27T07:57:13Z","snapshot_observed_at":"2026-08-13T13:18:08.227597Z","submitted_at":"2025-06-27T07:57:13Z","title":"Analyzing and Fine-Tuning Whisper Models for Multilingual Pilot Speech Transcription in the Cockpit","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:12.458369Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.21990"},"observation_digest":"sha256:9c4d207296aaf8bf43b66f597862aac5384603fa8fde6d5d21c8a9dd338cc735","observation_id":"1f9a1363-5163-4ac3-aa36-633587a2a7a7","resolution":{"observed_at":"2026-08-06T22:18:12.458369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T15:02:02.830714Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.830714Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:789aaae286380cf1771b09c2a3a032c40e4416122eb7b9e906aeb7bb66ac33ce","observation_id":"1116d9ff-1bb6-45fe-8c3b-2d690506a98d","resolution":{"observed_at":"2026-08-06T15:02:02.830714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-05T12:07:21.415152Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01939","last_updated":"2025-09-02T04:20:12Z","snapshot_observed_at":"2026-08-15T15:45:56.408224Z","submitted_at":"2025-09-02T04:20:12Z","title":"Group Relative Policy Optimization for Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:21.415152Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2509.01939"},"observation_digest":"sha256:acde19051c850ec41ad4769be356bf6063501af203928364986ddf74c37fc19d","observation_id":"3401423f-1608-4c4e-bf02-fad5fe8224fa","resolution":{"observed_at":"2026-08-05T12:07:21.415152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-05T10:53:38.926567Z","title":"CoRR abs/2111.09344 (2021), https://arxiv","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05359","last_updated":"2025-09-03T18:11:53Z","snapshot_observed_at":"2026-08-12T19:15:34.938531Z","submitted_at":"2025-09-03T18:11:53Z","title":"An Empirical Analysis of Discrete Unit Representations in Speech Language Modeling Pre-training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:53:38.926567Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2509.05359"},"observation_digest":"sha256:ae852f018daaf56559212bf24487de157987b2e52451cf1787423c51018b3dac","observation_id":"11f03851-e677-4215-b44e-f17e27cdb100","resolution":{"observed_at":"2026-08-05T10:53:38.926567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:17432afe5dbaa0755f3341164356c21e3a6ad4f523185e52d087c9a027ccd3d3","observation_id":"6f3f1d5d-1fc1-4078-aac8-50ad37a2817d","resolution":{"observed_at":"2026-05-18T13:01:24.397871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-03T19:05:08.543038Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02201","last_updated":"2026-06-09T07:25:27Z","snapshot_observed_at":"2026-08-15T21:19:29.438275Z","submitted_at":"2025-12-01T20:49:10Z","title":"Swivuriso: The South African Next Voices Multilingual Speech Dataset","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T19:05:08.543038Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2512.02201"},"observation_digest":"sha256:c43812e55e523fb4c80e8740edf0e0a656c9de31949cc680f18508b86bae1c8f","observation_id":"f08ae745-8c0c-45c9-8e5d-5c4ce0d8d8ab","resolution":{"observed_at":"2026-08-03T19:05:08.543038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2604.08003","last_updated":"2026-04-09T09:07:52Z","snapshot_observed_at":"2026-08-15T12:24:31.594968Z","submitted_at":"2026-04-09T09:07:52Z","title":"Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:50.408402Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2604.08003"},"observation_digest":"sha256:2dfc3119d975105447975224fea25618d7a7b88f19de451a20d9778a3b029e6f","observation_id":"d7b854e1-cb19-4514-8f8b-5dff47f5ff84","resolution":{"observed_at":"2026-05-11T05:30:57.407031Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:86e5d826031273f2a9a41406d27b90f82689dfd7f877badd6ae3766e7b1577b6","observation_id":"bb045c2c-b638-4482-a623-086d0037e76f","resolution":{"observed_at":"2026-05-11T04:50:55.964075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2605.09568","last_updated":"2026-05-25T00:50:21Z","snapshot_observed_at":"2026-08-15T07:50:56.634385Z","submitted_at":"2026-05-10T14:29:35Z","title":"RADAR Challenge 2026: Robust Audio Deepfake Recognition under Media Transformations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T02:34:01.865434Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2605.09568"},"observation_digest":"sha256:852eb0ea1274faf0ca09e82e6bf061f0b8bdbc06fb929c2f577e118743de17ea","observation_id":"068edde5-1384-476f-b6df-1f05db66a483","resolution":{"observed_at":"2026-05-12T07:31:27.811824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2605.09568","last_updated":"2026-05-25T00:50:21Z","snapshot_observed_at":"2026-08-15T07:50:56.634385Z","submitted_at":"2026-05-10T14:29:35Z","title":"RADAR Challenge 2026: Robust Audio Deepfake Recognition under Media Transformations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T22:57:59.897674Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2605.09568"},"observation_digest":"sha256:19913aa820c9b1641a68fb1dc3bfae2af14dc3558d1bc67ac2014af2b0ca4679","observation_id":"be8a2da7-1b27-480e-87ce-879cc3e59f4b","resolution":{"observed_at":"2026-05-20T22:59:11.692624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2605.09568","last_updated":"2026-05-25T00:50:21Z","snapshot_observed_at":"2026-08-15T07:50:56.634385Z","submitted_at":"2026-05-10T14:29:35Z","title":"RADAR Challenge 2026: Robust Audio Deepfake Recognition under Media Transformations","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T22:53:18.321056Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2605.09568"},"observation_digest":"sha256:533fe1b7d45eabf3f5e45178a6b1fe60b3f70436aca1f55777023c1baa88ade9","observation_id":"49cb625b-4304-4618-9094-15bb842ea5f8","resolution":{"observed_at":"2026-07-01T13:45:45.419554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2605.12387","last_updated":"2026-05-12T16:50:54Z","snapshot_observed_at":"2026-08-11T13:09:27.378345Z","submitted_at":"2026-05-12T16:50:54Z","title":"A Semi-Supervised Framework for Speech Confidence Detection using Whisper","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T04:00:49.889795Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2605.12387"},"observation_digest":"sha256:834e4e7ad94d007e8b39c6a4276207d4b8f1e542ace08ce2b0c3a10bff67f9ea","observation_id":"167ab0d4-6cc9-48fb-9d09-f00e78cea41b","resolution":{"observed_at":"2026-05-13T04:02:13.237407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2605.20830","last_updated":"2026-05-20T07:21:36Z","snapshot_observed_at":"2026-08-14T12:16:23.131331Z","submitted_at":"2026-05-20T07:21:36Z","title":"Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T02:32:26.122526Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2605.20830"},"observation_digest":"sha256:786cfb3fa59324076495539c10f95ff2fa20b39252155e4350ae5076b1da4967","observation_id":"0d7c2b33-d648-40b7-8bcc-e3d509e1b74f","resolution":{"observed_at":"2026-05-21T02:33:55.507165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2606.06837","last_updated":"2026-06-05T02:24:19Z","snapshot_observed_at":"2026-08-06T02:56:00.329851Z","submitted_at":"2026-06-05T02:24:19Z","title":"SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:19:56.932689Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2606.06837"},"observation_digest":"sha256:6f1dea9687b29f39107555ef702ddcc533167b29b66315ef75e7b86c1486ccd4","observation_id":"a8d9ac97-39d3-446e-bb53-a2f48a6c3582","resolution":{"observed_at":"2026-07-02T19:47:19.541629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2606.22473","last_updated":"2026-06-21T12:33:44Z","snapshot_observed_at":"2026-08-14T14:26:37.762631Z","submitted_at":"2026-06-21T12:33:44Z","title":"Interleaved Speech Language Models Latently Work In Text","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T10:41:19.777779Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2606.22473"},"observation_digest":"sha256:ddeac13ddc162ad4fd780ff7f37f5759a0d69740d116a4178fb42cd74d6b8192","observation_id":"df4de4f9-255a-4315-90ca-f4423eb35d0b","resolution":{"observed_at":"2026-07-04T08:59:42.903183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":"2111.09344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-04T20:10:07.966776Z","title":"Galvez, G","venue":null,"work_id":"68c21db4-1050-44ca-822c-40033d58c0f3","year":2021},"citing_paper":{"arxiv_id":"2606.25391","last_updated":"2026-06-24T04:42:57Z","snapshot_observed_at":"2026-08-04T17:58:05.494359Z","submitted_at":"2026-06-24T04:42:57Z","title":"From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-25T20:36:24.901454Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2606.25391"},"observation_digest":"sha256:80a5aa519bb2a5a0427a18385610c9109ad6c7e38106561358b2c6d9c885954a","observation_id":"6a8b02e2-f9f1-4c90-8e35-fb7561cdf825","resolution":{"observed_at":"2026-07-04T20:10:07.969024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-07-11T09:35:44.381743Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05051","last_updated":"2026-07-06T13:25:33Z","snapshot_observed_at":"2026-08-13T01:49:56.538580Z","submitted_at":"2026-07-06T13:25:33Z","title":"Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T09:35:44.381743Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2607.05051"},"observation_digest":"sha256:e217538728e577fed4f00aea5af1821848e110e4c5ecb182e0c16fc661407034","observation_id":"b47761c7-f254-4d3a-9afa-934c9feee09d","resolution":{"observed_at":"2026-07-11T09:35:44.381743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2111.09344/citation-record","integrity":"/paper/2111.09344/integrity","json":"/paper/2111.09344/citation-record.json","paper":"/paper/2111.09344"},"outbound":[],"paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2111.09344."}