{"as_of":"2026-08-10T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19832595f89cdb41fb7b93127d50e169b6a5661f991e12cfd2b666ac87b96ba4","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T10:13:51.001946Z","state":"measured"},{"denominator":116,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":116,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":280,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:10:04.216311Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1161,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2305.01626","last_updated":"2026-04-22T22:19:55Z","snapshot_observed_at":"2026-07-06T15:22:25.008777Z","submitted_at":"2023-05-02T17:38:21Z","title":"Basic syntax from speech: Spontaneous concatenation in unsupervised deep neural networks","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-24T09:06:55.725579Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2305.01626"},"observation_digest":"sha256:7b67a892156966d77346d1a953dfebcd5627b049493d0d80fe9d39a0c8c926d2","observation_id":"25aebbe4-9b63-4c96-a5ff-564402859396","resolution":{"observed_at":"2026-05-24T09:09:15.624681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:7208406ac673292c78e2b392746f7fe2e66c793f899c82fe1adf823d9ae4dff3","observation_id":"1f5592a9-5b6c-4a81-bcce-e25bde195f02","resolution":{"observed_at":"2026-05-13T23:30:00.609860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:c4781aa70cf39c3c69bb44f282519e201081b3f7126a430c0a796ab550732de7","observation_id":"9c409c77-d2f6-46a8-bb54-13ea20ac87b2","resolution":{"observed_at":"2026-05-16T07:07:57.890817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-12T03:33:45.855974Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2308.03281"},"observation_digest":"sha256:83fd1a78e3ba19ef01f3d13e2a6a0b4398ad23801ef35f0c08b08da3ee6ac3ab","observation_id":"0d8fddea-ab3a-4da0-9d3c-1bb5ecce36fb","resolution":{"observed_at":"2026-05-12T03:33:45.943920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2402.01703","last_updated":"2026-04-22T14:47:14Z","snapshot_observed_at":"2026-07-06T17:24:33.169277Z","submitted_at":"2024-01-24T19:56:20Z","title":"Community-Informed AI Models for Police Accountability","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T05:08:34.362690Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2402.01703"},"observation_digest":"sha256:bd484b63ff88a079263ae6f26c1b4aea8062116e37cad590dac0f84dfd34f1db","observation_id":"e00c5b17-6604-43f4-a113-790b109ab2ac","resolution":{"observed_at":"2026-05-24T05:08:54.647010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:3894597975d44f10f2949fd11c509390070ff7fd4398c1815bf704f258a24496","observation_id":"e3f41e3d-44d2-462e-8ef7-e2a26197d103","resolution":{"observed_at":"2026-05-24T00:28:39.523430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:e73beaac097ff683d2fd524fe0523cc1aa609c2a9f0e7cdb969f3b67abc80ce5","observation_id":"90d6252e-f3ee-4b63-b42e-fcf338e96f23","resolution":{"observed_at":"2026-05-17T10:46:28.621293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2412.07584","last_updated":"2026-04-28T15:45:36Z","snapshot_observed_at":"2026-08-02T06:54:38.590926Z","submitted_at":"2024-12-10T15:20:23Z","title":"Multimodal Contextualized Support for Enhancing Video Retrieval System","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T07:14:34.843867Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2412.07584"},"observation_digest":"sha256:38e199e8a38bfa7b03b33cd60bb7e490d6675058751b419f69a0f8e2e5ec7919","observation_id":"aed2f2ed-ae40-44fd-8d88-2056d9e2154c","resolution":{"observed_at":"2026-05-23T07:15:28.460774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2501.05465","last_updated":"2026-05-14T16:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T19:53:57Z","title":"Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-23T05:47:48.488826Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.05465"},"observation_digest":"sha256:42305f51b3265a157b4af24d2a93516f622cf2bad39b3c3407dcc4dbadf31cab","observation_id":"6407b19f-7730-4a5f-ba5b-821e9f6ef611","resolution":{"observed_at":"2026-05-23T05:52:37.599659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T21:10:04.216311Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06117","last_updated":"2025-08-13T20:03:11Z","snapshot_observed_at":"2026-08-10T21:03:35.481181Z","submitted_at":"2025-01-10T17:15:38Z","title":"Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:10:04.216311Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.06117"},"observation_digest":"sha256:cc8a66c0cebbc843f1c778392bc80308440432c2a999b629cb3323f3dc39e34e","observation_id":"7fea7ce3-9333-483b-a3cc-2485dfe189bf","resolution":{"observed_at":"2026-08-10T21:10:04.216311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T20:53:52.228462Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07102","last_updated":"2025-01-13T07:27:00Z","snapshot_observed_at":"2026-08-10T20:47:05.493883Z","submitted_at":"2025-01-13T07:27:00Z","title":"AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:52.228462Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.07102"},"observation_digest":"sha256:e8484bf3e3fa99d6f16667e6d2cb06c31f293f609bf81cea48cb4f9ae9698ff9","observation_id":"ec5f02cd-42d9-49e6-9dc0-6a2b07079d98","resolution":{"observed_at":"2026-08-10T20:53:52.228462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T20:34:09.819032Z","title":"Robust Speech Recognition via Large-Scale Weak Super- vision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08104","last_updated":"2025-01-14T13:28:14Z","snapshot_observed_at":"2026-08-10T20:27:18.912664Z","submitted_at":"2025-01-14T13:28:14Z","title":"Loudspeaker Beamforming to Enhance Speech Recognition Performance of Voice Driven Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:09.819032Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.08104"},"observation_digest":"sha256:aa47bd8942a42424f21f48cce3af1036f4274dca5f8bca7c9430285854ddb671","observation_id":"0ccf6fb8-952d-474f-bf94-acc4c6dc3dbc","resolution":{"observed_at":"2026-08-10T20:34:09.819032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T18:52:42.964721Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10937","last_updated":"2025-01-19T04:10:53Z","snapshot_observed_at":"2026-08-10T19:45:51.148757Z","submitted_at":"2025-01-19T04:10:53Z","title":"Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:52:42.964721Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.10937"},"observation_digest":"sha256:18294d6d727a0ab99a4da38b530b3d6fec93e2c6753f7ac396f244b16e62e897","observation_id":"add67a61-7082-413d-94da-588cddc480b8","resolution":{"observed_at":"2026-08-10T18:52:42.964721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T17:22:05.514989Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12300","last_updated":"2025-01-21T17:13:13Z","snapshot_observed_at":"2026-08-10T17:15:45.763113Z","submitted_at":"2025-01-21T17:13:13Z","title":"LLM-Assisted Knowledge Graph Completion for Curriculum and Domain Modelling in Personalized Higher Education Recommendations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:22:05.514989Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.12300"},"observation_digest":"sha256:ee1252a7c1d3ba2f72467bdf699f93e99ef81c4d8d935fc7f0b9a034893aa165","observation_id":"9fb5f113-5f3e-4810-a7c2-1fa40851ed81","resolution":{"observed_at":"2026-08-10T17:22:05.514989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T17:02:51.148066Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12640","last_updated":"2025-08-29T10:39:09Z","snapshot_observed_at":"2026-08-10T16:55:45.566414Z","submitted_at":"2025-01-22T04:58:50Z","title":"Toxicity Begets Toxicity: Unraveling Conversational Chains in Political Podcasts","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:02:51.148066Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.12640"},"observation_digest":"sha256:ad67cd50fdbc44cf03ad2e548cd75ec696afe30a4619cb1571b401e317f53b4b","observation_id":"2f341de6-15a3-4f6b-9f02-40afc73fd34a","resolution":{"observed_at":"2026-08-10T17:02:51.148066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T15:46:12.170322Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13682","last_updated":"2025-01-23T14:07:49Z","snapshot_observed_at":"2026-08-10T15:39:49.877262Z","submitted_at":"2025-01-23T14:07:49Z","title":"Collective Memory and Narrative Cohesion: A Computational Study of Palestinian Refugee Oral Histories in Lebanon","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T15:46:12.170322Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.13682"},"observation_digest":"sha256:41cd827ddbc5062c20ead11d881069674c5948f1344b37ca036b0f3dd5c25376","observation_id":"04d38a44-17df-41f3-ab92-77c111efba33","resolution":{"observed_at":"2026-08-10T15:46:12.170322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:823496efe08ef57a6e7f2218331fcc4ef204d8c86181632e3a4d301116add4af","observation_id":"07987b6a-79e5-4c70-adfd-fdbf8e344ddf","resolution":{"observed_at":"2026-05-14T00:32:41.244010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T14:54:33.838786Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14877","last_updated":"2025-01-24T19:03:42Z","snapshot_observed_at":"2026-08-10T14:47:54.171199Z","submitted_at":"2025-01-24T19:03:42Z","title":"DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T14:54:33.838786Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.14877"},"observation_digest":"sha256:d6a2e949a2910d682aa901e96d53a719c184e00b4a7cc0f12ab5974799adc033","observation_id":"8535ee46-ff4d-438e-8ffd-bf24a9da38b1","resolution":{"observed_at":"2026-08-10T14:54:33.838786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T14:49:55.588901Z","title":"Robust speech recognition via large- scale weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14925","last_updated":"2025-01-28T17:52:16Z","snapshot_observed_at":"2026-08-10T14:44:42.690129Z","submitted_at":"2025-01-24T21:31:11Z","title":"Profiling Apple Silicon Performance for ML Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:55.588901Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.14925"},"observation_digest":"sha256:a23b2130ee0ec0f44363ddc585aded9cde9389fe67f69c8b2e4bcef30cb2f6b4","observation_id":"32a94e51-607c-42ff-8a59-9bd688dd324c","resolution":{"observed_at":"2026-08-10T14:49:55.588901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T20:27:22.597362Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16344","last_updated":"2025-05-31T16:37:32Z","snapshot_observed_at":"2026-08-10T20:19:27.664864Z","submitted_at":"2025-01-15T06:30:17Z","title":"WhiSPA: Semantically and Psychologically Aligned Whisper with Self-Supervised Contrastive and Student-Teacher Learning","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:27:22.597362Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.16344"},"observation_digest":"sha256:97a7e72ac914603f344bf707aec6cf8eae54410230a14431f98ae7c1d29a065f","observation_id":"4fd1bfad-0568-46bf-bd99-7d6c945d3d9c","resolution":{"observed_at":"2026-08-10T20:27:22.597362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T20:20:58.946422Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.946422Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:399c06773bb30746a90ec08b2d760b17d06e0afa91e8cce3ec8e80def8519ec6","observation_id":"0b56fcd9-dbb9-434f-9f7b-2f1ec0e7c116","resolution":{"observed_at":"2026-08-09T20:20:58.946422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T19:07:33.651511Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00421","last_updated":"2025-02-01T12:47:36Z","snapshot_observed_at":"2026-08-10T02:28:04.588362Z","submitted_at":"2025-02-01T12:47:36Z","title":"Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:07:33.651511Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2502.00421"},"observation_digest":"sha256:52a4479a650b6f8137947ddbc20717072e6e6e171f0cc5914000ed5f100ed8ba","observation_id":"2beee3f1-c15f-4a57-ac43-cf17a5a27df7","resolution":{"observed_at":"2026-08-09T19:07:33.651511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T18:05:52.341242Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00718","last_updated":"2025-07-10T14:44:44Z","snapshot_observed_at":"2026-08-09T21:15:27.675893Z","submitted_at":"2025-02-02T08:36:23Z","title":"\"I am bad\": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T18:05:52.341242Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2502.00718"},"observation_digest":"sha256:9d6e7743568a2f980cb5f7306f7c002629f2fdd0d8444030db40e68e7dd316a6","observation_id":"14eb5793-877f-4d05-99f9-9a7cadc400e0","resolution":{"observed_at":"2026-08-09T18:05:52.341242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T16:43:08.831448Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-10T20:48:32.864844Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.831448Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:636d3657615c4e8ed96b0c37acb232f32b1c3a6bacd0996da8b63531a175dcec","observation_id":"e5c149c6-979a-4f34-b0d0-349eee89c42f","resolution":{"observed_at":"2026-08-09T16:43:08.831448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T17:06:31.329295Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02610","last_updated":"2025-02-03T01:25:47Z","snapshot_observed_at":"2026-08-09T16:58:53.946288Z","submitted_at":"2025-02-03T01:25:47Z","title":"Secure & Personalized Music-to-Video Generation via CHARCHA","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T17:06:31.329295Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2502.02610"},"observation_digest":"sha256:126a33c29c94ea21793325c5552bf3e99029c75ea3320eb3ce54d80b7e094b77","observation_id":"d0a90cce-4323-417b-94d6-5ff980e2f47f","resolution":{"observed_at":"2026-08-09T17:06:31.329295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2502.16942","last_updated":"2025-06-02T07:51:11Z","snapshot_observed_at":"2026-07-06T20:41:28.562637Z","submitted_at":"2025-02-24T08:11:17Z","title":"NUTSHELL: A Dataset for Abstract Generation from Scientific Talks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T02:50:10.307310Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2502.16942"},"observation_digest":"sha256:1c8f5864295ae79aa1fccb256ba0ce1476cc47a21dae8f882438dcfe4f1f3a69","observation_id":"6c11505b-32de-4a0c-995f-7148d96d07bb","resolution":{"observed_at":"2026-05-23T02:52:26.539614Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T15:35:35.723258Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-10T18:25:34.594517Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.723258Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:1f21c899374501bc91f0fe126db3270be091ed06f0c6a649c30d7231f0aa077a","observation_id":"cf7e1600-435f-49ed-9a59-da803e35217e","resolution":{"observed_at":"2026-08-07T15:35:35.723258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T15:07:10.363576Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-10T12:01:15.672168Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.363576Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:d63e69f0677ffd7215251e7447c04b53495dcdff4fe4aa0a0c66f3bc51642489","observation_id":"092bb8b5-818c-403a-9762-39b6ad937b9a","resolution":{"observed_at":"2026-08-07T15:07:10.363576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:55:56.715907Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-09T09:32:42.256193Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:56.715907Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:fd06c935ade6d9d1c2e3c854403d9e0ebaa7bd33614e86569752ec02ac8ed0f7","observation_id":"7489012e-c329-4f5a-8be7-8331d9ac307c","resolution":{"observed_at":"2026-08-07T14:55:56.715907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:55:01.681010Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17326","last_updated":"2025-05-22T22:42:40Z","snapshot_observed_at":"2026-08-09T20:29:46.148181Z","submitted_at":"2025-05-22T22:42:40Z","title":"VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:01.681010Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.17326"},"observation_digest":"sha256:8ead8407a1c807960e84a2d49e5c4139032bf3f03b9346acabee1bb856b1874c","observation_id":"362e459a-056b-41d1-892a-a9e44a7ccfaa","resolution":{"observed_at":"2026-08-07T14:55:01.681010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:34:18.559801Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18436","last_updated":"2025-07-04T23:16:29Z","snapshot_observed_at":"2026-08-08T14:59:05.608435Z","submitted_at":"2025-05-24T00:11:07Z","title":"Voice of a Continent: Mapping Africa's Speech Technology Frontier","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:18.559801Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.18436"},"observation_digest":"sha256:fcb5462221165566a7c16b72e5d26334b269e5a15d0a47887eb52084548e6c16","observation_id":"669ef1d5-6dae-491c-9720-dd9879aa6fa2","resolution":{"observed_at":"2026-08-07T14:34:18.559801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:30:33.802965Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-09T11:08:24.041213Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.802965Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:8d0ef3c5ad73cece881d060961a2335952741d5540eb19ae9ee88294e806756d","observation_id":"9ab42704-7e69-4852-a0a3-61943c0b3599","resolution":{"observed_at":"2026-08-07T14:30:33.802965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:23:38.902233Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19103","last_updated":"2025-05-25T11:45:08Z","snapshot_observed_at":"2026-08-09T09:56:31.596522Z","submitted_at":"2025-05-25T11:45:08Z","title":"WHISTRESS: Enriching Transcriptions with Sentence Stress Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:38.902233Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19103"},"observation_digest":"sha256:2952d3c79f24e72c7e7245ea737357b61f4ddc25a9af6cea6f6e5613ca9a4045","observation_id":"eac08d46-0bd1-4f26-8de5-760e16456aaf","resolution":{"observed_at":"2026-08-07T14:23:38.902233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:19:58.084628Z","title":"Robust speech recognition via large-scale weak supervision.ArXiv, abs/2212.04356, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.084628Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:eba823c336eb84ea16177d00cde8fa8f3d74d7e92ccdb33098a1cca89df4c7ee","observation_id":"7ffd8915-540a-457e-ad2a-feebe127b0e5","resolution":{"observed_at":"2026-08-07T14:19:58.084628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:18:27.221397Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19476","last_updated":"2025-05-27T09:33:56Z","snapshot_observed_at":"2026-08-09T13:06:45.444737Z","submitted_at":"2025-05-26T03:55:00Z","title":"FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:27.221397Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19476"},"observation_digest":"sha256:8d64d3cb142606c60125ca2c31b658c8abd89c1f727434e80c503b2eaadce366","observation_id":"82083e53-5fa3-4c13-a1a8-e6e616108ce4","resolution":{"observed_at":"2026-08-07T14:18:27.221397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:12:47.158251Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-10T12:01:11.716512Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.158251Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:bb103ac0ab4bab8d7ae9647ef120ce6a44b1ba21444075546e897e715219da79","observation_id":"ac4fef8f-9040-40f2-8b58-b96e78ba18bf","resolution":{"observed_at":"2026-08-07T14:12:47.158251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:07:23.097224Z","title":"org/abs/2212.04356","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.097224Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:05bbc36c7ceba7a8a20036addf1fdcc0d532fd6ea696c999c2197ae08454e3de","observation_id":"653a531d-516d-43c4-a81d-4a0d21144b4e","resolution":{"observed_at":"2026-08-07T14:07:23.097224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T13:56:55.026428Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.026428Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:9cf4099e84fdc4963dece3170803d73d9b7e3823d71271b14a4643f2fcba06be","observation_id":"5d37df95-1f99-4f47-b8ae-994a436c9dc8","resolution":{"observed_at":"2026-08-07T13:56:55.026428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T13:08:17.805464Z","title":"Robust speech recognition via large-scale weak supervision, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22581","last_updated":"2025-05-28T16:54:36Z","snapshot_observed_at":"2026-08-08T07:07:56.863758Z","submitted_at":"2025-05-28T16:54:36Z","title":"Tell me Habibi, is it Real or Fake?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:17.805464Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.22581"},"observation_digest":"sha256:d7e1c11fe5b7d4de15f7516e2362a0a0f77e32ebf8844b123dded9d015c31784","observation_id":"00cfc314-ae5e-4872-803a-f1b002791421","resolution":{"observed_at":"2026-08-07T13:08:17.805464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:46:44.309947Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23570","last_updated":"2025-07-04T14:02:59Z","snapshot_observed_at":"2026-08-09T11:24:22.499340Z","submitted_at":"2025-05-29T15:44:36Z","title":"Evaluating AI capabilities in detecting conspiracy theories on YouTube","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:44.309947Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.23570"},"observation_digest":"sha256:357c36267569a301f6d1db82f2299b37bcf9fb1b24529f7aefa34cfc606c8568","observation_id":"fd8df946-d27d-4c42-842c-6f7511a71823","resolution":{"observed_at":"2026-08-07T12:46:44.309947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:43:41.505406Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23688","last_updated":"2025-05-30T03:54:35Z","snapshot_observed_at":"2026-08-07T12:37:32.759706Z","submitted_at":"2025-05-29T17:25:35Z","title":"Automatic classification of stop realisation with wav2vec2.0","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.505406Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.23688"},"observation_digest":"sha256:cd10b82d9740d3b53e66586f7d32b7700f69489da033b38e09113b821a4aa49f","observation_id":"510a616b-305f-42a4-9ceb-3b4a2bf17860","resolution":{"observed_at":"2026-08-07T12:43:41.505406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T13:23:36.500911Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23822","last_updated":"2025-07-23T14:16:49Z","snapshot_observed_at":"2026-08-07T13:16:30.261603Z","submitted_at":"2025-05-28T04:07:17Z","title":"Speech as a Multimodal Digital Phenotype for Multi-Task LLM-based Mental Health Prediction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:36.500911Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.23822"},"observation_digest":"sha256:764c72b64f837646eaf2f45a0b092f5e776c1c30d8f6ddb913466993e9eb680a","observation_id":"67a4ed0c-25ad-4b1f-8b11-03838c63e7c6","resolution":{"observed_at":"2026-08-07T13:23:36.500911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:43:01.114392Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24016","last_updated":"2025-05-29T21:34:49Z","snapshot_observed_at":"2026-08-07T12:35:29.864056Z","submitted_at":"2025-05-29T21:34:49Z","title":"BeaverTalk: Oregon State University's IWSLT 2025 Simultaneous Speech Translation System","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:43:01.114392Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.24016"},"observation_digest":"sha256:561850f3171e247708e92f2f452ea13b07eb3b5120b8fd68302802e842ed9b6e","observation_id":"927629a9-723c-4a3a-b10d-8afa9b6fcabb","resolution":{"observed_at":"2026-08-07T12:43:01.114392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:35:28.601428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24561","last_updated":"2025-05-30T13:16:08Z","snapshot_observed_at":"2026-08-09T10:13:07.858419Z","submitted_at":"2025-05-30T13:16:08Z","title":"Improving Language and Modality Transfer in Translation by Character-level Modeling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:28.601428Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.24561"},"observation_digest":"sha256:b3807465447cac80363bc311cffff6d08995e959e940f88e04e8a63f40c1b19c","observation_id":"7ccbdb48-8c5d-4768-a10f-c3d2414dfe97","resolution":{"observed_at":"2026-08-07T12:35:28.601428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:11:47.662234Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.662234Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:74bf7014453511a08e2d2ae5a33f63d177b742c6ba78cd0f1d3c1e8499f9b9aa","observation_id":"fe169053-4210-4de0-8198-e5079bc077c8","resolution":{"observed_at":"2026-08-07T12:11:47.662234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:12:29.194153Z","title":"Nasim Rahaman, Aristide Baratin, Devansh Arpit, Felix Draxler, Min Lin, Fred Hamprecht, Yoshua Bengio, and Aaron Courville","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00385","last_updated":"2025-05-31T04:31:02Z","snapshot_observed_at":"2026-08-07T12:04:30.289730Z","submitted_at":"2025-05-31T04:31:02Z","title":"MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:29.194153Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.00385"},"observation_digest":"sha256:582251de80e8bd6806e170b566c9504b96bda0249b53f4102b0e1cdac058bf2e","observation_id":"0e18c3fc-2abf-449a-b237-3e7684be45e7","resolution":{"observed_at":"2026-08-07T12:12:29.194153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:08:16.251129Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00454","last_updated":"2025-05-31T08:16:54Z","snapshot_observed_at":"2026-08-10T15:38:21.686559Z","submitted_at":"2025-05-31T08:16:54Z","title":"Towards Temporally Explainable Dysarthric Speech Clarity Assessment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.251129Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.00454"},"observation_digest":"sha256:95a6343c99fd070b2bdcaefe14bc0fa039f1d9d5b839722a2fff5d074042e153","observation_id":"8f669cfc-e9bd-4201-bfe5-7cf4c0b33446","resolution":{"observed_at":"2026-08-07T12:08:16.251129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:51:05.676589Z","title":"org/abs/2212.04356","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.676589Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:3caf99c3ee2005433438ff130a745771ca006d39fd65140f7d244b740a3594a4","observation_id":"b3c97642-4e2f-49ba-b054-61c624db5296","resolution":{"observed_at":"2026-08-07T11:51:05.676589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:50:22.032115Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01406","last_updated":"2025-06-02T08:02:44Z","snapshot_observed_at":"2026-08-07T11:41:14.981381Z","submitted_at":"2025-06-02T08:02:44Z","title":"Speech-to-Speech Translation Pipelines for Conversations in Low-Resource Languages","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:50:22.032115Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.01406"},"observation_digest":"sha256:4b39e27b7af233fdcf4ef7d32ddc95389da118e10999346b32bc97a7ca42e3b9","observation_id":"5b7dbf67-aec0-49ee-a7c1-e096206ce4e3","resolution":{"observed_at":"2026-08-07T11:50:22.032115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:33:51.141038Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-10T15:22:06.543828Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.141038Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:948b0513395621e805e14150034c30300e164b90c4e21bcba26a675a9977ab2b","observation_id":"a5122e6c-0b43-417c-9412-5550698e7071","resolution":{"observed_at":"2026-08-07T11:33:51.141038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:27:12.982988Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02412","last_updated":"2025-06-03T03:56:45Z","snapshot_observed_at":"2026-08-07T11:22:20.938824Z","submitted_at":"2025-06-03T03:56:45Z","title":"SingaKids: A Multilingual Multimodal Dialogic Tutor for Language Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:27:12.982988Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02412"},"observation_digest":"sha256:2b2245bbc4bf34a84438f7ccaea86bff4586ebb51f24cc4ae7fb386f7b8e618d","observation_id":"e411ff1b-a951-471b-ac16-e942d99d6bfc","resolution":{"observed_at":"2026-08-07T11:27:12.982988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:21:11.541084Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02742","last_updated":"2025-06-03T10:59:22Z","snapshot_observed_at":"2026-08-08T08:10:54.994072Z","submitted_at":"2025-06-03T10:59:22Z","title":"Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:11.541084Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02742"},"observation_digest":"sha256:a976781b7d8ece21f8f9789953eaae907e6431a15096ac846ea06dac597a1c0b","observation_id":"000021e7-1a98-488e-a767-fbe79ea35c0a","resolution":{"observed_at":"2026-08-07T11:21:11.541084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:16:00.179089Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02995","last_updated":"2025-06-03T15:29:52Z","snapshot_observed_at":"2026-08-10T18:32:24.851514Z","submitted_at":"2025-06-03T15:29:52Z","title":"It's Not a Walk in the Park! Challenges of Idiom Translation in Speech-to-text Systems","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:16:00.179089Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02995"},"observation_digest":"sha256:f78458dfa789cf73f96458aa4971ae64032420a795957aa43fd42e4f1facd7f4","observation_id":"9bab065b-80a5-40ab-8ae1-e532b1240ee6","resolution":{"observed_at":"2026-08-07T11:16:00.179089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:16:32.166827Z","title":"Robust speech recognition via large-scale weak super- vision. arxiv 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-08T15:23:23.036086Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.166827Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:dca65be6a4bd63f6118e5f1eb88d4106ed8f8fe0242eafdbb79918814701d814","observation_id":"c89fd632-0615-417d-824b-23b60a90d21b","resolution":{"observed_at":"2026-08-07T11:16:32.166827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T10:29:44.929007Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:44.929007Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:33dadfa1559c55cd7c57eb4ba46e5dbb28c77ee4781e029994e585bc6cc18071","observation_id":"7561d1b5-c72f-4b58-9ef6-34f8a48cddea","resolution":{"observed_at":"2026-08-07T10:29:44.929007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T10:24:24.738562Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05538","last_updated":"2025-06-05T19:39:28Z","snapshot_observed_at":"2026-08-07T10:17:08.444526Z","submitted_at":"2025-06-05T19:39:28Z","title":"SocialDF: Benchmark Dataset and Detection Model for Mitigating Harmful Deepfake Content on Social Media Platforms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.738562Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.05538"},"observation_digest":"sha256:46ce37c06e0985306b055c5c200819dbc0227fbe5d40790f0d3dd9756cb532b5","observation_id":"053d37e6-e36e-4348-a95b-a9e45a799d34","resolution":{"observed_at":"2026-08-07T10:24:24.738562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T10:24:24.751517Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05538","last_updated":"2025-06-05T19:39:28Z","snapshot_observed_at":"2026-08-07T10:17:08.444526Z","submitted_at":"2025-06-05T19:39:28Z","title":"SocialDF: Benchmark Dataset and Detection Model for Mitigating Harmful Deepfake Content on Social Media Platforms","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.751517Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.05538"},"observation_digest":"sha256:b0e28b11673c9e7bcebe9b53e937080ab6cabcc2317ca786a01c81de7de24ed7","observation_id":"9b849b07-d899-4c0d-aed9-622c927b7025","resolution":{"observed_at":"2026-08-07T10:24:24.751517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T06:05:31.772749Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.772749Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:3e689c5733d933e15b85dc8d9ce589afbb10825f6f31ffcfea1be65de2a305f7","observation_id":"63cd450c-52ea-467c-b862-0b91c26bfd4f","resolution":{"observed_at":"2026-08-07T06:05:31.772749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T05:54:06.944151Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-09T10:25:03.473270Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.944151Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:b2acb3d7acf4b24406bd1f837f02470769204f1b6a7873c487311981a1c182e3","observation_id":"95e1751b-1236-4cd7-9a5b-858ef3a85bc0","resolution":{"observed_at":"2026-08-07T05:54:06.944151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T05:37:55.521083Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07510","last_updated":"2025-06-09T07:37:50Z","snapshot_observed_at":"2026-08-10T19:43:50.323462Z","submitted_at":"2025-06-09T07:37:50Z","title":"DeRAGEC: Denoising Named Entity Candidates with Synthetic Rationale for ASR Error Correction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:55.521083Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.07510"},"observation_digest":"sha256:6a1d649584ffa5b97485c548475655886fa4aed54a74df50bbe2b6fa0bac7f8e","observation_id":"780ec326-efaf-43c1-b0ed-fc11a23069e1","resolution":{"observed_at":"2026-08-07T05:37:55.521083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2506.09362","last_updated":"2026-06-22T05:21:26Z","snapshot_observed_at":"2026-08-07T04:47:52.631796Z","submitted_at":"2025-06-11T03:17:31Z","title":"\"I Said Things I Needed to Hear Myself\": Peer Support as an Emotional, Organisational, and Sociotechnical Practice in Singapore","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T10:28:12.506891Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.09362"},"observation_digest":"sha256:96dfeeef5456819706414e0634c915a39bbcf037dba4c09a068d93b9492e6690","observation_id":"8de39f9e-f8cc-4735-a072-778fc06aeeb6","resolution":{"observed_at":"2026-05-19T10:32:14.540239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:53:52.220765Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09362","last_updated":"2026-06-22T05:21:26Z","snapshot_observed_at":"2026-08-07T04:47:52.631796Z","submitted_at":"2025-06-11T03:17:31Z","title":"\"I Said Things I Needed to Hear Myself\": Peer Support as an Emotional, Organisational, and Sociotechnical Practice in Singapore","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:52.220765Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.09362"},"observation_digest":"sha256:4a34c6d4adda8fd512f91ec3367460c03dc69da1b1f83ef411fed5c3da44b69c","observation_id":"f5fc0067-badf-4842-bce7-67fd00d00cac","resolution":{"observed_at":"2026-08-07T04:53:52.220765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:53:44.054699Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09409","last_updated":"2025-06-11T05:40:26Z","snapshot_observed_at":"2026-08-08T16:12:57.549272Z","submitted_at":"2025-06-11T05:40:26Z","title":"MAGMaR Shared Task System Description: Video Retrieval with OmniEmbed","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:53:44.054699Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.09409"},"observation_digest":"sha256:9bf7a1c0b128d032bc61e42437a8d7f8581f7115fd6b18f149985fa08ba4ffe9","observation_id":"8e062e4f-a776-4688-8bab-4b1ca7efad0f","resolution":{"observed_at":"2026-08-07T04:53:44.054699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:53:39.096796Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09424","last_updated":"2025-06-11T06:12:50Z","snapshot_observed_at":"2026-08-10T15:10:41.969606Z","submitted_at":"2025-06-11T06:12:50Z","title":"Hidden in Plain Sight: Evaluation of the Deception Detection Capabilities of LLMs in Multimodal Settings","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:53:39.096796Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.09424"},"observation_digest":"sha256:120f90e4eec7ef4165b8843609d04e19cd93a84bb159f691f113c0f296cd9daf","observation_id":"3e43e5e7-da8b-4a6a-ac04-6751ecdffe79","resolution":{"observed_at":"2026-08-07T04:53:39.096796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:15:56.689663Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.689663Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:701b0f394d2b98ef4abe6abf423a4fd8406d45c0d7f55bb7b7756f627b63d055","observation_id":"5092846e-ce14-438f-b405-42cea1176d02","resolution":{"observed_at":"2026-08-07T04:15:56.689663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T00:59:49.340105Z","title":"Robust speech recognition via large- scale weak supervision (arxiv: 2212.04356). arxiv,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-10T01:37:25.002786Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.340105Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:6840aa2a50cc1b7b04b6719bb8910a2d88405b7e3a493e3de67fa6584757b796","observation_id":"1cdb8260-90bf-493d-bc95-08b50280516b","resolution":{"observed_at":"2026-08-07T00:59:49.340105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T00:52:03.933734Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-09T04:18:05.919282Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.933734Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:61eb8a3af3d63b19bd11595db3d056626e6f8eb23ed98da820e7c05718c4993c","observation_id":"ef7dbf33-7411-4e07-87b9-bc4450a22762","resolution":{"observed_at":"2026-08-07T00:52:03.933734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T00:23:13.221764Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14190","last_updated":"2025-06-17T05:05:09Z","snapshot_observed_at":"2026-08-09T21:10:36.952068Z","submitted_at":"2025-06-17T05:05:09Z","title":"AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:13.221764Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.14190"},"observation_digest":"sha256:11336860d177e4ec3ca58d45bd1b937ae8b168dfd4c6991d697b94b289d83863","observation_id":"561a7fc8-18a6-4e7b-a1ae-42a92ef577a4","resolution":{"observed_at":"2026-08-07T00:23:13.221764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T23:48:39.299238Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15981","last_updated":"2025-06-28T05:47:16Z","snapshot_observed_at":"2026-08-10T08:31:47.566066Z","submitted_at":"2025-06-19T02:56:49Z","title":"Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:48:39.299238Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.15981"},"observation_digest":"sha256:2ba40fd6f1937e8c76f584efcc7bc5531ea85bcad5503540a7b34f6d06668894","observation_id":"ec36eb69-f540-4f2e-9e9d-2ae8e6b8fabd","resolution":{"observed_at":"2026-08-06T23:48:39.299238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T23:41:49.574295Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-08T18:40:49.656734Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.574295Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:136a0849844dda6fbe2aeeed5c53cfc59be55c358ff3c42874845df56b603484","observation_id":"9b8ec22b-69c3-4c6b-9053-dbe902e1692e","resolution":{"observed_at":"2026-08-06T23:41:49.574295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T23:21:34.685007Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18488","last_updated":"2025-06-28T05:44:41Z","snapshot_observed_at":"2026-08-10T07:59:50.635381Z","submitted_at":"2025-06-23T10:42:50Z","title":"AI-Generated Song Detection via Lyrics Transcripts","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:21:34.685007Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.18488"},"observation_digest":"sha256:30c78db4752ee226bff3f5bf254b3bb2598b86e79c5ea8485ade466b00ea89d0","observation_id":"547ac7e2-02e2-4d3e-a840-c1a1a4ba4b50","resolution":{"observed_at":"2026-08-06T23:21:34.685007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T23:20:14.347829Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18621","last_updated":"2025-06-23T13:28:33Z","snapshot_observed_at":"2026-08-09T02:51:19.840480Z","submitted_at":"2025-06-23T13:28:33Z","title":"The Anatomy of Speech Persuasion: Linguistic Shifts in LLM-Modified Speeches","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:14.347829Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.18621"},"observation_digest":"sha256:7a8ae553c3afaa6c87a7e896a79eec4fe067fdc52e3ef881c079b333266f1456","observation_id":"fb4c00f9-49d5-4e61-b4cb-9c792d554f9f","resolution":{"observed_at":"2026-08-06T23:20:14.347829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:31:32.218638Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21563","last_updated":"2025-06-12T07:02:28Z","snapshot_observed_at":"2026-08-08T09:20:55.054492Z","submitted_at":"2025-06-12T07:02:28Z","title":"FormosanBench: Benchmarking Low-Resource Austronesian Languages in the Era of Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:31:32.218638Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.21563"},"observation_digest":"sha256:af5c447406c2b3b42fcce7f37e72e55d065b6a8ccefaf11387c2e1a3628793fb","observation_id":"30b1a339-1ffb-4fff-b9a5-23f5fe2b993d","resolution":{"observed_at":"2026-08-07T04:31:32.218638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T23:57:16.980912Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22466","last_updated":"2025-06-18T15:30:20Z","snapshot_observed_at":"2026-08-09T22:36:59.472398Z","submitted_at":"2025-06-18T15:30:20Z","title":"Conversations with Andrea: Visitors' Opinions on Android Robots in a Museum","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:16.980912Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.22466"},"observation_digest":"sha256:b33db7f4d96cc0e5ef6b0a244e0c724cc7e9a2355ebd6f8e3515bec28e845513","observation_id":"4f04612a-9ca2-4627-be6c-f3e8eaa918b1","resolution":{"observed_at":"2026-08-06T23:57:16.980912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T22:03:18.895300Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22846","last_updated":"2025-06-28T10:59:42Z","snapshot_observed_at":"2026-08-08T18:21:12.144688Z","submitted_at":"2025-06-28T10:59:42Z","title":"Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:03:18.895300Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.22846"},"observation_digest":"sha256:99eeb965e35af42220900ff8dd96d5667a7ad39869e5aa2816ca3c50a169ce58","observation_id":"a54531ca-2667-4c2e-8e03-44a0c2ebe267","resolution":{"observed_at":"2026-08-06T22:03:18.895300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T22:03:39.096442Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22858","last_updated":"2025-06-28T11:41:36Z","snapshot_observed_at":"2026-08-06T21:54:47.899893Z","submitted_at":"2025-06-28T11:41:36Z","title":"Mind the Gap: Entity-Preserved Context-Aware ASR Structured Transcriptions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:03:39.096442Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.22858"},"observation_digest":"sha256:f0399de1161bb5a358f4273e1d87696a834f373ec73c8126b3026032eb02c8ba","observation_id":"137ae469-8815-4f1c-9b43-7c514257771e","resolution":{"observed_at":"2026-08-06T22:03:39.096442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T21:55:54.575759Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23049","last_updated":"2025-06-29T01:13:15Z","snapshot_observed_at":"2026-08-09T21:29:17.173499Z","submitted_at":"2025-06-29T01:13:15Z","title":"AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:55:54.575759Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.23049"},"observation_digest":"sha256:452eac42bf4f3e3c05b1d67f74848c9af1570a8fe2d9b58b52e2fba2975d881c","observation_id":"13a632cc-e96a-46d8-820f-e45d952320fc","resolution":{"observed_at":"2026-08-06T21:55:54.575759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T21:51:35.718054Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-09T15:45:24.880266Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.718054Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:12266022c16640d3694f5e939eb1048d45d1c342e2712fb116ebda36f2a7787d","observation_id":"155da7b2-5768-40fa-a998-96514840291a","resolution":{"observed_at":"2026-08-06T21:51:35.718054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T21:38:44.378445Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.378445Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:da476e99771b8fdf029d70cabd16b1be3d2b9d47e0a9859ad92fefd92648577d","observation_id":"454caf69-4c5d-4748-8eef-257f5696f746","resolution":{"observed_at":"2026-08-06T21:38:44.378445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T20:59:47.174249Z","title":"http://doi.org/10.54941/ahfe1003158 Radford, Alec & Kim, Jong & Xu, Tao & Brockman, Greg & McLeavey, Christine & Sutskever, Ilya","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01274","last_updated":"2025-07-02T01:19:32Z","snapshot_observed_at":"2026-08-10T00:39:14.194268Z","submitted_at":"2025-07-02T01:19:32Z","title":"AI Meets Maritime Training: Precision Analytics for Enhanced Safety and Performance","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:47.174249Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.01274"},"observation_digest":"sha256:2f7f563d21e8e409beadbb69e8a82e7113a26fb0d55449f232d1d2d897bd1703","observation_id":"430e6464-070f-4b65-97e9-5592c608a025","resolution":{"observed_at":"2026-08-06T20:59:47.174249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T20:45:39.740292Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01931","last_updated":"2025-07-02T17:44:54Z","snapshot_observed_at":"2026-08-08T11:19:58.670442Z","submitted_at":"2025-07-02T17:44:54Z","title":"Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:39.740292Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.01931"},"observation_digest":"sha256:a8771817940c3284550c164b9ad9f8cb7d635b1ca91f9442226cf38539797b66","observation_id":"eb8410f3-ebf4-48a8-935b-b5172942e000","resolution":{"observed_at":"2026-08-06T20:45:39.740292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T22:42:23.077634Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02927","last_updated":"2025-06-26T01:54:02Z","snapshot_observed_at":"2026-08-10T20:07:41.708780Z","submitted_at":"2025-06-26T01:54:02Z","title":"A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:42:23.077634Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.02927"},"observation_digest":"sha256:134a37217726b9db8b1463cc45272a9ddd05fdb72f422d171c25afa45d3261c7","observation_id":"d8254148-5783-49b6-b7a7-bfba91d4b099","resolution":{"observed_at":"2026-08-06T22:42:23.077634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T20:10:38.210134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03556","last_updated":"2025-07-16T07:47:37Z","snapshot_observed_at":"2026-08-08T20:28:51.823568Z","submitted_at":"2025-07-04T13:09:08Z","title":"A Multistakeholder Approach to Value-Driven Co-Design of Recommender System Evaluation Metrics in Digital Archives","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:38.210134Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.03556"},"observation_digest":"sha256:2ed12517219355273e660afcab16052648e1d000b317bcef32dcc7a5069de1c2","observation_id":"d6393925-b0eb-4ac8-8324-8fe9fdeb1b18","resolution":{"observed_at":"2026-08-06T20:10:38.210134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T19:49:49.081002Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04598","last_updated":"2025-07-07T01:25:51Z","snapshot_observed_at":"2026-08-10T13:04:59.791527Z","submitted_at":"2025-07-07T01:25:51Z","title":"Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:49:49.081002Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.04598"},"observation_digest":"sha256:3b496f429178d495392748be8172cc7d240b4d111cae3005f5534adaf5b3d06d","observation_id":"a707dcb3-367b-43f9-80ab-79c83a0489a6","resolution":{"observed_at":"2026-08-06T19:49:49.081002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T19:42:02.363973Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04889","last_updated":"2025-07-07T11:23:20Z","snapshot_observed_at":"2026-08-07T08:41:40.870535Z","submitted_at":"2025-07-07T11:23:20Z","title":"Fine-tuning on simulated data outperforms prompting for agent tone of voice","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:42:02.363973Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.04889"},"observation_digest":"sha256:ca09fc1fc839df577114f01a7075c5d72fac51633be8b1b693fb646cceba8854","observation_id":"7ae0f467-f322-4e49-9d98-7ef88b704a61","resolution":{"observed_at":"2026-08-06T19:42:02.363973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T19:22:46.219396Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05729","last_updated":"2025-07-08T07:23:03Z","snapshot_observed_at":"2026-08-06T19:16:49.203758Z","submitted_at":"2025-07-08T07:23:03Z","title":"Non-Intrusive Binaural Speech Intelligibility Prediction Using Mamba for Hearing-Impaired Listeners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:22:46.219396Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.05729"},"observation_digest":"sha256:71462b869ab11da87583b3c845458cf513375c2c0d95ef33420fe8513d411270","observation_id":"ac687549-46e1-44fe-a6a3-79d5849eca00","resolution":{"observed_at":"2026-08-06T19:22:46.219396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T19:21:04.004618Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:04.004618Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:db7370d767e69c46baee6955344f946b30fef833705db4ae51e13ef3d3df0b71","observation_id":"5f89e426-80c3-4f7b-889d-7f0670e5d05c","resolution":{"observed_at":"2026-08-06T19:21:04.004618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T18:41:36.801092Z","title":"https://doi.org/10.48550/arXiv.2212.04356, https://arxiv.org/abs/2212.04356","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07550","last_updated":"2025-07-10T08:47:41Z","snapshot_observed_at":"2026-08-09T23:41:47.193200Z","submitted_at":"2025-07-10T08:47:41Z","title":"Pluri-perspectivism in Human-robot Co-creativity with Older Adults","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:41:36.801092Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.07550"},"observation_digest":"sha256:8b87bd38746028658b03f578a3e40bb976f93449748974c5b59d5d1652cbf0ce","observation_id":"25e6e748-9c27-4427-be00-9150bb52ee63","resolution":{"observed_at":"2026-08-06T18:41:36.801092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T18:33:18.191288Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07877","last_updated":"2025-08-01T20:13:43Z","snapshot_observed_at":"2026-08-10T06:56:37.390961Z","submitted_at":"2025-07-10T16:00:27Z","title":"Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:18.191288Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.07877"},"observation_digest":"sha256:807c057ce14969b43eb0277e38a2baeb1d744f94021cd275ada0d89b23c1b60b","observation_id":"dfd33c6d-b74f-4e6d-bd96-6d64dce2979e","resolution":{"observed_at":"2026-08-06T18:33:18.191288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T18:21:34.303507Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-09T04:59:19.398088Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:34.303507Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:4597a45081db68ae25f9880ef93fb7457bcc50e2db8028880b4c98d46fbd6875","observation_id":"af316edf-f4b4-4b89-a2d7-6e53281a4ac4","resolution":{"observed_at":"2026-08-06T18:21:34.303507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T17:45:45.153762Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10016","last_updated":"2025-08-20T07:04:41Z","snapshot_observed_at":"2026-08-09T19:39:54.419791Z","submitted_at":"2025-07-14T07:51:56Z","title":"The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:45:45.153762Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.10016"},"observation_digest":"sha256:13f09b020f6bb5257fdbb42b7c30ac4e3ba401124511126ba93e05942f60eb06","observation_id":"68529c00-d533-40f3-8fdb-19e8ed6916bb","resolution":{"observed_at":"2026-08-06T17:45:45.153762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T17:29:00.894627Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10860","last_updated":"2025-07-14T23:20:55Z","snapshot_observed_at":"2026-08-10T18:09:33.274577Z","submitted_at":"2025-07-14T23:20:55Z","title":"WhisperKit: On-device Real-time ASR with Billion-Scale Transformers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:29:00.894627Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.10860"},"observation_digest":"sha256:9b0a70492216709f793833def3800ef45ecd435ab9e361ca7ccea9d1725d7430","observation_id":"a0760c96-3840-4fce-95bc-eaa5a0ac0585","resolution":{"observed_at":"2026-08-06T17:29:00.894627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2507.12002","last_updated":"2026-05-12T02:53:11Z","snapshot_observed_at":"2026-07-06T21:57:59.765265Z","submitted_at":"2025-07-16T07:57:15Z","title":"Detecting In-Person Conversations in Noisy Real-World Environments with Smartwatch Audio and Motion Sensing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T05:02:30.603869Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.12002"},"observation_digest":"sha256:557983958a16e2492a5c618ec2249970429a0f21999fcf540f8c7ff211500aa5","observation_id":"b5f830ea-7fcd-4892-abf6-5845fed1ad37","resolution":{"observed_at":"2026-05-19T05:02:58.662409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:56:53.397036Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12252","last_updated":"2025-07-16T13:59:32Z","snapshot_observed_at":"2026-08-06T16:47:49.409409Z","submitted_at":"2025-07-16T13:59:32Z","title":"Improving Contextual ASR via Multi-grained Fusion with Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:56:53.397036Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.12252"},"observation_digest":"sha256:c5f2db5682dd2d561f33a5cf53777592b576c66f898834b9ac2b029fd76d62ad","observation_id":"574eee85-20ac-447c-a5d2-438fb3272c5f","resolution":{"observed_at":"2026-08-06T16:56:53.397036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:41:24.784828Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-09T11:41:57.492874Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.784828Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:710ccf62b340deeab2cd6e2e5352a3745dae40f72fc0b2e51db9dcd50d77fb47","observation_id":"42d7cc22-0da8-414d-a31f-95b64b67886d","resolution":{"observed_at":"2026-08-06T16:41:24.784828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:33:52.525067Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13155","last_updated":"2025-07-17T14:17:40Z","snapshot_observed_at":"2026-08-10T13:40:12.749786Z","submitted_at":"2025-07-17T14:17:40Z","title":"NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:52.525067Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.13155"},"observation_digest":"sha256:5861b4b515f9f25ad1a5dfa7b5ba28343e6c620343e20f35c52b2073e12436cd","observation_id":"67803a5b-440f-4008-8c96-5f47244dae01","resolution":{"observed_at":"2026-08-06T16:33:52.525067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:29:07.212256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13309","last_updated":"2025-07-17T17:29:45Z","snapshot_observed_at":"2026-08-09T21:36:20.357105Z","submitted_at":"2025-07-17T17:29:45Z","title":"FocusView: Understanding and Customizing Informational Video Watching Experiences for Viewers with ADHD","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:29:07.212256Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.13309"},"observation_digest":"sha256:79c1f2b4b1d0043dfe28ae21c1c23f43a53fbdb7604147892c398e639e977d68","observation_id":"b28d93b5-22fe-4116-87a3-e81d8192e779","resolution":{"observed_at":"2026-08-06T16:29:07.212256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2507.13563","last_updated":"2026-06-23T14:05:34Z","snapshot_observed_at":"2026-08-06T16:19:41.670843Z","submitted_at":"2025-07-17T22:41:40Z","title":"Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T03:42:32.087391Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.13563"},"observation_digest":"sha256:5582d979b222b2c2d64bbf2a2d86acd262cbc17c2699a64c831dfe3980eb99ce","observation_id":"98eb2d34-7471-4222-b28b-50ef5d3d83d4","resolution":{"observed_at":"2026-05-19T03:42:57.335437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:53:12.420252Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16836","last_updated":"2025-07-16T16:22:02Z","snapshot_observed_at":"2026-08-08T04:38:15.919357Z","submitted_at":"2025-07-16T16:22:02Z","title":"From Black Box to Biomarker: Sparse Autoencoders for Interpreting Speech Models of Parkinson's Disease","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:12.420252Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.16836"},"observation_digest":"sha256:55d11ba7721655afb411d3348b34bbe39f73bea93514f7f085a5b70eff0960e4","observation_id":"58adfa33-8e07-49cd-a60c-1edb99d576ea","resolution":{"observed_at":"2026-08-06T16:53:12.420252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T15:53:05.725398Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16843","last_updated":"2025-07-20T03:39:09Z","snapshot_observed_at":"2026-08-06T15:44:55.422896Z","submitted_at":"2025-07-20T03:39:09Z","title":"Weak Supervision Techniques towards Enhanced ASR Models in Industry-level CRM Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:53:05.725398Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.16843"},"observation_digest":"sha256:606b9245147cf4cc0d64f424da2717e145243064ed464ed981f4257f2cb31981","observation_id":"20b59c6f-0807-417e-80d1-a2def0804837","resolution":{"observed_at":"2026-08-06T15:53:05.725398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.04356/citation-record","integrity":"/paper/2212.04356/integrity","json":"/paper/2212.04356/citation-record.json","paper":"/paper/2212.04356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.2591652","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ﬁle number","venue":"Figshare","work_id":"11223eac-8fa3-41f3-a420-3e509d7391e0","year":2022},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:e4926fd8b90ad2c4c6e5efcf894ef77fcb2716ea577a1f5b8adb08f95781d694","observation_id":"61781080-c448-447f-8fc7-026510d051c5","resolution":{"observed_at":"2026-05-24T10:14:18.668420Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3c354efa-a822-4073-bc33-7e3ab1467b12","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:11602c47e7ba3ae4ed64ec21c49ff29d97c5cf9dc089ba685717e7af756ca348","observation_id":"5f4d4acb-031d-40db-980f-cd98729ed52f","resolution":{"observed_at":"2026-05-24T10:14:19.076523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b9e6107-da38-4c51-a398-db6fc8fb2cfb","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:1d6230d192f21185f814a14673f3041776fd4ac9e1182106c1279351ab622a8a","observation_id":"757b85d9-7666-4058-8a6a-fd54a6a1eb16","resolution":{"observed_at":"2026-05-24T10:14:19.080390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ff72c794-96fd-4ac6-a043-531d9a145ffc","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:5a2817bd4342f9bc303c2c9b48dba9fad914e413a026c7e8b7b96c1a87132699","observation_id":"86368a5c-e694-4932-9ae7-cc2bc0394a6b","resolution":{"observed_at":"2026-05-24T10:14:19.065035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d085b306-1f86-49f5-b2ac-7b83eeb1a1a8","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:9782a1f6a05f5e111feb06cbd3a5c6cf079c8b7f82f35bb0758c42f038f4f6cd","observation_id":"2cfb5b40-3877-4fd3-8de6-53a9468b4172","resolution":{"observed_at":"2026-05-24T10:14:19.072429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"042be44f-2e79-4512-a78b-61abc9da7a94","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:275eb5fef224d32d942e192617d87fe6fdbcb68d4208ae75367c09eddef4890e","observation_id":"ae76955c-c168-43e0-bedf-48187814673c","resolution":{"observed_at":"2026-05-24T10:14:19.068617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e742f495-fdcd-47a7-9e98-a8b4c7c6a7fa","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:63d8bb4421422053f402131c7c98694ed8e6243bace19f1fd5b93cc506cff138","observation_id":"f4aaf036-1856-4510-9e90-ead9e6f40212","resolution":{"observed_at":"2026-05-24T10:14:19.094208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ten thousand dollars","venue":null,"work_id":"9f78807d-ef68-4b62-9995-c08b45330b2b","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:cf8e61a97e2de6a803927c0d738fb73e2a9c1803e8c92c06dd0ee0a0ba061c19","observation_id":"78e3db12-ddb6-4054-8746-9d49369dd073","resolution":{"observed_at":"2026-05-24T10:14:19.097962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e52aae6f-77ba-4efb-8c26-097ec9a4f949","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:17ebbe6f942f64d61f0d1eee681fecca71dbdd880c77bee6dc485574f861d57a","observation_id":"f6be1ece-56f6-499a-b792-a5b6824af10f","resolution":{"observed_at":"2026-05-24T10:14:19.061475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ac321e4-905a-407f-afdf-125faa1a315f","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:24a2786898e28d89e1c1af4dcfc58a97ed51d76640e5536479863ad353c0773c","observation_id":"fac8fe65-1d88-46cd-9160-810fde870e25","resolution":{"observed_at":"2026-05-24T10:14:19.091159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"318a1387-56ed-42f4-8e46-f6675856f98e","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:8160f19fc831f63102f94aef20d524c9a5cc209fa8d0761f94d94afa194edcea","observation_id":"3478da73-e72c-4689-9d70-d740b11e45e2","resolution":{"observed_at":"2026-05-24T10:14:19.084234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca6d3077-1f66-4aff-a558-6b8a769942bf","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:bc1f310ba719dd71fa8be9cec028267e3753dd124ce3d7ceba2c050eea074058","observation_id":"4e2f6698-1e71-4cc2-abc4-ad326a53951d","resolution":{"observed_at":"2026-05-24T10:14:19.046686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3b4ac958-f085-4e3d-80aa-06f5ffc7b5c8","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:ae7290d16181311e7fd826e6fa9697333fa34ca95111e79f7c65eb694646db23","observation_id":"cece95c8-ffc8-40af-9c5d-9438189560a2","resolution":{"observed_at":"2026-05-24T10:14:19.087489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"when the Unicode category of each character in the NFKC-normalized string starts with M, S, or P","venue":null,"work_id":"75512f4f-de9f-41d2-b6cd-6f285bf1c14e","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:6e16d69cdc0d1d5ac574a17678954d87cdb8a27f210cacb80c8212458564f662","observation_id":"f84b9375-4576-450f-b101-fa52eb5668c9","resolution":{"observed_at":"2026-05-24T10:14:19.056636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f4674750-53e0-4243-a775-78836e2dd6cb","year":null},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:fd819ad6e8a624e026d855103aa1fcd6479f61f046570fd711316ae9b33470dd","observation_id":"3f3bbae0-3ce6-4c80-9cd1-98b0d28333b9","resolution":{"observed_at":"2026-05-24T10:14:19.049852Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34091824-2c0e-4a6b-8f1e-579d7e072f8e","year":1988},"citing_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T10:13:51.001946Z"},"links":{"citing_paper":"/paper/2212.04356"},"observation_digest":"sha256:e28a7fafb96a03919178ca8bc46225d36f67d5e16f05d5512de6e8c9304fd51c","observation_id":"51a45dff-b5ce-4992-ad0c-3ce67a589859","resolution":{"observed_at":"2026-05-24T10:14:19.053117Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":11,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 100 inbound Pith citation observations for arXiv:2212.04356."}