{"as_of":"2026-08-09T13:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8380ff3975e30e0b94e14ba88fb9836253600c6179bcbebb5deb3ea7b8beef5","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:18:01.686274Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:51:15.098039Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T22:52:44.973580Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2505.22251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22251","snapshot_observed_at":"2026-06-28T22:52:44.973580Z","title":"Evaluation of llms in speech is often flawed: Test set contamination in large language models for speech recognition","venue":null,"work_id":"1c3cb60f-fb00-4678-a5e8-e7485c30c7dd","year":2025},"citing_paper":{"arxiv_id":"2601.12248","last_updated":"2026-05-10T16:47:20Z","snapshot_observed_at":"2026-07-06T22:42:03.665045Z","submitted_at":"2026-01-18T03:55:28Z","title":"AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:17.935630Z"},"links":{"cited_paper":"/paper/2505.22251","citing_paper":"/paper/2601.12248"},"observation_digest":"sha256:57d98220d95dba88ad2a8d24e5d5587c138bf5819aae92f8987a669b36b00a5e","observation_id":"57f39226-af22-4d2e-bf6f-cf48af4400e7","resolution":{"observed_at":"2026-05-16T14:07:58.664363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2505.22251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22251","snapshot_observed_at":"2026-06-28T22:52:44.973580Z","title":"Evaluation of llms in speech is often flawed: Test set contamination in large language models for speech recognition","venue":null,"work_id":"1c3cb60f-fb00-4678-a5e8-e7485c30c7dd","year":2025},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-05T12:06:36.882921Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2505.22251","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:f388588741836e30058f5083660465d2e7f1fbd3cc5050a25466c963f56c0b47","observation_id":"a74ba727-e03f-42d1-a4b3-ce8ce35bf26d","resolution":{"observed_at":"2026-05-12T00:41:26.371213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2505.22251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22251","snapshot_observed_at":"2026-06-28T22:52:44.973580Z","title":"Evaluation of llms in speech is often flawed: Test set contamination in large language models for speech recognition","venue":null,"work_id":"1c3cb60f-fb00-4678-a5e8-e7485c30c7dd","year":2025},"citing_paper":{"arxiv_id":"2606.07608","last_updated":"2026-05-29T13:43:57Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T13:43:57Z","title":"Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:51:15.098039Z"},"links":{"cited_paper":"/paper/2505.22251","citing_paper":"/paper/2606.07608"},"observation_digest":"sha256:507ef9220e0bebe84df1d3510a20d3a35f7c3cb46559408ad96ac431beca10f0","observation_id":"7dcc69a9-dd97-4fa6-aa8c-2094b28938bd","resolution":{"observed_at":"2026-06-28T22:52:44.975160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22251/citation-record","integrity":"/paper/2505.22251/integrity","json":"/paper/2505.22251/citation-record.json","paper":"/paper/2505.22251"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.929100Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":"fae5531e-1a70-483f-8732-a596fac0cf76","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.672482Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:4c572e96546280e0617252c3777906110055c71be4c902b151bc1ec55a12473f","observation_id":"e51946b5-eedc-4742-9706-00bb3ea0841f","resolution":{"observed_at":"2026-08-07T13:18:06.007622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.755986Z","title":"Salsa: Speedy asr-llm synchronous aggregation,","venue":null,"work_id":"c9af80d5-cebb-4fae-adee-6553fe088fa1","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.773788Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:9971e9f36a14476e15812c5b26d9fb7cc813918a1024facac170811e40575c32","observation_id":"82ca8082-c047-4b76-aa76-599ae9d6f911","resolution":{"observed_at":"2026-08-07T13:18:05.832740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.573615Z","title":"Delayed fusion: Integrating large language models into first- pass decoding in end-to-end speech recognition,","venue":null,"work_id":"49aa09c9-a421-429d-aff8-ae31b6f13de1","year":2025},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.878148Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:62940b0df43ea876b02324e83bc6814554c6c3f3bab29559f756582a1e5434c7","observation_id":"e5c9e119-9eac-45d8-a44e-e4032f22e4fb","resolution":{"observed_at":"2026-08-07T13:18:05.655581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14259","last_updated":"2025-06-11T17:09:58Z","snapshot_observed_at":"2026-08-07T05:58:57.740955Z","submitted_at":"2024-05-23T07:39:42Z","title":"Let's Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14259","snapshot_observed_at":"2026-08-07T13:17:57.992010Z","title":"Let’s fuse step by step: A generative fusion decoding algorithm with llms for multi-modal text recog- nition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.992010Z"},"links":{"cited_paper":"/paper/2405.14259","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:5b3efb0d8d683ba267f5da6d0a4065a1e640781577bcd7590052a0465d603c72","observation_id":"a97d9d19-e543-44ee-8123-a8ea3890fc73","resolution":{"observed_at":"2026-08-07T13:17:57.992010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02248","last_updated":"2024-06-14T17:57:13Z","snapshot_observed_at":"2026-07-06T16:42:57.571795Z","submitted_at":"2023-11-03T21:47:03Z","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02248","snapshot_observed_at":"2026-08-07T13:17:58.104459Z","title":"COSMIC: Data efficient instruction-tuning for speech in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.104459Z"},"links":{"cited_paper":"/paper/2311.02248","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:56ffb3e9e7c2bd6eec2541dae5ff71288223aeb50c1945cf5e75f91ecb7b7d83","observation_id":"30f794d4-eb9c-47e0-a134-779f495bdd9f","resolution":{"observed_at":"2026-08-07T13:17:58.104459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.404322Z","title":"On decoder-only architec- ture for speech-to-text and large language model integration,","venue":null,"work_id":"d7209199-02bd-4bcc-8e0c-91499a98efb0","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.185843Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:1126992ef2d5b25b0650897f3771e3c194bd25265ce7ed6a9d38871398886a54","observation_id":"1848cb06-81ef-41d0-ae81-f904473fe067","resolution":{"observed_at":"2026-08-07T13:18:05.481616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04172","last_updated":"2023-09-29T07:32:03Z","snapshot_observed_at":"2026-07-06T15:51:50.675471Z","submitted_at":"2023-07-09T13:38:25Z","title":"Can Generative Large Language Models Perform ASR Error Correction?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04172","snapshot_observed_at":"2026-08-07T13:17:58.378986Z","title":"Can generative large language models perform asr error correction?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.378986Z"},"links":{"cited_paper":"/paper/2307.04172","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:17874465bc56725b52142cf0e2a4bb6b5606c774cc4066857d9ca1d9c45c6f42","observation_id":"f2334377-8217-4782-9570-370dd76bed53","resolution":{"observed_at":"2026-08-07T13:17:58.378986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.160165Z","title":"Contextual spelling correction with large language models,","venue":null,"work_id":"7a646f77-f793-4598-ad3c-fc16dae6ad18","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.491470Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:00e03f768664a9e2b53af6c3f92237dc63b4851d4683e35b581345a357406a1e","observation_id":"579a16f0-cc67-44db-8fc6-063faad13915","resolution":{"observed_at":"2026-08-07T13:18:05.269833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:58.590808Z","title":"Denoising LM: Pushing the limits of error correction models for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.590808Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:1dd28b9ce4f1f50b050180aa120538aecf81c2108076bf81b059361ef07d2861","observation_id":"bd9d0c1a-9bd8-4a7b-af49-08c078b1c8bc","resolution":{"observed_at":"2026-08-07T13:17:58.590808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.975806Z","title":"NLP evaluation in trouble: On the need to measure LLM data contamination for each benchmark,","venue":null,"work_id":"c8f601c2-c5e0-49e3-85bd-b10d8660c894","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.719183Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:4f1aa08ab996b16598ea1e3705bcfe680320294aa49535936e2f4557df5bbf72","observation_id":"20558f48-2ba2-4662-9ace-e767da79a8bc","resolution":{"observed_at":"2026-08-07T13:18:05.065536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.840777Z","title":"Data contamination: From mem- orization to exploitation,","venue":null,"work_id":"2f2545e0-7b6f-4aad-aae1-c0b83abf884e","year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.845669Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:41ef1d0b705637b97c0cd5771215c75d065a82ceef90973e39e0ca92bc237e1d","observation_id":"a5fbcd1b-5a4b-473f-92be-3d3fc27230e3","resolution":{"observed_at":"2026-08-07T13:18:04.910943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.670717Z","title":"Leak, cheat, repeat: Data contamination and evaluation malpractices in closed-source LLMs,","venue":null,"work_id":"2d6e1315-7064-4c5e-87bf-9b308bbfde8e","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.921580Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:99aac7dc4dc049df5b56594f7f20ff88727802ac2037ec2c2de9574513aa2ce7","observation_id":"d0f92251-4b5d-4cd0-9784-3197c3cb07ae","resolution":{"observed_at":"2026-08-07T13:18:04.742613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.502685Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"47ddf890-94c6-4995-aff2-9939a75d6f5c","year":2015},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.019387Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:9a0b310f0bdb7da5a0a6999a80538343effff2fac0528be6b30f10adf1f4a6c3","observation_id":"2cb5b22d-a54c-4581-8366-baa3bdd85dfa","resolution":{"observed_at":"2026-08-07T13:18:04.572516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.399937Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":"379d3ad6-d66c-4a1f-90fd-045ed3292ab0","year":2020},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.145288Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:aeac1d13cc831c4921cae7127b633ec73d4f90e9057eb0278b1679c1d16fae3e","observation_id":"e27156b0-dd5c-40d6-ac32-2675cfb83de5","resolution":{"observed_at":"2026-08-07T13:18:04.448183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:17:59.257220Z","title":"The Pile: An 800GB dataset of diverse text for language modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.257220Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:6b0e5635c497a0a3682285db71f52e63cd78cd45189798979c766fc403c74bef","observation_id":"66807b87-4d71-456c-b571-8ab88bb88c99","resolution":{"observed_at":"2026-08-07T13:17:59.257220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.255581Z","title":"Comparing discrete and continuous space llms for speech recognition,","venue":null,"work_id":"7f50d5ea-c850-45a7-bcaa-8d376aa8067d","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.330018Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:da82317501957fc15ca26f3f46bcdbdb685d70f77ee40e4d7a6662d9a9c0ea0e","observation_id":"ae18e7e6-64e0-4c1d-bd23-23fa1a04c57a","resolution":{"observed_at":"2026-08-07T13:18:04.342946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.004153Z","title":"Connecting speech encoder and large language model for ASR,","venue":null,"work_id":"860ab910-3852-4c6b-8729-e47cdec47658","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.495385Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:2c6ccc832e2d5a0c2a2efd95576790756583af577836ff30ac4d40d0feb0d394","observation_id":"47c931db-4bf3-46f6-aa78-2b90cefacb9d","resolution":{"observed_at":"2026-08-07T13:18:04.063947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T13:17:59.596297Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.596297Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:67df64e49d5a494067e7492ebc931c5d5440acebbb3476544849fb3aed816304","observation_id":"d87d8bc6-a3bb-4405-8617-b3fdbe805c69","resolution":{"observed_at":"2026-08-07T13:17:59.596297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T13:17:59.761074Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.761074Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:a5fc83ba336dbb50b2b42b38aec9555fc500a5fb22dd39915c1d258a2e38fb86","observation_id":"0901f8d5-522a-4fc3-9a6d-41b30ebce6f4","resolution":{"observed_at":"2026-08-07T13:17:59.761074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03752","last_updated":"2024-10-02T01:54:35Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-02T01:54:35Z","title":"Efficient Streaming LLM for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03752","snapshot_observed_at":"2026-08-07T13:17:59.819028Z","title":"Efficient streaming llm for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.819028Z"},"links":{"cited_paper":"/paper/2410.03752","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:3678279ad6f3775443422e1c0e5280dec11415d5cd409b3102a3015dffa2e77f","observation_id":"a7b04456-488c-47da-9c15-3d516c30a64f","resolution":{"observed_at":"2026-08-07T13:17:59.819028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.893920Z","title":"Ctc-assisted llm-based contextual asr,","venue":null,"work_id":"39a82c37-123d-4b5a-b791-4f936a649090","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.878246Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:dd1d302f903fae74abfe19b0069405d3a8cbd35d8d0261ffae787f52c275c9ed","observation_id":"0dc9d712-d060-4667-a2c6-104c24596087","resolution":{"observed_at":"2026-08-07T13:18:03.950181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.752042Z","title":"The bigscience ROOTS corpus: A 1.6TB composite multilingual dataset,","venue":null,"work_id":"a98e9c79-7d57-49b0-8048-c5d047bcd464","year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.974379Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:9f3bf6bc832523473ee9c42c65a099e39ac2f083cf5a6d93724a6f5bea35cb62","observation_id":"93838fd6-cedd-4eff-9577-2989b3746f90","resolution":{"observed_at":"2026-08-07T13:18:03.828371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.643084Z","title":"RedPajama: an open dataset for training large language models,","venue":null,"work_id":"4e8ab574-0baf-4797-a76e-1a07d4e842b4","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.145791Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:4982bbfeb4dd2b868a891063a1afde659ec6ee2fd976591aa309d14b480e3b24","observation_id":"813bbacb-f1be-4c2e-a6b9-3ceb4ffffae6","resolution":{"observed_at":"2026-08-07T13:18:03.691614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.490943Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research,","venue":null,"work_id":"ce2e53b3-1c7f-45ce-8a19-c952b875f0c5","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.241349Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:cf167469880f6c614a2f0368d4ad49ca9a42a55ddff3ec207740b89942e15b9f","observation_id":"9508cdb2-5227-4d14-89d6-c753b08e84fa","resolution":{"observed_at":"2026-08-07T13:18:03.572575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-07T20:30:00.414611Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-08-07T13:18:00.321479Z","title":"LLM360 K2: Building a 65B 360-open-source large language model from scratch,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.321479Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:98b96eb6015e3756f8120467a5f851453d5f0faeaacc4d291e35e86d906de368","observation_id":"bca93d8b-50e0-40af-ae8a-631cc3c33fcc","resolution":{"observed_at":"2026-08-07T13:18:00.321479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:18:00.418973Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.418973Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:750fee002aa948727e81891eb9fe465c383f4b36e4ec82c6b214f11118f694e1","observation_id":"dac2a22a-6122-4127-b0af-09d970d02d07","resolution":{"observed_at":"2026-08-07T13:18:00.418973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:18:00.496111Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.496111Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:d3cb2540709901a1f67ede6570e02fe6aed3a4bc7b1254f2fdf2c9a9e6850921","observation_id":"fe0a6792-3ef8-4a52-bd2e-d1347e81dd8e","resolution":{"observed_at":"2026-08-07T13:18:00.496111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:18:00.592114Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.592114Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:4f28c28c0d66653cf703c1eacf68231d7e5198bfb2fcbdff4f0ea0ecddb7c0e5","observation_id":"ae8ac505-2c60-4ce1-a392-e459fc14b16d","resolution":{"observed_at":"2026-08-07T13:18:00.592114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.300881Z","title":"Leskovec, A","venue":null,"work_id":"76228c04-12e8-4573-ab92-0088ed7c7d66","year":2014},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.715018Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:19760784629a802489ad34cc3afcd447cd582dda17c534169c68679f9dff79b4","observation_id":"d1012a3e-8e98-4224-8bb6-a5961c78016d","resolution":{"observed_at":"2026-08-07T13:18:03.390008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.127861Z","title":"Benchmarking non- parametric statistical tests,","venue":null,"work_id":"293f04c3-c8e7-4610-9623-e1703c642092","year":2005},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.810541Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:2675a018d6568ee7b94856a4903b468b16df31d6dedd706116e85b230fd5c390","observation_id":"963276c5-1b92-4756-ae75-7220c0c22c4b","resolution":{"observed_at":"2026-08-07T13:18:03.213721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:00.895479Z","title":"Confidence intervals for evaluation in machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.895479Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:e4dee91e6d323db9d989a388cb82a1b2529d0d50e99d59b069a90448e3e04aa2","observation_id":"3e11ba02-3e84-4659-b8b7-06f2db9663c4","resolution":{"observed_at":"2026-08-07T13:18:00.895479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.916394Z","title":"Pythia: A suite for analyzing large language models across training and scaling,","venue":null,"work_id":"9069fb41-417e-4235-b0cc-c3c67d9d73fc","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.017697Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:b81d382b3895185da8178e095223843c501e4c603dce09402837c637e2d4b07a","observation_id":"2ca12751-7f35-42c3-9e4d-f0963c7c566a","resolution":{"observed_at":"2026-08-07T13:18:03.032271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.778769Z","title":"GPT-NeoX-20B: An open-source autoregressive language model,","venue":null,"work_id":"850f8503-c53e-4935-9520-687e904657c5","year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.144965Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:3d14aa8736098c18b1896d0a45d3cbfb12ce3705167605845bad63778950624b","observation_id":"987ac905-bc74-4c2f-9c94-179b75bebcc4","resolution":{"observed_at":"2026-08-07T13:18:02.840529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T13:18:01.230964Z","title":"OPT: Open pre-trained trans- former language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.230964Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:d2c845d40bca10444e301376ac182693972631e2bbdf784b877212037b6ddd2d","observation_id":"72c03d69-2317-4751-a8c3-9cb4bce3e637","resolution":{"observed_at":"2026-08-07T13:18:01.230964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.616907Z","title":"OLMo: Accelerating the science of language models,","venue":null,"work_id":"e0fbf484-7abd-4ca2-a784-547a87892e95","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.319044Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:f32bcafe3debf3d660c71ab0af964455f53382ce2c6dddc299a47dcfaf6f214f","observation_id":"f7103772-83af-47fd-a90e-5ef74418b67d","resolution":{"observed_at":"2026-08-07T13:18:02.677131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.387752Z","title":"The secret sharer: Evaluating and testing unintended memorization in neural networks,","venue":null,"work_id":"3d241310-723a-49d3-9aa7-27b1b40d4181","year":2019},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.409238Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:03ff15b19e137a4f575be0296ac4cbdbf52b48253ea77fb04597ecd751dc1390","observation_id":"532a5e63-10f6-4de3-a0a2-77984b0eeef9","resolution":{"observed_at":"2026-08-07T13:18:02.534516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.268553Z","title":"Open- source conversational AI with SpeechBrain 1.0,","venue":null,"work_id":"056244ff-15f2-4a5a-bf2b-98a5b31c2a8e","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.500777Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:956af9a870f29be5da3e1c9f72c63e3550d318b0bb5f10282d2bae99035902cc","observation_id":"21b8daf0-bacf-4925-9322-a8e58f77506c","resolution":{"observed_at":"2026-08-07T13:18:02.316139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:01.593951Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.593951Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:46480ad72e773e0ccac633b76b12a4521497e1ff63a144762a943c57e0b7ce4d","observation_id":"69c183be-540d-4daf-9b3c-65659e666f3c","resolution":{"observed_at":"2026-08-07T13:18:01.593951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.022210Z","title":"SpecAugment: A simple data augmen- tation method for automatic speech recognition,","venue":null,"work_id":"a8c7ccbe-b891-4cc7-9321-8667401299d7","year":2019},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.686274Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:6b49dee1b01676ce8f9d037b11399455b1f489cb0520fa5b8230c71c16e040a4","observation_id":"50495929-d525-42b5-8230-3f8f68f3cb4a","resolution":{"observed_at":"2026-08-07T13:18:02.141680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2505.22251."}