{"as_of":"2026-08-23T04:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86e5a645c96d1d2108c6f0eb5c66f5e0c85d5a525a55a9ff5df0b4053e8c8d5c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T07:53:41.580597Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08409/citation-record","integrity":"/paper/2607.08409/integrity","json":"/paper/2607.08409/citation-record.json","paper":"/paper/2607.08409"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.322003Z","title":"Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence (artificial intelligence act),","venue":null,"work_id":"ce484b8c-51f5-4f81-9231-29a174b67897","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:c72f52401c657c72e150d5e6decc968453b0385c37c8e408f853acc8eb992ab6","observation_id":"6d2f0160-1ba9-4238-914e-185420186d46","resolution":{"observed_at":"2026-07-10T07:56:58.323350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.323910Z","title":"Generating synthetic audio data for attention-based speech recognition systems,","venue":null,"work_id":"88b8b30b-72b6-4b42-b2c2-35e1302011b3","year":2020},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:431505f76256ba57193b86b2c1f10382ea1e44833eee58fc822d6d1deb5292d3","observation_id":"2b098f63-c488-4a2c-8688-c0ab4b5f2c62","resolution":{"observed_at":"2026-07-10T07:56:58.325129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.318127Z","title":"Speech recognition with augmented synthesized speech,","venue":null,"work_id":"b2749d63-740c-4387-8860-09e07121b79b","year":2019},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:7e531a1479f98feb96de10ee284a8e53354096f3481de89caf7e716284393d27","observation_id":"b41d03eb-2f1c-41d8-bada-1edaa7a6e4ec","resolution":{"observed_at":"2026-07-10T07:56:58.319413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.320034Z","title":"Large-scale self- and semi-supervised learning for speech translation,","venue":null,"work_id":"baf0d0f3-f93b-416a-8f46-2daed6d331a1","year":2021},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:e99f238794825a49e410b2f646736b9d1bc2178d36eec69d0db6aaa0c1aeab24","observation_id":"9059d399-3a65-4fd9-9270-91cd54882b82","resolution":{"observed_at":"2026-07-10T07:56:58.321309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16726","last_updated":"2024-10-22T06:25:16Z","snapshot_observed_at":"2026-08-16T13:07:07.378047Z","submitted_at":"2024-10-22T06:25:16Z","title":"Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap","version":1},"cited_work":{"arxiv_id":"2410.16726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16726","snapshot_observed_at":"2026-07-10T07:56:57.827938Z","title":"Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap","venue":"eess.AS","work_id":"5db490e3-efaf-4b5c-bac4-9962fa2eb175","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2410.16726","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:ef428b642a1f9b3da629ecd4ecbb42bc8d16ad5de0e8ddd843d74b19ddbb8e2f","observation_id":"3e0978d7-fa3b-425c-89df-3003fe01e696","resolution":{"observed_at":"2026-07-10T07:56:57.829232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21631","last_updated":"2025-08-29T13:46:41Z","snapshot_observed_at":"2026-08-16T18:12:13.980936Z","submitted_at":"2025-08-29T13:46:41Z","title":"Towards Improved Speech Recognition through Optimized Synthetic Data Generation","version":1},"cited_work":{"arxiv_id":"2508.21631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.21631","snapshot_observed_at":"2026-07-10T07:56:57.825364Z","title":"Towards Improved Speech Recognition through Optimized Synthetic Data Generation","venue":"eess.AS","work_id":"1f0d0fa5-b696-468a-b6e4-6806f9c0df65","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2508.21631","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:d5cb3cb9042569f9e57a2fade6a875895e1db8db5af2867a7f6cfaf02ee0deb5","observation_id":"36576cbb-e42f-4060-95a7-18dba3e13d27","resolution":{"observed_at":"2026-07-10T07:56:57.826693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.313733Z","title":"The state of TTS: A case study with human fooling rates,","venue":null,"work_id":"79009581-1f45-4f89-a26f-7d4ea599b80b","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:8e848e773b51bf1fdbd72df9f29cf856781dc309b9db93a75f689dc17a67f0b4","observation_id":"c31764ed-5702-49e6-8969-82a78a3b2925","resolution":{"observed_at":"2026-07-10T07:56:58.315091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.316157Z","title":"Task arithmetic can mitigate synthetic-to-real gap in automatic speech recognition,","venue":null,"work_id":"13c393bd-1fca-4b3e-8414-19c011118674","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:7ec7ae9b3d1affba172fcff895266425c9ee4dc1d38555e88751251dc834f5c9","observation_id":"5fabd68f-94ba-42b1-9f5d-33d2840073a4","resolution":{"observed_at":"2026-07-10T07:56:58.317437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11130","last_updated":"2025-06-16T15:47:41Z","snapshot_observed_at":"2026-08-07T04:54:43.738701Z","submitted_at":"2025-06-10T17:30:32Z","title":"A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data","version":2},"cited_work":{"arxiv_id":"2506.11130","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11130","snapshot_observed_at":"2026-07-10T07:56:57.825825Z","title":"A self-refining frame- work for enhancing asr using tts-synthesized data","venue":"cs.CL","work_id":"73a675bd-873c-4c68-ae94-7772f8941f1b","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2506.11130","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:fdc975498f5a2125f3b62c655f9020072603d1f69111d416f1726b99e9def8a0","observation_id":"f4c1c24d-f962-49e2-a2e3-79a370005f00","resolution":{"observed_at":"2026-07-10T07:56:57.826984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-08-15T14:29:36.597543Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":2},"cited_work":{"arxiv_id":"2606.29031","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.29031","snapshot_observed_at":"2026-07-10T07:56:57.828325Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","venue":"cs.CL","work_id":"06ca5eb5-d495-496e-9375-58ac09c11e7d","year":2026},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2606.29031","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:166041e70ae1a7a9c796369dc67a04f513af07da2423d5127b5e26e3d4ac3a70","observation_id":"c2abd48f-f4fa-468a-9e1c-512b24dcdda1","resolution":{"observed_at":"2026-07-10T07:56:57.829489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.325738Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"eb2f0926-8e95-4030-8ff0-6bd2a2c44fb1","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:e87ac76c46e46a3cc7e8c15bee8873b4ceb051e80bd80547283f2cf40d79aba3","observation_id":"0ca392a6-8f08-4e5e-a3d3-ba827f5cfc04","resolution":{"observed_at":"2026-07-10T07:56:58.327093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:4fa0a2eacf86a7d03acb256198d598c32d5c6c83e96703d45342c41eb359bbbc","observation_id":"b157b81f-cfcf-4579-aadc-ba99a1e431fd","resolution":{"observed_at":"2026-07-10T07:56:57.834713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-21T19:19:25.551780Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:769361667b2a118e318dddf934cf2aa4645d15d96aced25b2a43b91c7dc5445c","observation_id":"f8a95b65-001a-4544-bf80-7d7c79d6f798","resolution":{"observed_at":"2026-07-10T07:56:57.817961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-16T14:18:48.581750Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":"2402.08846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-07-10T20:37:34.440026Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity","venue":"cs.CL","work_id":"d0cf5313-bc88-4f8f-9a2c-9012a25a93dd","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:f9ee49158925c73fdd4d0dc9ece413a5b40dde5b75b6b81b69235073b5327a17","observation_id":"c72269b7-e68e-40fd-9e73-4195f71fe3d5","resolution":{"observed_at":"2026-07-10T07:56:57.809471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.305114Z","title":"Speech recognition meets large language model: Bench- marking, models, and exploration,","venue":null,"work_id":"4dfbee89-8907-45b7-b829-794ac7508d1c","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:05b7183544a15c63b2ae841cb7c6b738cdf9c00c7f75c0bb5b22ae8579cd53a2","observation_id":"224e70bf-6b13-4af4-b7c9-92632202a5db","resolution":{"observed_at":"2026-07-10T07:56:58.306366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.307020Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"357d9b97-de3b-485a-bd97-ec5f7d3a2070","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:60ec49460b3818683690692d641995a1b9ff2d56316268b016ecb3f9f7b469b0","observation_id":"88d686b5-5f02-4cde-8042-60da15189f84","resolution":{"observed_at":"2026-07-10T07:56:58.308311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":"2304.03277","doi":"10.48550/arxiv.2304.03277","metadata_source":"pith","pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction Tuning with GPT-4","venue":"cs.CL","work_id":"fd515477-f9f1-48aa-9feb-a3308e7656bb","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:9eaa46bbaec2ec55f2edc170c7f2b8d73f68f8e389b6dd473ee48ff2860f2e94","observation_id":"04e66afd-ec29-4976-ab4b-8c0ed4159e2b","resolution":{"observed_at":"2026-07-10T07:56:57.811678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.303218Z","title":"Zephyr: Direct distillation of LM alignment,","venue":null,"work_id":"21d4778c-6cbe-4e98-aca9-41d21b0cd248","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:942cdf1a7d6ddfc243fc7b57230e687db5c28cf9f9545be2a3c679b3bfdf48ac","observation_id":"ed36115c-c153-4b4b-bbe7-872ff1e280bb","resolution":{"observed_at":"2026-07-10T07:56:58.304446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.309109Z","title":"Value alignment from unstructured text,","venue":null,"work_id":"d03f5545-14ba-4578-abe1-fdc69ee56450","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:c8084d319ed4641f18059696ffc845561e0dbe0774163ef8996130d0564e6adf","observation_id":"49281c48-3377-4a50-bf74-4e0fdb88293f","resolution":{"observed_at":"2026-07-10T07:56:58.310442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.311011Z","title":"Direct preference optimization: your language model is secretly a reward model,","venue":null,"work_id":"dfe6f552-85cb-49e0-96f8-74f6c6760911","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:5767f2a2d00ce4ff2d27f3a7906d413dce447240b80a521bb6e0ae175768a148","observation_id":"fe82b4c4-ebd1-4bf2-877f-0eda5c55a8ba","resolution":{"observed_at":"2026-07-10T07:56:58.312875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:e9bea56489ba3273a510fa732ca682eccc651a9ada18e42016f1015fae6ebc2a","observation_id":"f3a59d63-a611-4162-a777-33dfe4f52644","resolution":{"observed_at":"2026-07-10T07:56:57.824071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.299281Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"52b86fdc-47c3-4b4e-8b09-73c0d21144e5","year":2022},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:2e4a9344c10d4872d58babf3a4ac90993ab061503319f3298a09d401ea83328d","observation_id":"63099adc-1895-483e-811c-dbc33e25f639","resolution":{"observed_at":"2026-07-10T07:56:58.300642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:42a887da1f39ec08fd0fd7dadbadce42e459305b6798293e1d10fb489c9c6fc8","observation_id":"4d82c231-3e0a-4781-863a-60949b6c7bc9","resolution":{"observed_at":"2026-07-10T07:56:57.831820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.290142Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"334f2580-9b7d-4a6a-b371-2879db47a373","year":2022},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:7a9e9b4c58534783887c9effa9996b8cc0ab9682106e6d2731b89dcda5041901","observation_id":"0a9a8986-b6bb-412c-b197-460adb92a205","resolution":{"observed_at":"2026-07-10T07:56:58.291705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-15T22:57:45.773661Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:1f36a78b6ed0a8da0112de791ff8a5d0c2843bb18316e073c4b5b05816e34ee6","observation_id":"340b2421-dfb1-4f33-9ea2-698fd130cfde","resolution":{"observed_at":"2026-07-10T07:56:57.824459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-08-13T02:49:58.912820Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:aba81dd3c75e91485b2d84c1800ba98ac88af1c3068c83529cb047811551c11d","observation_id":"4322a0cd-30d2-4255-9d7a-2bf039c87bbe","resolution":{"observed_at":"2026-07-10T07:56:57.808715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.292241Z","title":"Group relative policy optimization for speech recognition,","venue":null,"work_id":"b8a8ba14-39bd-4b67-9d5e-7b078c23da59","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:1e937fd3b5489c27f83f02ee7d8ee502c4d1c6545ae4b66636b97421bfded3f1","observation_id":"efa5c9c4-35e8-4d5c-9327-bbe47c4353a7","resolution":{"observed_at":"2026-07-10T07:56:58.296342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:57.819548Z","title":"Distilling conversations: Abstract compression of conversational audio context for LLM-based ASR,","venue":null,"work_id":"8b2b4e43-592b-469c-957e-515a39594cc2","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:bed9a2d62bfdb2df43ac5646fd71f5f7937e9dd70c0cc7124738a91f593d5cc0","observation_id":"eaa3bedc-f2da-4543-8e8f-7a0bd3dbe997","resolution":{"observed_at":"2026-07-10T07:56:57.821097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:57.804355Z","title":"Text-only adaptation in llm- based asr through text denoising","venue":null,"work_id":"8141632d-618f-41f0-b36f-ba855f3dfe04","year":2026},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:acc524190348213f607ac45cfb2de7a0316d0f5fe5ac7441cc03017284d1e18e","observation_id":"575c62b3-b2c8-47d8-88c2-b3e3ad08121b","resolution":{"observed_at":"2026-07-10T07:56:57.806207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.302263Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":"6408476c-cdab-4d0a-86e8-3bde951fc8d7","year":2015},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:222ce3aad6dcda548581e859cccd1cea845d6ba6bd38d6e014fb10c6c9e7f476","observation_id":"e37f1c4c-0d0d-4ef4-9ca8-fca8683ed75e","resolution":{"observed_at":"2026-07-10T07:56:58.303578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.319122Z","title":"Qwen3-TTS: V oice design,","venue":null,"work_id":"ea0516ce-a3f0-40cb-bbfd-ed4241d0680c","year":2025},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:b1f67f8e8d25fa559fac9581cf1743be326b20c37a51192884cd5c84d3cb87b6","observation_id":"c1f2ba59-82cc-407c-88b3-86f8f361b57a","resolution":{"observed_at":"2026-07-10T07:56:58.320312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.327645Z","title":"Building and evaluation of a real room impulse response dataset,","venue":null,"work_id":"da56d255-2d37-47fc-a9ff-43e890a4d672","year":2019},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:b1e12a2214a93f8b3c0bd37c1abd13b40ce2bfd818f42c598269522bb35bb954","observation_id":"1851c3a8-7fbc-4b7c-8293-bc070b33236e","resolution":{"observed_at":"2026-07-10T07:56:58.329122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.301302Z","title":"pyannote.audio 2.1 speaker diarization pipeline: Principle, benchmark, and recipe,","venue":null,"work_id":"965bd81f-9f3e-406b-9458-fe15adafc834","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:82f76289c10b03c99f6338e797f0f11087fc71e3d32ab33c90eb02f49ed8b58c","observation_id":"65949cb1-477c-4044-9ee3-f38bf82446ba","resolution":{"observed_at":"2026-07-10T07:56:58.302549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.297060Z","title":"C-Pack: Packed resources for general Chinese embeddings,","venue":null,"work_id":"60220c87-2183-480e-b89c-3ceec630f86a","year":2024},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:d218c6eaf0570a608e2fe3798ba0c4d4cdd91a52fce01437842b5f8781681d8d","observation_id":"72550ea0-63dd-47ef-8024-0b5d8f7b6cd7","resolution":{"observed_at":"2026-07-10T07:56:58.298407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T18:32:53.947470Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":20},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.08409."}