{"as_of":"2026-08-08T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a1fa89405be98e597256c4aab25a0ce3788e93758cc7a486cbb4744e3be2170","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:26:32.594986Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.09366/citation-record","integrity":"/paper/2606.09366/integrity","json":"/paper/2606.09366/citation-record.json","paper":"/paper/2606.09366"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:efb554af2fc1426875bdd6f17a3293eb0df7844e6bbbe00af324ea0fad2f0239","observation_id":"4ba04366-f80d-42f3-b828-93d0309bccac","resolution":{"observed_at":"2026-07-03T01:37:30.605027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:0113ed93878f574defbbacbd468bf7150acdffb8b15e57d62d5e5784fd68923e","observation_id":"45bd6074-46ad-4a75-924d-cdddcf3a4728","resolution":{"observed_at":"2026-07-03T01:37:30.607505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13632","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.619849Z","title":"Closing the gap between text and speech under- standing in llms","venue":null,"work_id":"3d4fe369-c396-4eb2-b021-8c3fe119526d","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:8720f872d4f63c926b31f2c4493d0da55bbb4e7121a39bb975e91a916c86e4b8","observation_id":"60e8cece-fda3-4ac2-9c82-259e6205bd84","resolution":{"observed_at":"2026-07-03T01:37:30.621346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":"2507.08128","doi":"10.48550/arxiv.2507.08128","metadata_source":"pith","pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","venue":"cs.SD","work_id":"67c2892d-8e27-4da1-8198-71c48e673e96","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:c0c261ded1fe7cc309fb806f0ba223dd57b13ad0d5ef7d4ae2c2d5d049cba5b1","observation_id":"9e850727-45d9-46e5-b89c-dd7b39f449d8","resolution":{"observed_at":"2026-07-03T01:37:30.611659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21060","doi":"10.48550/arxiv.2509.21060","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring audio’s impact on correctness: Audio-contribution-aware post-training of large audio language models","venue":"Research Portal (King's College London)","work_id":"78aac118-cc6b-4c29-bfd2-7104eaab9861","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:5fdc729919053e04e2f1f22721ad20cceacc0b8be91c5358c3e8832d9c9f6957","observation_id":"dc5cb171-33d0-47a5-a87e-03621ff2e003","resolution":{"observed_at":"2026-07-03T01:37:30.618646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:e37bc7a0882190010c7d01148c78131ae15513263d16177f552f14da4159d238","observation_id":"621d1ba7-779e-417c-a2bf-bbbeba787d77","resolution":{"observed_at":"2026-07-03T01:37:30.597792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-06T01:59:30.134013Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"cited_work":{"arxiv_id":"2601.06199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06199","snapshot_observed_at":"2026-07-03T01:37:30.613903Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","venue":"eess.AS","work_id":"8997388d-332d-4d0c-8b1a-50e04985fbff","year":2026},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2601.06199","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:b1339d04f414a7fd8bd3eb85866b29db12dffdb2f2e6244c7652e372a51d7a7b","observation_id":"f31f6adb-b2a7-4358-a2e7-2e3c9ca1244b","resolution":{"observed_at":"2026-07-03T01:37:30.615450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0196391","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PLOS ONE , publisher =","venue":"PLoS ONE","work_id":"81d0da81-c9ee-4ee3-8863-1bc47f932839","year":2018},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:3b30edc2843458fcdda16db0b4ac65974d7be71d55e9ee1913c1a6321bc127e1","observation_id":"575a00fe-35a2-48c6-9d45-dac408d68aaa","resolution":{"observed_at":"2026-06-27T16:31:02.727492Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-07T00:10:36.836059Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"cited_work":{"arxiv_id":"2510.04584","doi":"10.48550/arxiv.2510.04584","metadata_source":"pith","pith_arxiv_id":"2510.04584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","venue":"cs.CL","work_id":"63b4a48a-8dff-4e0b-8d8f-47905c8b637b","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2510.04584","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:3b3aff830e493c647b0a4e602ba98da04dea2f45097a9e33d5e924017fb1a5c5","observation_id":"af7227b8-3b48-4510-864f-4cd11dc8a227","resolution":{"observed_at":"2026-07-03T01:37:30.595468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.595884Z","title":"Available: https://arxiv.org/abs/2511.03310","venue":null,"work_id":"4d623d94-692b-4977-9e27-2eef00d1b6b8","year":null},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:50e0e75f40f3156f32ed88addb6ecf2e5afd9bd029a306a7d3c760a71e762b3d","observation_id":"8e179965-984e-494a-b90a-b91990573426","resolution":{"observed_at":"2026-07-03T01:37:30.597120Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:bd3025f2a8d1dbe69f9b3dba11a4fd17ef7e2c126f749fa9a68ae0e4a5124442","observation_id":"f5b65a5e-84a4-4f2a-9e20-ebb402c64e0e","resolution":{"observed_at":"2026-07-03T01:37:30.599502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15930","last_updated":"2023-09-16T06:14:54Z","snapshot_observed_at":"2026-08-05T06:18:44.577926Z","submitted_at":"2023-08-30T10:12:39Z","title":"LLaSM: Large Language and Speech Model","version":3},"cited_work":{"arxiv_id":"2308.15930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.15930","snapshot_observed_at":"2026-07-03T01:37:30.579102Z","title":"LLaSM: Large language and speech model.arXiv preprint arXiv:2308.15930","venue":null,"work_id":"2959c7f3-e690-4086-b347-09ba2e8f3989","year":2023},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2308.15930","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:ac2a025e519911dfe8822ea14860504578417f3b9bbc171e250656522f9be9d2","observation_id":"c55f5e85-e411-4c6e-b2e9-10faaf5f9493","resolution":{"observed_at":"2026-07-03T01:37:30.580557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"cited_work":{"arxiv_id":"2508.15418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15418","snapshot_observed_at":"2026-07-03T01:37:30.588519Z","title":"Llaso: A foundational framework for reproducible research in large language and speech model.CoRR, abs/2508.15418,","venue":null,"work_id":"effec894-c65d-42ea-a586-6b807c0daa5b","year":null},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2508.15418","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:11431471186cfe0895f78c04bb2c1c67cc9b36a56458cd03474aff12d0e93765","observation_id":"01cba664-288f-4a84-a6ad-dabecc5f7b82","resolution":{"observed_at":"2026-07-03T01:37:30.589991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00168","last_updated":"2025-05-17T15:25:50Z","snapshot_observed_at":"2026-07-06T19:24:52.534713Z","submitted_at":"2024-09-30T19:17:46Z","title":"SSR: Alignment-Aware Modality Connector for Speech Language Models","version":2},"cited_work":{"arxiv_id":"2410.00168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.00168","snapshot_observed_at":"2026-07-03T01:37:30.587971Z","title":"InProceedings of the 30th International Conference on Machine Learning, pages 1310–1318","venue":null,"work_id":"c410b06c-d350-4fb7-bd38-df701dd13b04","year":2022},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2410.00168","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:1879288ccd9b3267fc44ffedd7dd039e68106a6146be9fd97c6eae3b348f44ce","observation_id":"0e312edf-c0eb-49ee-8d51-53de56662c24","resolution":{"observed_at":"2026-07-03T01:37:30.589450Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05543","last_updated":"2026-04-20T10:33:45Z","snapshot_observed_at":"2026-08-07T19:08:48.898922Z","submitted_at":"2026-01-09T05:51:56Z","title":"Closing the Modality Reasoning Gap for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2601.05543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05543","snapshot_observed_at":"2026-07-03T01:37:30.611503Z","title":"Closing the Modality Reasoning Gap for Speech Large Language Models","venue":"cs.CL","work_id":"952409f6-737a-4ba4-a626-821db6d76ff8","year":2026},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2601.05543","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:98f5fca3603d34421700884e20c2d8f93c21912a0f2d2b815689f67c81beffce","observation_id":"1c3b0ca4-2a46-45af-a79c-ba6ace513038","resolution":{"observed_at":"2026-07-03T01:37:30.612695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":"2506.04779","doi":"10.48550/arxiv.2506.04779","metadata_source":"pith","pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","venue":"cs.CL","work_id":"1a24d3b1-2d00-407c-90f0-b0aeec13bfe6","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:8d55e29b89993225db3262dcc1cf967b147b042ce005d286d61042a883b77500","observation_id":"b5ec2c3d-063b-4aca-a024-2f406df37cf0","resolution":{"observed_at":"2026-07-03T01:37:30.594742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:05f54af63a6e6c0680524bb38bd34cb0f1d1e53381a9ad60ab58fb139a81d7e6","observation_id":"f6f9f46d-f6b4-434a-9928-6f2d81b15ade","resolution":{"observed_at":"2026-07-03T01:37:30.610025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2606.09366."}