{"as_of":"2026-08-07T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abbd8429480791688b3e8f40c48c54162a4a6b0621be4e22fd9373abfbf6aeec","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:32.222856Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:0c2574fd3fc4a95c93062a492f9dfe7d8549de86cea7bb28bd94598af4f886c7","observation_id":"474d7e28-d8cc-4621-ae66-e608e21415dd","resolution":{"observed_at":"2026-05-11T02:14:45.462747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:041c02aeeb5cdd6e5db938e0830ce10197aca19454d816e1f04ba215d33543fb","observation_id":"62792d3a-d3f9-48b5-badd-2459f82d3802","resolution":{"observed_at":"2026-05-18T13:39:48.291681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:bb092172f4592d95ed602cb72abfdf718939c76392ac3d594e080b68e6a4083d","observation_id":"6f095213-9732-49f6-9f03-231262498176","resolution":{"observed_at":"2026-05-10T17:54:03.293192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:35b5776bdba458edbaa85e1d11fcbda7adfa2120aa41185b372727803a8bdeb0","observation_id":"c9bfbf4a-251a-4423-a3d4-c7be0a6c46ad","resolution":{"observed_at":"2026-05-22T20:45:07.987371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-07T14:30:32.222856Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T14:26:05.696322Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.222856Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:1346103909cd66577d8d96422e1bb519d8a7f980d8f51215ca6e0172c378c30c","observation_id":"1e9316b4-b1fd-426f-8937-3caf555a31f6","resolution":{"observed_at":"2026-08-07T14:30:32.222856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:37a901f3f642676de1c35c65e9578498bdeb4c67011d51fdcd6aa2786efb1ef0","observation_id":"443ccc8e-7d58-43a8-ba77-17d99a880be4","resolution":{"observed_at":"2026-05-11T21:22:37.293820Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-06T19:46:11.082340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-07T01:19:10.776990Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.082340Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:48eff37e344d1df7b71c0830394a1a4a5cc51e735596d1a1c5cd1315bb8e8737","observation_id":"0a06db11-99ae-49f8-8285-e4a32689457d","resolution":{"observed_at":"2026-08-06T19:46:11.082340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-06T18:21:31.841304Z","title":"Speechverse: A large-scale generalizable audio language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-06T18:11:43.215379Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:31.841304Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:1f774d40c07abc029ddc9538c7adb4b7aec430ae606ba9ed712d2e61fedf472d","observation_id":"fdb3b362-ebbd-455e-8dd6-55c2a7f4ad4f","resolution":{"observed_at":"2026-08-06T18:21:31.841304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-06T10:59:03.105773Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23267","last_updated":"2025-07-31T05:56:21Z","snapshot_observed_at":"2026-08-06T10:59:00.488902Z","submitted_at":"2025-07-31T05:56:21Z","title":"Your Spending Needs Attention: Modeling Financial Habits with Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:03.105773Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.23267"},"observation_digest":"sha256:68888c7c563e8137e95d2887886d1499717464005b2caab0c296ec8b51f74b42","observation_id":"b91d2310-470c-4a35-a5e0-5ddf7a956343","resolution":{"observed_at":"2026-08-06T10:59:03.105773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T19:01:21.059534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14130","last_updated":"2025-08-19T06:58:16Z","snapshot_observed_at":"2026-08-07T05:00:34.000889Z","submitted_at":"2025-08-19T06:58:16Z","title":"EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:01:21.059534Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2508.14130"},"observation_digest":"sha256:ddcba406f9a74353d74fafe6b26ecfb449b931a0b3042b819834bf76c73566c8","observation_id":"89172613-8aed-4848-822a-cc168751ec30","resolution":{"observed_at":"2026-08-05T19:01:21.059534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T15:27:29.283691Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19856","last_updated":"2025-08-27T13:16:31Z","snapshot_observed_at":"2026-08-05T15:27:28.932842Z","submitted_at":"2025-08-27T13:16:31Z","title":"TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:27:29.283691Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2508.19856"},"observation_digest":"sha256:09a4cf739439b525452c89fd3444f21e27a36a828653bab7604ce57b8746a7bf","observation_id":"f54078c4-3e0f-4f78-99d6-2b2fa9376b3c","resolution":{"observed_at":"2026-08-05T15:27:29.283691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:967049959d35a17f12c4cc51c4bca61bfd32388834a7b077ad2b48f9287f33a1","observation_id":"44ed0d62-41c9-427e-9093-19ea7800fef0","resolution":{"observed_at":"2026-05-21T22:24:23.516544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:bb657bc8ace53224be803c91dbb6a92d2dd65f20665df1752ed1ff7e76adbea3","observation_id":"24cce4b3-79af-445d-9dcd-fb45577f3dec","resolution":{"observed_at":"2026-05-18T16:31:36.857609Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2512.07571","last_updated":"2026-04-06T08:39:08Z","snapshot_observed_at":"2026-07-06T22:38:03.983093Z","submitted_at":"2025-12-08T14:05:40Z","title":"A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T00:46:08.921194Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2512.07571"},"observation_digest":"sha256:5628d63758279966d2213018138b89c6152808ce9b436d4f0ef97e012f3392b3","observation_id":"9a25b118-325e-4ad3-a8db-c625e6a19e72","resolution":{"observed_at":"2026-05-17T00:48:45.994945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-03T17:16:37.503517Z","title":"Speech- verse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:37.503517Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:51420480bf818556457b1f8faba83de8ce022ece0448aba2864773ef6eaf5ad9","observation_id":"7950c080-4db3-4b22-9a33-64b1ead58181","resolution":{"observed_at":"2026-08-03T17:16:37.503517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2601.20898","last_updated":"2026-01-28T09:50:34Z","snapshot_observed_at":"2026-07-06T22:43:21.411174Z","submitted_at":"2026-01-28T09:50:34Z","title":"Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T10:37:56.416600Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2601.20898"},"observation_digest":"sha256:abaaa7a0a31f89b13311be7e05d0729514e357f29be637760a4d2d617d8c2ba6","observation_id":"f701f70d-084b-4191-93fb-9320c4c6b1fa","resolution":{"observed_at":"2026-05-16T10:40:51.416440Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:cdf39920a14d1e2673f53a1e61121bb3d4038a4d7176f9490ab05885dad8ba0d","observation_id":"9e4419e8-9bf8-4396-862e-f2a4021a6b9c","resolution":{"observed_at":"2026-05-16T05:50:40.260650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-03T04:37:50.813861Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18452","last_updated":"2026-06-29T11:58:47Z","snapshot_observed_at":"2026-08-06T14:57:38.833531Z","submitted_at":"2026-02-04T13:25:47Z","title":"RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:50.813861Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2602.18452"},"observation_digest":"sha256:4af7a393c658275a104fd781f7efaa3754ee6cc124fe016c66ba8c6ce1efd237","observation_id":"bb44bd26-3154-4e60-aea1-c6402245406d","resolution":{"observed_at":"2026-08-03T04:37:50.813861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:1e15ea13fc8d1239ce11c29a0a39c78f3cbcef5bd75355ff1b8b3b5bec36271c","observation_id":"8875ffd5-8b02-434c-9207-648105f67899","resolution":{"observed_at":"2026-05-11T04:50:56.282925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:31cdf20f1943b5137d4bfdeeb90bda39a235ae3da496ecd9baf17a165afc8e34","observation_id":"bcc2be79-4c71-42fa-8a17-0086fe8db9dc","resolution":{"observed_at":"2026-05-21T07:39:48.981456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2605.20414","last_updated":"2026-05-25T03:05:12Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:10:30Z","title":"PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T06:54:41.345212Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2605.20414"},"observation_digest":"sha256:e9f1dc45800c02cf285a535f0db57a1e7f1eb07dca6cae5f0028e0776bd98d26","observation_id":"60960240-19b8-47ba-b252-6a48a7d72167","resolution":{"observed_at":"2026-05-21T06:54:45.172403Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:039908626b718398a919b39851111280b146f0c0e5a3e9341f4d60c944a8ea15","observation_id":"ed66c343-5d3e-4173-8a20-25e1c6f7bd57","resolution":{"observed_at":"2026-06-30T22:15:05.347302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2606.30671","last_updated":"2026-06-24T15:32:47Z","snapshot_observed_at":"2026-08-07T08:15:41.432353Z","submitted_at":"2026-06-24T15:32:47Z","title":"Enhancing BEST-RQ Pseudo-Label Quality through Online Refinement for Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T06:51:41.995108Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2606.30671"},"observation_digest":"sha256:e27adca9262900134a3dc4d6e033182af98973db03c0919fb32048be255f98b7","observation_id":"6754d537-dcf4-4b2d-b544-b7a8c614195d","resolution":{"observed_at":"2026-07-01T06:55:29.122979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.08295/citation-record","integrity":"/paper/2405.08295/integrity","json":"/paper/2405.08295/citation-record.json","paper":"/paper/2405.08295"},"outbound":[],"paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2405.08295."}