{"as_of":"2026-08-09T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0fcd14ffe4b9cb3221f9b9f1ec1ca9f606aed13112f82a1d28d85bd213d01d2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:38:37.251024Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T23:51:43.934329Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2503.14324"},"observation_digest":"sha256:13ee80d0dc8f33decede5adcd15f6772e33914494f62a8b037cef556d0832e9e","observation_id":"7ac78b78-52a7-4d26-af96-90e2f944f2cf","resolution":{"observed_at":"2026-05-22T23:52:16.736897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:560628c46d7453c66545728f56672909a04cfe63d973668df12542ee3cf9bc0d","observation_id":"93c544ca-6fdf-4cf3-9a36-01f9219931fa","resolution":{"observed_at":"2026-05-11T19:21:27.223308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-07T15:38:37.251024Z","title":"arXiv preprint arXiv:2502.17239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14438","last_updated":"2025-05-20T14:42:20Z","snapshot_observed_at":"2026-08-09T02:59:06.064910Z","submitted_at":"2025-05-20T14:42:20Z","title":"S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:37.251024Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2505.14438"},"observation_digest":"sha256:04a9ea159519b2cc0da49a615de0c95479e493f13a3cdc5b158e723a00042673","observation_id":"3fe741c6-d071-41b1-9000-f47f5998c79a","resolution":{"observed_at":"2026-08-07T15:38:37.251024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-07T11:28:52.822450Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.822450Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f554c42d45a486bc3a5ee14be1506abb2bc4cc23fedacb57fd76e3d8db42ed87","observation_id":"a861450a-14e7-4ae6-b631-4ebdec81cd59","resolution":{"observed_at":"2026-08-07T11:28:52.822450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-06T21:55:53.227261Z","title":"Baichuan- audio: A unified framework for end-to-end speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23049","last_updated":"2025-06-29T01:13:15Z","snapshot_observed_at":"2026-08-08T12:46:41.624118Z","submitted_at":"2025-06-29T01:13:15Z","title":"AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:55:53.227261Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2506.23049"},"observation_digest":"sha256:296012a73aa9c107e1452ff192a02bd41f45ba15a7d8db0b0649be7bf40ece48","observation_id":"be26c935-a7ac-46cc-8640-094e2ff6b65b","resolution":{"observed_at":"2026-08-06T21:55:53.227261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-06T21:51:35.263754Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-07T07:10:18.010065Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.263754Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:90fe41f67977246ab306ad8a9d6f8b7906e44d421458b3a361fae229beededdc","observation_id":"b0168cde-54d0-420f-92bd-c76a6392a6e2","resolution":{"observed_at":"2026-08-06T21:51:35.263754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:f3c8fb41fc5bb47b7fd0e49be27cc8639789649f2ae99e564821bbce481ad6f1","observation_id":"c5ec8a30-318c-426e-93a7-7007b19df62e","resolution":{"observed_at":"2026-05-15T03:42:44.716460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T15:00:14.020393Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-07T03:22:53.746027Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.020393Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:df2ff135ef15d2480653be614891678778e5a768abbde72b99341df69fc98c62","observation_id":"40b1610e-2ed8-40ec-b53c-be989790466a","resolution":{"observed_at":"2026-08-05T15:00:14.020393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T10:36:06.427752Z","title":"arXiv preprint arXiv:2502.17239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-08T20:51:35.281735Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.427752Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:9a1e92c1c628d319e18d1abc6b7cde91f60ce192d0ce635762da8b21177e3e17","observation_id":"6eb69524-e602-42c6-9335-744ef968d22f","resolution":{"observed_at":"2026-08-05T10:36:06.427752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:620ee93d7efbfa045b107046dfb0918d7c9a8b1f319b0f2cbe85e017a77a765a","observation_id":"6926b130-d033-4f16-badd-5e1c9729d192","resolution":{"observed_at":"2026-05-18T16:31:37.190198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-04T10:13:42.410505Z","title":"arXiv preprint arXiv:2502.17239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11098","last_updated":"2026-07-06T08:06:32Z","snapshot_observed_at":"2026-08-08T04:21:21.183477Z","submitted_at":"2025-10-13T07:45:52Z","title":"VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:13:42.410505Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2510.11098"},"observation_digest":"sha256:2a376817c2dbaea7d9c32656b43982672cf4607075dad39eab159f9f764980a0","observation_id":"89d9be4e-f9a5-4f7b-a26b-0bc092ce3677","resolution":{"observed_at":"2026-08-04T10:13:42.410505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-03T18:00:28.526023Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.07352","last_updated":"2026-06-09T12:53:03Z","snapshot_observed_at":"2026-08-07T12:56:58.369664Z","submitted_at":"2025-12-08T09:43:30Z","title":"MultiAPI Spoof: A Multi-API Dataset and Local-Attention Network for Speech Anti-spoofing Detection","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:00:28.526023Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2512.07352"},"observation_digest":"sha256:31eab5e95cc94f761d82b6d0da2341450dac991d43be218bae7dbb471041b0a0","observation_id":"11e27bd1-6153-4f61-8b74-5684833c4c51","resolution":{"observed_at":"2026-08-03T18:00:28.526023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-03T17:16:39.457626Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction.arXiv:2502.17239, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:39.457626Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:1601dcfc82155b476a0b2bd206b1c99c4e6d073a5cb8d0e844e8a705b527cb6f","observation_id":"94e8db46-1223-4201-b70b-90ca2fa41cf8","resolution":{"observed_at":"2026-08-03T17:16:39.457626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T08:34:56.898815Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:7e1888c71a5d17ce505df704f951fa277f4cc2fd0065c2d16d2bb167de3ea571","observation_id":"d6683298-010e-43a2-9606-620f3e4996e6","resolution":{"observed_at":"2026-05-15T08:35:18.399022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T10:43:27.176535Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:9c43397edffb74e2dae60639c002b964ec45834d0bf5665b7e4e2c0302e84429","observation_id":"1619f4df-1231-4214-b6e6-ac818e748e8a","resolution":{"observed_at":"2026-05-21T10:44:07.754424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-07-13T22:57:11.059962Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T22:57:11.059962Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:1f3f9f6bd35f324ef2e5053e812c7fdf1f0d1f714d9a9f44364637f641b96f12","observation_id":"ecce569e-f6b6-4ab5-a71e-af81032600c7","resolution":{"observed_at":"2026-07-13T22:57:11.059962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-03T10:51:29.519900Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:52.182973Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2603.22267"},"observation_digest":"sha256:50431a7e7fd49b736af76bde9daf224fd17c95626c90f7b0261d91e139f07d5a","observation_id":"ae31ae8d-13e0-4ce0-a579-01c2dac98406","resolution":{"observed_at":"2026-05-15T00:39:35.811984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2605.03937","last_updated":"2026-05-05T16:27:33Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:27:33Z","title":"MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:34:50.848124Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2605.03937"},"observation_digest":"sha256:1b930494228cc030b06f14485af85c58996c4bb046f38182e9cb9738e9bf33b3","observation_id":"7baf8c86-9613-4ee9-9ec7-cfa1175ab18d","resolution":{"observed_at":"2026-05-11T16:41:08.056194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:a515cdbeca21fe8091c1448d306f82036e64c0e04d3167ca6af67d6113e52ebf","observation_id":"61026f86-cd55-4732-8fe4-d45b601d3ce4","resolution":{"observed_at":"2026-05-11T04:50:56.122055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2605.10199","last_updated":"2026-05-11T08:46:47Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:46:47Z","title":"How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:08:55.753359Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2605.10199"},"observation_digest":"sha256:cab18bcf0acd5422e0df95f2e95fef3bea3e5fb6f29d8a27a0852667c035d63b","observation_id":"7ec77828-2a15-4d3a-83d3-590e8adb6a76","resolution":{"observed_at":"2026-05-12T03:11:19.093344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:67ca6446dd139064165cf2f19b79c13a6b706aa97370adda6a41100de7a0843c","observation_id":"6b2082f1-4432-4c22-9f48-8dafc6f09f5d","resolution":{"observed_at":"2026-05-21T07:39:48.790217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-07-13T08:22:44.347941Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23912","last_updated":"2026-04-08T23:43:46Z","snapshot_observed_at":"2026-08-08T18:14:47.595645Z","submitted_at":"2026-04-08T23:43:46Z","title":"Raon-Speech Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T08:22:44.347941Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2605.23912"},"observation_digest":"sha256:40c1fc5ea35c4f73a2db0fbfbbef908f670d7f1b1fd39dd00d4c777a32bb37b2","observation_id":"bbbc490e-cd64-4314-b29c-33519ad62833","resolution":{"observed_at":"2026-07-13T08:22:44.347941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:3eb9f0b1594df59e7158b2c50ed4afbb2f4a465ba138b86d43651c92a93f4fd8","observation_id":"99d7e8bb-82e4-4a41-85f5-5c04d7ac008a","resolution":{"observed_at":"2026-06-28T17:52:26.925475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-06T23:00:35.099926Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:ad1e33990720f852275355c2364434d9421cf22db69b8243e0b0376ba6ff0d12","observation_id":"181163d2-d0d8-453f-8e9a-015a68694417","resolution":{"observed_at":"2026-07-02T00:56:25.114734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":218,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:fd9dd6adefb96c412a286c3a1fdda7769ce734110b10110a3b9828254ae3bda9","observation_id":"4fc400e4-c217-41ba-8839-4e5e8e252bb1","resolution":{"observed_at":"2026-07-01T11:55:42.134456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-01T11:20:17.818345Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19932","last_updated":"2026-07-22T09:04:55Z","snapshot_observed_at":"2026-08-07T17:53:01.414682Z","submitted_at":"2026-07-22T09:04:55Z","title":"Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:20:17.818345Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2607.19932"},"observation_digest":"sha256:2c65276eb06cf27fc11f363c186580cd3ecfec824dfc482b0f909736a43158fc","observation_id":"f7baa26c-ec12-481b-9480-c87ea1f3954c","resolution":{"observed_at":"2026-08-01T11:20:17.818345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-01T07:12:11.242181Z","title":"arXiv preprint arXiv:2502.17239 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.242181Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:880a67abc964deef9bdd39ffdcf99e387a1fa2a5f00e04ac15eafd27e3802562","observation_id":"5e51c39d-defd-4a26-86bf-4cf89f94e98d","resolution":{"observed_at":"2026-08-01T07:12:11.242181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.17239/citation-record","integrity":"/paper/2502.17239/integrity","json":"/paper/2502.17239/citation-record.json","paper":"/paper/2502.17239"},"outbound":[],"paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2502.17239."}