{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b72d1f6b0cda32e90c0f1176ef4076803146e2d78ddaf8c3aa3e8528f9488bc3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:41:00.748722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:7bed2cb1dbd896de8b6ecb87697d2f0cb2ed494b41a1705b0ee91ee91fef56de","observation_id":"d76f053a-4f51-44c6-9c0d-6b8f7b739e43","resolution":{"observed_at":"2026-05-22T20:45:08.048139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T15:41:00.748722Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14356","last_updated":"2025-05-20T13:41:32Z","snapshot_observed_at":"2026-08-07T15:33:28.382460Z","submitted_at":"2025-05-20T13:41:32Z","title":"PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:00.748722Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.14356"},"observation_digest":"sha256:f91542c36152bc80797a023a50ffc2a66f7543b9cec6a1bf9f89452f38ef8dd2","observation_id":"fd7ba0be-36c5-4455-8098-6c4bf2e123b0","resolution":{"observed_at":"2026-08-07T15:41:00.748722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T14:51:15.917688Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-08T14:59:41.765787Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:15.917688Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.17417"},"observation_digest":"sha256:f44f89d45528d1da702fc166bb789daffe5179d36745d32e49e35eac790466c8","observation_id":"24297cbb-faa3-4c2a-a25a-9cf84fe8d9b4","resolution":{"observed_at":"2026-08-07T14:51:15.917688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T14:25:09.865471Z","title":"WavChat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19179","last_updated":"2025-05-25T14:57:57Z","snapshot_observed_at":"2026-08-07T14:16:55.957495Z","submitted_at":"2025-05-25T14:57:57Z","title":"BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:09.865471Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.19179"},"observation_digest":"sha256:9f196963495adfad2c8988d7cdf05f509ce50da230156c3c422e1114d33f632f","observation_id":"4c3dccc7-2e75-4285-ad77-48527129a280","resolution":{"observed_at":"2026-08-07T14:25:09.865471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T11:28:51.286122Z","title":"Wavchat: A survey of spoken dialogue models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-08T04:20:18.898895Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.286122Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d67a6cdf96e81edeb176c7ea095b05035e2058c2eb2ffd0adea22b1d1e25bdde","observation_id":"b3c742b7-aa8e-4ea6-b906-76cf35b79278","resolution":{"observed_at":"2026-08-07T11:28:51.286122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:47:11.320572Z","title":"WavChat: A Survey of Spoken Dialogue Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.320572Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:0827e12e6a86f3a943e2c9c8a6f203ac9c39bc8139a12700d1b29339556aa97f","observation_id":"44080555-c607-49e4-a760-a70df34c9de0","resolution":{"observed_at":"2026-08-07T05:47:11.320572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:03:13.393147Z","title":"Wavchat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.393147Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:ef1a9249bb3f0bd62e7ba66d2eb929b6bbe0da00294a1127fc9a6e3691bee6ed","observation_id":"681a5cdb-7ba7-4382-9e1f-b936d7d04130","resolution":{"observed_at":"2026-08-07T05:03:13.393147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T23:35:36.084747Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-07T23:23:01.221709Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.084747Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:f31bcfe2e1b64fbb692b183a6941ad0b7b0479ce64ca3791cde23d19c88008d7","observation_id":"b65c5f37-2a5f-4cad-b67c-2cbb5e689769","resolution":{"observed_at":"2026-08-06T23:35:36.084747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2506.18962","last_updated":"2026-05-11T09:01:24Z","snapshot_observed_at":"2026-08-06T06:40:03.304790Z","submitted_at":"2025-06-23T17:58:17Z","title":"UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T07:43:26.736409Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.18962"},"observation_digest":"sha256:57a5d8df8681a998e4ab37399d401eeef4c862d44eaddb1b67f54054554abeb0","observation_id":"ae0594c1-2ab7-40ed-84a5-211ae59b4860","resolution":{"observed_at":"2026-05-19T07:47:10.364647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T21:33:09.245104Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23986","last_updated":"2025-07-01T16:23:28Z","snapshot_observed_at":"2026-08-07T19:47:51.420051Z","submitted_at":"2025-06-30T15:50:08Z","title":"StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:09.245104Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.23986"},"observation_digest":"sha256:8c6c8680259c7d8185e3e8b26e064a2d901102f9369974467c3b85fc33f4becb","observation_id":"8c503e55-8ba0-4943-9f41-c006f5503240","resolution":{"observed_at":"2026-08-06T21:33:09.245104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T16:11:24.285128Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14346","last_updated":"2025-07-18T19:51:56Z","snapshot_observed_at":"2026-08-06T15:55:51.419471Z","submitted_at":"2025-07-18T19:51:56Z","title":"Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:11:24.285128Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2507.14346"},"observation_digest":"sha256:482922555c19047cb7642be4174d6e3fc468fe566018768fd8aff88e1433904e","observation_id":"f140ba98-4637-4a27-b434-b70b112dc254","resolution":{"observed_at":"2026-08-06T16:11:24.285128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T21:45:22.176873Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08095","last_updated":"2025-08-11T15:33:44Z","snapshot_observed_at":"2026-08-07T16:13:39.029257Z","submitted_at":"2025-08-11T15:33:44Z","title":"Dual Information Speech Language Models for Emotional Conversations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:45:22.176873Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2508.08095"},"observation_digest":"sha256:1ed9bc0301b9cad48aff6397f718115722436c86110affc57bb0b2c9b90fdf93","observation_id":"74403b0a-948f-405d-9850-ed7df164adbb","resolution":{"observed_at":"2026-08-05T21:45:22.176873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T16:46:49.184979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-08T02:19:42.525581Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.184979Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:7483fe7ddc27b8a9012018424f5e01985977ca5fe06db9b6bd9a33ce799887af","observation_id":"5288e3c4-2220-4f74-bd8a-ccf2e787a69d","resolution":{"observed_at":"2026-08-05T16:46:49.184979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T15:52:44.007778Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00078","last_updated":"2025-08-26T20:40:24Z","snapshot_observed_at":"2026-08-05T15:52:43.760838Z","submitted_at":"2025-08-26T20:40:24Z","title":"ChipChat: Low-Latency Cascaded Conversational Agent in MLX","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:44.007778Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2509.00078"},"observation_digest":"sha256:cb9d388769da2a96f4ffde60acd9786d0be0e409ba41e82123c8f95ffc6b0740","observation_id":"9f744dbb-9fdf-44a8-9b65-209172234df5","resolution":{"observed_at":"2026-08-05T15:52:44.007778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:4089df2bac9f3275e99b77dcb068839b89a4dafc6d27ee1894cd2172066e38a1","observation_id":"ab9084d7-ed4c-4928-add3-05e6c2c8fd8c","resolution":{"observed_at":"2026-05-18T11:52:35.726992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-03T21:42:49.032029Z","title":"WavChat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-06T18:33:53.894178Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:49.032029Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:c067825ca1f1cfc8664af09a136a77e4c67747285ca2ce4b599c431ee249cc2f","observation_id":"b19cbf1b-6668-4905-b09c-0e80e2297a68","resolution":{"observed_at":"2026-08-03T21:42:49.032029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-03T10:51:29.519900Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:52.182973Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2603.22267"},"observation_digest":"sha256:59c450c9512fe9fff01118b499c30421ae2f2e41566c41a750743d3c5433cd3c","observation_id":"271fc78e-d208-4431-9e80-c67457bd918e","resolution":{"observed_at":"2026-05-15T00:39:35.866368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"WavChat: a Survey of Spoken Dialogue Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:13f58728c77043fe6c9e0a0bbfbed187bc51a35c8596f0593833db910c126586","observation_id":"535b2d08-65a5-4aa4-ba7a-7e720b089a69","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-01T20:57:25.785838Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:0d7457eb7dbc5697370c3cf7fdb69bca7fbb7507d09c7b86cf7b47db35d05dc4","observation_id":"7bd73e9c-b565-485d-acf0-d87c0ab92ffc","resolution":{"observed_at":"2026-05-10T11:35:18.904751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2604.19245","last_updated":"2026-04-22T07:02:47Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:50:50Z","title":"Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T02:18:07.162514Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.19245"},"observation_digest":"sha256:6263aa66b5dfe82c32550b06240f13264fae243b437d45755827dc6e776a7048","observation_id":"8ea7f99f-86af-441f-a610-0d9a707b88a3","resolution":{"observed_at":"2026-05-10T02:22:21.217967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-05T12:06:36.882921Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:995badcc7ce34f0c8b4e2e9dcb0e9cb375741a64980c3635f694d21a3dfbc2a9","observation_id":"e8014a72-e25e-48c7-9938-bfde1e7c5e27","resolution":{"observed_at":"2026-05-12T00:41:26.363121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.04613","last_updated":"2026-05-06T08:03:31Z","snapshot_observed_at":"2026-08-02T05:05:09.769581Z","submitted_at":"2026-05-06T08:03:31Z","title":"VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T16:59:25.973854Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.04613"},"observation_digest":"sha256:91f5159ee55ac98a142b9f5c3fad38e35a5a33bf5b4dce8e71649383b0c308ba","observation_id":"6de18e82-e85e-4747-9da7-4f588149be8f","resolution":{"observed_at":"2026-05-11T17:51:09.764621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:1c6d4db0ce439b5a09231025adf96d2990147f5ea973f8484d19b04a35fa722e","observation_id":"36ee66e8-0806-429d-94e4-0367b3d78a91","resolution":{"observed_at":"2026-05-11T04:50:55.760212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.17443","last_updated":"2026-06-18T10:10:06Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T13:29:15Z","title":"Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T13:02:53.960375Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.17443"},"observation_digest":"sha256:5a11694ed22b2a05ab19a7b28bd55f23d5d75e2f6c47d3ef5c28b9d5502842d8","observation_id":"7a2fed10-bd5c-417e-bed0-684bfb935262","resolution":{"observed_at":"2026-05-20T13:03:17.758837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.17443","last_updated":"2026-06-18T10:10:06Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T13:29:15Z","title":"Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T19:12:32.672352Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.17443"},"observation_digest":"sha256:c5652f7cb880ed121a319482433152f94d634d08c8f8782c2c71ac0a4a519f93","observation_id":"6d257d6d-1135-4f57-aec4-5ffc20237160","resolution":{"observed_at":"2026-06-30T19:15:00.392581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:a8774a6269c01ca6d128a41ae72104664226ce4482a535050179684f922575a5","observation_id":"3e1a5b93-42aa-42d3-b65a-0f686d7bb436","resolution":{"observed_at":"2026-05-21T07:39:49.050610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:54cfdf060ae802035ec2752962a4debe53a46e00fc8acb3d62c363b7d8cc66b1","observation_id":"292c42a6-2bcc-4fdc-b4d3-5472e442d172","resolution":{"observed_at":"2026-07-01T20:46:13.838719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:8dd0d1a3b76f1c5da92d7177a5d85c27c2612f3e5de7f79a9ff868af998203b4","observation_id":"56dd88e1-fd28-4878-aafe-63dad0995384","resolution":{"observed_at":"2026-07-02T00:46:24.646473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:13a267a116e466dc37429997030a93e59b2eefb71653f81a3e77cf80d54927a4","observation_id":"9e561681-2cfb-4359-be47-55f7f9d8f1e8","resolution":{"observed_at":"2026-06-27T13:20:57.380720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.11386","last_updated":"2026-06-09T19:08:07Z","snapshot_observed_at":"2026-08-07T01:36:37.082023Z","submitted_at":"2026-06-09T19:08:07Z","title":"Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:22:52.428152Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.11386"},"observation_digest":"sha256:7f0d39f84b07059af92ff897696d69e55649fe9be6218b3f973b36462dffa1d0","observation_id":"5615766a-21f1-4d73-8a28-d4a93a13076e","resolution":{"observed_at":"2026-07-03T05:07:39.504681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.12902","last_updated":"2026-06-11T04:59:33Z","snapshot_observed_at":"2026-08-06T20:56:40.382372Z","submitted_at":"2026-06-11T04:59:33Z","title":"PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:53:13.344795Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.12902"},"observation_digest":"sha256:3a889035dacd23270f1d5caeaf90891747a54308612cc3523dbcf0a9bac86830","observation_id":"fc803355-0644-4879-9499-af55bdc620cc","resolution":{"observed_at":"2026-07-03T14:48:33.547578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.21970","last_updated":"2026-06-20T09:59:34Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T09:59:34Z","title":"Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T12:08:55.070482Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.21970"},"observation_digest":"sha256:d6f8deccbf3c8c645ae1f3cb4b35e8c1077b10a22dc842ae634c81315faf8715","observation_id":"0a6e3651-30ce-49cd-a0a5-a1d5c29ac73a","resolution":{"observed_at":"2026-07-04T08:09:41.319388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:74b180f44f1486cbecdde7128fd54dbecb5a303f4e950262ee343106432465dc","observation_id":"5bff76c7-2b3a-478d-bc3e-aaf2a390e528","resolution":{"observed_at":"2026-07-04T12:09:49.441309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:ce8ccf87a6b1fdeece9a1d9848a484ed48c6eccd2c16854079bb6c9ca0e1742c","observation_id":"c068f586-cd16-4bd7-9cdb-a91e167203ce","resolution":{"observed_at":"2026-07-04T13:59:52.893021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-07-12T08:53:05.906087Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T21:22:38.888528Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:487326818a10e64cf567688d2c6bfeedff97b456aa004a225dea5a5e5d055b60","observation_id":"16ed510f-853e-45a6-b971-8f702480c31a","resolution":{"observed_at":"2026-07-03T21:28:58.297693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-07-12T08:53:13.408944Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-07-12T08:53:05.906087Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T08:53:13.408944Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:77cfb24d41f587a4f50dc885125d0190203d357bd3bbe2514d4fda840f7b33a8","observation_id":"1aacc01f-e37b-4fce-9c64-46d6f0f3761f","resolution":{"observed_at":"2026-07-12T08:53:13.408944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-07T11:01:55.500168Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:3a1fea309cb90ba8c22442461449bafae56a71f04b85233bdf4c400ddc0b5e6d","observation_id":"b65231ce-691f-49ab-bddc-1b16309664a0","resolution":{"observed_at":"2026-07-08T02:44:27.611257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-01T07:12:17.646123Z","title":"arXiv preprint arXiv:2411.13577 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.646123Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:a72e430b738bce29c6e583de7916ed5d2ffed7de6f096d6269ae18eb791beab5","observation_id":"26ce0f7a-9521-40c9-a8ca-99e9b2e5484c","resolution":{"observed_at":"2026-08-01T07:12:17.646123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13577/citation-record","integrity":"/paper/2411.13577/integrity","json":"/paper/2411.13577/citation-record.json","paper":"/paper/2411.13577"},"outbound":[],"paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2411.13577."}