{"as_of":"2026-08-07T18:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:395ba9f8024aabf0459953ea4e676e82a8af1834fa1bb6ba05bb6ba669565f69","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T19:02:16.119373Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.19453/citation-record","integrity":"/paper/2606.19453/integrity","json":"/paper/2606.19453/citation-record.json","paper":"/paper/2606.19453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:c6e5422c9c534955f2c0eabc8834b3dc19769090737bc3b67334eb421d64face","observation_id":"dc8158c4-0919-40b5-bef4-628ca0407403","resolution":{"observed_at":"2026-07-04T02:49:25.054154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:1e607e6d7f0c9368bccb13b28dc47c0ea8418762d8b26c03aeabe0d3d48bb2f8","observation_id":"1c775997-0ae1-4ebb-bcca-133882e01dff","resolution":{"observed_at":"2026-07-04T02:49:24.994509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:c3601c8ecd319e87185f894effd4d3131efc249cf5abf48e8eb3f3b96617a89d","observation_id":"4b3cdabd-2207-42fd-842b-80b5c1a22b6f","resolution":{"observed_at":"2026-07-04T02:49:25.022076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.709693Z","title":"From turn-taking to synchronous dialogue: A survey of full-duplex spoken language models","venue":null,"work_id":"b7e531ae-f18c-4c43-9259-84866b46f913","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:0a11f1c4f3e3249c61e70bf59c548a82b973a4fb47c6d867e9acd49bd8080640","observation_id":"010a61b3-bee2-4c9f-b806-7a215fd51d02","resolution":{"observed_at":"2026-07-04T02:49:25.027785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13472","last_updated":"2025-05-29T03:32:21Z","snapshot_observed_at":"2026-08-07T18:06:32.574272Z","submitted_at":"2025-02-19T06:51:34Z","title":"FlexDuo: A Pluggable System for Enabling Full-Duplex Capabilities in Speech Dialogue Systems","version":2},"cited_work":{"arxiv_id":"2502.13472","doi":"10.48550/arxiv.2502.13472","metadata_source":"pith","pith_arxiv_id":"2502.13472","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"acoustic to- kens","venue":"cs.CL","work_id":"7d46a569-944a-4b5d-a1bf-c0772174cd36","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2502.13472","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:e8dde6a400f0d6f9aadffee960bb66774d22a17f6e79d34215a66ab7e533b81d","observation_id":"799ea9b2-8e0c-43b9-b28b-7b8c2b3100eb","resolution":{"observed_at":"2026-07-04T02:49:25.051912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.685549+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.685549+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:a72f18467a33c96726fd0fa7b751d65f4873fc23921abad1e608f69fcb21826e","observation_id":"681b7d68-a2dc-4532-ac1d-ede5959dabbc","resolution":{"observed_at":"2026-07-04T02:49:25.016400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T19:02:16.119373Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:8d3061e443e7da1bc7e39f86bec9a513d83b7bfcbb16d0b4ea7156d3fff54be6","observation_id":"575e11c0-60aa-4308-9f3f-9cf019c65b49","resolution":{"observed_at":"2026-06-26T19:02:16.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T19:02:16.119373Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:be3df8dcd1f44561fc8caa1d4d86b3cfe016842b8ce392bdff6889b7567dd32e","observation_id":"5c3b866c-7d72-441f-8290-e74b830c22af","resolution":{"observed_at":"2026-06-26T19:02:16.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:977052b54109db084de6939f258da2cd5cd6302115adf17fc580f61b5900f543","observation_id":"152022c0-615d-4c18-b4b9-b96624a0cb49","resolution":{"observed_at":"2026-07-04T02:49:25.059455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:db538284e4f8066e6f1a4f37cece671efdbdc422e982f78d7dd4ae0d0a52aa00","observation_id":"833063de-95b3-488c-a55a-f9a2e4206004","resolution":{"observed_at":"2026-07-04T02:49:25.025115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:d12eccce8bb22d4ea71100ebafbdb5ea47a2bc631c8dcbfab4b28dd0bd5d4fb9","observation_id":"92a57590-d5b1-4f10-865c-c281a3a039b6","resolution":{"observed_at":"2026-07-04T02:49:25.010931Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T19:02:16.119373Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:691109979b4fc580632df72ed330476843bee1ae123f35a1cf94df34db883574","observation_id":"fe31b96f-3af2-446d-b4ae-f8375842a4b5","resolution":{"observed_at":"2026-06-26T19:02:16.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:81fa834241e3eb7dc50c1b0c6e6611f79c98afc81e35b968de73efc2df8aeb77","observation_id":"4cf45c11-4d86-4d20-be97-ba8120d39acf","resolution":{"observed_at":"2026-07-04T02:49:25.034679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":"2410.11190","doi":"10.48550/arxiv.2410.11190","metadata_source":"pith","pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities","venue":"eess.AS","work_id":"104f05e3-a490-4b69-90dc-68a70e9c5355","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:3e38c2d8137ab61353c3f83318c2b4dc5c8c52e78a6e4aa5c87cd3b73cc417e3","observation_id":"20bb6061-74d9-4860-a7fd-357cfb726f17","resolution":{"observed_at":"2026-07-04T02:49:25.056791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.841947Z","title":"Fun-audio-chat technical report","venue":null,"work_id":"3aab8cff-d938-401b-a33e-ed1821101046","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:7d6e3a815cc839406ade999a57c6dc9daff86dcd2b2fc4aa239c5fcab43fb4c3","observation_id":"3b3933fe-3130-4293-b348-2dff0c8d9eea","resolution":{"observed_at":"2026-07-04T02:49:25.049038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:49:25.023354Z","title":"Covo-audio technical report","venue":null,"work_id":"b131a09f-08ea-46fa-8553-8ea5fc48c89c","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:db6f28bbe6bede8d7614ea0ccebdcfec95fa916cdb0e781856acc73ceec1c0ad","observation_id":"f2ad20fb-f375-4d63-a80f-a152b99208ad","resolution":{"observed_at":"2026-07-04T02:49:25.024865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:49:25.017689Z","title":"Soulx-duplug: Plug-and-play streaming state prediction module for realtime full-duplex speech conver- sation","venue":null,"work_id":"79d81189-5f3b-41ef-8d73-3947f4d66799","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:626c28f7925dda2040199469cc0ac82a295c17383c24dd3bad9c642d4fd92592","observation_id":"991f45d7-b0da-4287-9e3c-2d97b1d6cb92","resolution":{"observed_at":"2026-07-04T02:49:25.019606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":6},"cited_work":{"arxiv_id":"2604.01897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.01897","snapshot_observed_at":"2026-07-04T02:49:25.031283Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","venue":"cs.SD","work_id":"c75b81ef-ea19-4d42-af43-d06a0df71942","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2604.01897","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:6d83bff53b0b26aae3d6b647c372831b629f02f96ebd4404b786c4cd6e5bba9d","observation_id":"77733285-e27c-4e3d-85f1-c568fd45cef3","resolution":{"observed_at":"2026-07-04T02:49:25.032467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:5610c63b4a781aaaea05c557d9b24abe529dc813a0edc02b4df15ab1ff4f33de","observation_id":"b3485cf5-69fe-4163-b873-5246e41cc53e","resolution":{"observed_at":"2026-07-04T02:49:25.046220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:64c29e58a905b8eae84d8949df5052d89b0206e1b0aad45db8606f38dab0331e","observation_id":"64a7b10f-e728-42bc-8c56-6c2e0ddecfdc","resolution":{"observed_at":"2026-07-04T02:49:25.045148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:1d10d0f5fbaa098c760585e3484973d7d40efdb599ead955d251865d7e649995","observation_id":"64f10523-1aab-4cec-8513-bb4242b094ef","resolution":{"observed_at":"2026-07-04T02:49:25.038040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:d5387b527e1d0740dbef6899bf5de202c73ad77a1ebe591ce436993a5d37da61","observation_id":"da34a01a-b062-45f0-a7d8-25496182aff1","resolution":{"observed_at":"2026-07-04T02:49:25.013734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06053","doi":"10.48550/arxiv.2602.06053","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Personaplex: V oice and role control for full duplex conversational speech models","venue":"Open MIND","work_id":"f9ff1418-0d52-48ae-b0a2-8de74df0fcfb","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:5126a541a2d570e9e62d5a19b29503fc7d37cb599c80c0257569fd383860fe99","observation_id":"3a15380d-6b5b-4de3-a6aa-2d23e53fbbea","resolution":{"observed_at":"2026-07-04T02:49:24.987760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12928","last_updated":"2026-05-12T00:31:31Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T16:17:52Z","title":"MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models","version":3},"cited_work":{"arxiv_id":"2604.12928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12928","snapshot_observed_at":"2026-07-08T00:04:22.468935Z","title":"MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models","venue":"cs.CL","work_id":"3892f74f-5dcd-43d6-82c8-e54735223edf","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2604.12928","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:63e2137df1bd093f07f13420ca3cfcf278bbaf034d07090f22d16b81296203c5","observation_id":"7d085be0-f106-4ec1-911e-a2b03394d8d7","resolution":{"observed_at":"2026-07-04T02:49:25.005579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T19:02:16.119373Z","title":"Easy turn: Integrating acoustic and linguistic modalities for robust turn-taking in full-duplex spoken dialogue systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:1d8fff2bce4730f9b53dc2c3097f9378c07bf39840aeb288b6d88642d3fade83","observation_id":"b8d0121b-1f37-4f4f-82bd-f1396cd54742","resolution":{"observed_at":"2026-06-26T19:02:16.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T19:02:16.119373Z","title":"Full-duplex-bench v1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:eac4fbab95e0d4ee4e4bd0b74f61cff35e5d67c70bc92e015e304889ff3b7f6e","observation_id":"5eae23d3-bf32-4797-8b48-f7fdbeb7024a","resolution":{"observed_at":"2026-06-26T19:02:16.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T19:02:16.119373Z","title":"Switchboard: Telephone speech corpus for research and development","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:3cf76ed1f0cf77fb972a36aea712aaad36a3674e7d2cd9ad34dd9328a2a9f2d9","observation_id":"2044f8b3-a0a2-4667-be8a-b1f4625482e3","resolution":{"observed_at":"2026-06-26T19:02:16.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16844","last_updated":"2022-03-31T07:01:06Z","snapshot_observed_at":"2026-07-06T12:55:09.694305Z","submitted_at":"2022-03-31T07:01:06Z","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","version":1},"cited_work":{"arxiv_id":"2203.16844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16844","snapshot_observed_at":"2026-07-04T02:49:25.025919Z","title":"Open source magicdata-ramc: A rich annotated mandarin conversational (ramc) speech dataset","venue":null,"work_id":"4b3f52d5-4ee0-4e23-92e6-d68344e22092","year":2022},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2203.16844","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:540d6ed0242bbfc72e2b375594af6cf97d900ca60bf3eefde3ca4f027c4db5cc","observation_id":"875a3707-031e-4019-bb9f-7eb40f23444c","resolution":{"observed_at":"2026-07-04T02:49:25.027416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11594","last_updated":"2026-04-24T06:36:24Z","snapshot_observed_at":"2026-08-02T02:42:26.875995Z","submitted_at":"2026-04-13T15:06:05Z","title":"HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models","version":2},"cited_work":{"arxiv_id":"2604.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11594","snapshot_observed_at":"2026-07-04T02:49:25.020749Z","title":"HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models","venue":"eess.AS","work_id":"6dbd2893-fc52-435a-b3f2-26c126faedcb","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2604.11594","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:cfb787f5bc10c7e4d0309d56508919628f9c2bee70b967df0d103deae679e456","observation_id":"12114a70-a4af-4716-abd7-3990d52f97bd","resolution":{"observed_at":"2026-07-04T02:49:25.022295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14920","last_updated":"2026-04-16T12:03:50Z","snapshot_observed_at":"2026-08-03T03:54:29.732084Z","submitted_at":"2026-04-16T12:03:50Z","title":"Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models","version":1},"cited_work":{"arxiv_id":"2604.14920","doi":"10.48550/arxiv.2604.14920","metadata_source":"pith","pith_arxiv_id":"2604.14920","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models","venue":"cs.AI","work_id":"a095af3f-a541-40c6-baaf-1b681b2e6dc7","year":2026},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2604.14920","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:bd676d29e09e2f95b8742b5ee8c8ae56c700aea01525bc7a5e1bb625a2d13bd4","observation_id":"df159f2a-4ea6-4f3b-9393-25619b0c9f7a","resolution":{"observed_at":"2026-07-04T02:49:24.999926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-07T17:23:47.379403Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:31fac8d7d30688adeeb7c06c701c96e0b74ad743fabb68a3dba99c759d6fd5b4","observation_id":"94e724fe-7e45-4836-9408-5f39b7802450","resolution":{"observed_at":"2026-07-04T02:49:25.047644Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01174","last_updated":"2025-03-03T04:46:04Z","snapshot_observed_at":"2026-08-07T17:34:52.724764Z","submitted_at":"2025-03-03T04:46:04Z","title":"Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics","version":1},"cited_work":{"arxiv_id":"2503.01174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01174","snapshot_observed_at":"2026-07-07T14:53:55.794102Z","title":"Talking turns: Benchmarking audio foundation models on turn-taking dynamics","venue":"cs.CL","work_id":"ceeb072e-0415-4508-999c-bcb728f2e57a","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2503.01174","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:6a4dd1366f922c6e273d275facca8959ac32b303a032da30a946ff40cee5b31e","observation_id":"0e1281f3-4fb8-42f9-8731-b258e47814ed","resolution":{"observed_at":"2026-07-04T02:49:25.019234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10262","last_updated":"2026-04-17T03:17:04Z","snapshot_observed_at":"2026-07-06T22:35:41.533403Z","submitted_at":"2025-11-13T12:50:04Z","title":"MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models","version":3},"cited_work":{"arxiv_id":"2511.10262","doi":"10.48550/arxiv.2511.10262","metadata_source":"pith","pith_arxiv_id":"2511.10262","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models","venue":"cs.CL","work_id":"440cc3b6-b8c4-4ec5-8501-bcb0026e0808","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2511.10262","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:105d5c064d68d43621c5b9c18fde4ad86c3d33619a4e2a83a7037a2d0911761c","observation_id":"f1ae03e7-9214-4a26-9416-82a418665422","resolution":{"observed_at":"2026-07-04T02:49:25.030118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:6428646bdfdd1e113321f86a26e649e3fde587dc9b4a51af921349ef66f364be","observation_id":"caff9bb2-9bed-430d-b66a-ac9fa46131f1","resolution":{"observed_at":"2026-07-04T02:49:25.036883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":"2404.08471","doi":"10.1145/3178876.3185996","metadata_source":"pith","pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","venue":"cs.CV","work_id":"f7251dcf-5341-4915-bfe7-27812387b61a","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:9facd653f07969c829e2c0b88068bccbd75ceefbcedcd9ea626e1b27c6b6fa2d","observation_id":"b61fcfa9-fe67-4a94-80c4-605cff841752","resolution":{"observed_at":"2026-07-04T02:49:25.044035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T01:54:34.489718+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T01:54:34.489718+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":6,"verified_exact":24,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2606.19453."}