{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:AZVUUSCO2NP6MFT2WBPGZEITAK","short_pith_number":"pith:AZVUUSCO","schema_version":"1.0","canonical_sha256":"066b4a484ed35fe6167ab05e6c9113028c502fe75af896e232989e373bf16ba3","source":{"kind":"arxiv","id":"2411.13577","version":2},"attestation_state":"computed","paper":{"title":"WavChat: A Survey of Spoken Dialogue Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG","cs.MM","cs.SD"],"primary_cat":"eess.AS","authors_text":"Hanting Wang, Jialong Zuo, Jian Li, Jingyu Lu, Jingzhen He, Jin Xu, Long Zhou, Minghui Fang, Qian Yang, Shengpeng Ji, Shujie Liu, Xiaoda Yang, Xize Cheng, Yidi Jiang, Yifu Chen, Yunfei Chu, Zehan Wang, Zhou Zhao, Ziyue Jiang","submitted_at":"2024-11-15T04:16:45Z","abstract_excerpt":"Recent advancements in spoken dialogue models, exemplified by systems like GPT-4o, have captured significant attention in the speech domain. Compared to traditional three-tier cascaded spoken dialogue models that comprise speech recognition (ASR), large language models (LLMs), and text-to-speech (TTS), modern spoken dialogue models exhibit greater intelligence. These advanced spoken dialogue models not only comprehend audio, music, and other speech-related features, but also capture stylistic and timbral characteristics in speech. Moreover, they generate high-quality, multi-turn speech respons"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.13577","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"eess.AS","submitted_at":"2024-11-15T04:16:45Z","cross_cats_sorted":["cs.CL","cs.LG","cs.MM","cs.SD"],"title_canon_sha256":"38de8e80e3f66d5710a512b194b77c50dcd7e53325503570bcb0e8a8c5dfe5c4","abstract_canon_sha256":"89212e2299dbd5860281c3fd761fc5c436e79a127cad928006039a44a132c9e6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:40:21.454101Z","signature_b64":"3xVpkWIpKZQgQL9NzxwUFCKD875edjUIJ3ZxmcFOGNvxAUfgH1idkSwOlGJIeMZZl8JLqNWlyvMoG5RQ9aYPBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"066b4a484ed35fe6167ab05e6c9113028c502fe75af896e232989e373bf16ba3","last_reissued_at":"2026-07-05T09:40:21.453626Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:40:21.453626Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"WavChat: A Survey of Spoken Dialogue Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG","cs.MM","cs.SD"],"primary_cat":"eess.AS","authors_text":"Hanting Wang, Jialong Zuo, Jian Li, Jingyu Lu, Jingzhen He, Jin Xu, Long Zhou, Minghui Fang, Qian Yang, Shengpeng Ji, Shujie Liu, Xiaoda Yang, Xize Cheng, Yidi Jiang, Yifu Chen, Yunfei Chu, Zehan Wang, Zhou Zhao, Ziyue Jiang","submitted_at":"2024-11-15T04:16:45Z","abstract_excerpt":"Recent advancements in spoken dialogue models, exemplified by systems like GPT-4o, have captured significant attention in the speech domain. Compared to traditional three-tier cascaded spoken dialogue models that comprise speech recognition (ASR), large language models (LLMs), and text-to-speech (TTS), modern spoken dialogue models exhibit greater intelligence. These advanced spoken dialogue models not only comprehend audio, music, and other speech-related features, but also capture stylistic and timbral characteristics in speech. Moreover, they generate high-quality, multi-turn speech respons"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.13577","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.13577/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.13577","created_at":"2026-07-05T09:40:21.453686+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.13577v2","created_at":"2026-07-05T09:40:21.453686+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.13577","created_at":"2026-07-05T09:40:21.453686+00:00"},{"alias_kind":"pith_short_12","alias_value":"AZVUUSCO2NP6","created_at":"2026-07-05T09:40:21.453686+00:00"},{"alias_kind":"pith_short_16","alias_value":"AZVUUSCO2NP6MFT2","created_at":"2026-07-05T09:40:21.453686+00:00"},{"alias_kind":"pith_short_8","alias_value":"AZVUUSCO","created_at":"2026-07-05T09:40:21.453686+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":22,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.06540","citing_title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","ref_index":33,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26968","citing_title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","ref_index":115,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23139","citing_title":"Audio Editing in the Era of Foundation Models: A Survey","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21970","citing_title":"Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01345","citing_title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12902","citing_title":"PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11386","citing_title":"Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01677","citing_title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01016","citing_title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17443","citing_title":"Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11167","citing_title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2504.08528","citing_title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20266","citing_title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17443","citing_title":"Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2506.18962","citing_title":"UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2509.26388","citing_title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2603.22267","citing_title":"TiCo: Time-Controllable Spoken Dialogue Model","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25591","citing_title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04613","citing_title":"VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06765","citing_title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14604","citing_title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19245","citing_title":"Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs","ref_index":73,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK","json":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK.json","graph_json":"https://pith.science/api/pith-number/AZVUUSCO2NP6MFT2WBPGZEITAK/graph.json","events_json":"https://pith.science/api/pith-number/AZVUUSCO2NP6MFT2WBPGZEITAK/events.json","paper":"https://pith.science/paper/AZVUUSCO"},"agent_actions":{"view_html":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK","download_json":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK.json","view_paper":"https://pith.science/paper/AZVUUSCO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.13577&json=true","fetch_graph":"https://pith.science/api/pith-number/AZVUUSCO2NP6MFT2WBPGZEITAK/graph.json","fetch_events":"https://pith.science/api/pith-number/AZVUUSCO2NP6MFT2WBPGZEITAK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK/action/storage_attestation","attest_author":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK/action/author_attestation","sign_citation":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK/action/citation_signature","submit_replication":"https://pith.science/pith/AZVUUSCO2NP6MFT2WBPGZEITAK/action/replication_record"}},"created_at":"2026-07-05T09:40:21.453686+00:00","updated_at":"2026-07-05T09:40:21.453686+00:00"}