{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e5852243d726bb65ee7d54da28fecba7b927948afde6ab60512ca21c657b808","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:16:11.681586Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29125/citation-record","integrity":"/paper/2607.29125/integrity","json":"/paper/2607.29125/citation-record.json","paper":"/paper/2607.29125"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:08.796391Z","title":"From turn-taking to synchronous dialogue: A survey of full-duplex spoken language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:08.796391Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:da2bffaab69c72c705bc2943460e2ccab239717b01a35ffbfbeca05cbc96b716","observation_id":"8f8e313c-7afa-4e63-a0a4-9cf84afddd07","resolution":{"observed_at":"2026-08-03T13:16:08.796391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:08.905461Z","title":"Turn-taking in conversational systems and human-robot interaction: A review,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:08.905461Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:635327379a5ea6936503d9d11e55c91790dc3a4700c7d27438cb605d0fde23e3","observation_id":"34e635bd-91cd-4e6d-9c2a-ef27582cce22","resolution":{"observed_at":"2026-08-03T13:16:08.905461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.024239Z","title":"Generative spoken dialogue language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.024239Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:f85c1ea54c7371b720479ed0c7657f3dafe3bb132777cc865f9492e94fbf1c2b","observation_id":"facccac1-90bd-4ef5-9ce6-45541ac18583","resolution":{"observed_at":"2026-08-03T13:16:09.024239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.110907Z","title":"Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.110907Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:3712b62ba63645a54d32a47c283baa7bbce5cea5c26205763124c68229e7c6f3","observation_id":"63d6ab26-1521-4dab-b932-ea341e55a2e5","resolution":{"observed_at":"2026-08-03T13:16:09.110907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.277474Z","title":"Talking turns: Benchmarking audio foundation models on turn-taking dynamics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.277474Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:1f567d0fc25109730a179914dadca99908877ea17230cf053870c5cf54fb6c06","observation_id":"883c87ec-07c8-4de7-928a-3142ca0de4ca","resolution":{"observed_at":"2026-08-03T13:16:09.277474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.444000Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.444000Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:fd1242c1d5bc29ef33d9c75afcf93ead910b9215833ddefabfd52bf5806e7a06","observation_id":"264f748a-f22e-4759-90fd-f494174048c4","resolution":{"observed_at":"2026-08-03T13:16:09.444000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.553253Z","title":"Full-duplex-bench v1.5: Evaluating overlap handling for full-duplex speech models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.553253Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:38d18cfaf16c5634633536656f93c95ef9a40dc48c89d4c52a46cfddd72c54b1","observation_id":"5d71ddac-1b28-49c0-9b6b-f8f31f92c581","resolution":{"observed_at":"2026-08-03T13:16:09.553253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.621941Z","title":"Full-duplex-bench-v2: A multi-turn evaluation framework for duplex dialogue systems with an automated examiner,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.621941Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:ae91691c38074032372351f0334a340785b89780a1937f11169e78a21c808a18","observation_id":"e0466355-7a60-4ddf-a11d-57fe2ca36303","resolution":{"observed_at":"2026-08-03T13:16:09.621941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.713495Z","title":"MTR-DuplexBench: Towards a comprehensive evaluation of multi-round conversations for full-duplex speech language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.713495Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:f43db68837dc165eb7ff479e9a68bd99d29c433f3e55fe1e49c28870da02fca3","observation_id":"d514405e-4b01-4339-b06b-e5be04933ff3","resolution":{"observed_at":"2026-08-03T13:16:09.713495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.794008Z","title":"Towards a japanese full-duplex spoken dialogue system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.794008Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:c914b6dfc5555fa4b17d3899780566f358ed67e038f1ccdc19e32f9f56de9348","observation_id":"45e39c7a-d75f-4222-b790-4653faf0e72d","resolution":{"observed_at":"2026-08-03T13:16:09.794008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.843559Z","title":"Effects of dialogue corpora properties on fine-tuning a moshi-based spoken dialogue model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.843559Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:4e4142995430f2d83f8f1af5ee5cc4fd18a1e020acae88a3339e95a33f3dcf87","observation_id":"6c7c749d-4195-43f2-9132-43358c397ee6","resolution":{"observed_at":"2026-08-03T13:16:09.843559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:09.925563Z","title":"The ICASSP 2026 HumDial challenge: Benchmarking human-like spoken dialogue systems in the LLM era,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:09.925563Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:6f8ebc999392d1780161cf45822148f9d8dc51ce1088a02700afea2df98b9c5f","observation_id":"5608f1a0-7c36-4ba4-8a63-5f174ab88850","resolution":{"observed_at":"2026-08-03T13:16:09.925563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.010235Z","title":"FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.010235Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:a74bc9631fe7ca4da2b469d66d8e0d4317e48c1cab2c7fc77eaa2b5fd80a0130","observation_id":"15a7cf94-cace-43f2-aa43-63563ac82ed1","resolution":{"observed_at":"2026-08-03T13:16:10.010235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.112665Z","title":"SoulX-duplug: Plug-and-play streaming state prediction module for realtime full-duplex speech conversation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.112665Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:470386d5a51f39985348c2ca92aab1d792e19476911862b1c0db2f388893d2d7","observation_id":"ae72628b-9c75-42eb-8d4a-73a760e7e2d2","resolution":{"observed_at":"2026-08-03T13:16:10.112665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.227811Z","title":"The candor corpus: Insights from a large multimodal dataset of naturalistic conversation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.227811Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:b7132dea84bbac80a6425b72e56f8bc2b1b65eba859a1e927a3e7e01da2bef20","observation_id":"2224aac8-a9e6-4296-81c7-fa78e94d74ae","resolution":{"observed_at":"2026-08-03T13:16:10.227811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.280411Z","title":"Japanese duplex conversation training dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.280411Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:1111aaeb44eda9b03d87247220299e1ee18a8168693b5bdab78369fb1028a073","observation_id":"00383747-04a3-4b3a-87f5-fbb565bf05a3","resolution":{"observed_at":"2026-08-03T13:16:10.280411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.307804Z","title":"TopiOCQA: Open-domain conversational question answering with topic switching,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.307804Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:68f12ffdae8dc4405185007564b21e8def978f4fffc338f099ac2d123790e1cf","observation_id":"97d74b58-7075-49c7-a349-36b6ec16fb35","resolution":{"observed_at":"2026-08-03T13:16:10.307804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.426421Z","title":"DiaSynth: Synthetic dialogue generation framework for low resource dialogue ap- plications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.426421Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:7b27154627ebf5321f8d99c199833ad54b364bad66ec32248a62b23be3642950","observation_id":"e2bebeb0-0243-4568-956b-3523e92ef81e","resolution":{"observed_at":"2026-08-03T13:16:10.426421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.585016Z","title":"SpeechDialogueFactory: A Framework for Natural Speech Dialogue Generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.585016Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:28acf44bfc72428c329b7b8f175cfbc166a973949c5c5d6821fa343e4c637806","observation_id":"77621781-cb2f-4656-aad4-87948c4a1cfe","resolution":{"observed_at":"2026-08-03T13:16:10.585016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.715680Z","title":"Behavior-SD: Behaviorally aware spoken dialogue generation with large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.715680Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:4fdea40fde375ef754c3f3cd04b6b40556b4ddf7c0f79acd07fc9b6a37ba5e09","observation_id":"c80b46cc-c9c5-402e-b34b-790b1a79e66b","resolution":{"observed_at":"2026-08-03T13:16:10.715680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:10.809105Z","title":"Gemma 4 31b,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.809105Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:80b13af45363f17bce9231ab4a10d5153d82b750901cc861f6f0dd8c1c3a12be","observation_id":"2c4ba526-7ce0-4359-b870-ef7983705d2a","resolution":{"observed_at":"2026-08-03T13:16:10.809105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-03T13:16:10.913379Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:10.913379Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:17a44eecfd3e10ac06a36896e29aa704109f4e8dfa4e1859a81866ee1a606822","observation_id":"ce19a3be-1a9c-4204-ba60-54bf98f7905e","resolution":{"observed_at":"2026-08-03T13:16:10.913379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-03T13:16:11.024485Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.024485Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:4f5f7510512026689f506a352051e7a2d411e4bb91dd80d7660ce40abf15eb15","observation_id":"4a634a0c-0fbf-48bd-ac03-21f7799465fb","resolution":{"observed_at":"2026-08-03T13:16:11.024485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:11.152025Z","title":"faster-whisper: Faster whisper transcription with ctrans- late2,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.152025Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:039de08d8042f3593be6ff8075dc8d8dd476acf3351b70eddcd5525f47c28661","observation_id":"d2816b7d-6bae-48c0-930b-4a6dcdfe61a1","resolution":{"observed_at":"2026-08-03T13:16:11.152025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:11.256072Z","title":"Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.256072Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:2c3d7722d714b1be8a3111609cc9e0d23c922ed99373374907a41f4f80718de8","observation_id":"1e098d26-33ce-46c0-8d48-c4d35e44f919","resolution":{"observed_at":"2026-08-03T13:16:11.256072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:11.306508Z","title":"GPT-5 nano Model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.306508Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:c8d8227a057b67766be7a2520caddb8c2e63f130dc0e5b61612132967ed48d86","observation_id":"71535aca-db61-48ca-a2e1-11e9c75f59c5","resolution":{"observed_at":"2026-08-03T13:16:11.306508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-03T13:16:11.443550Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.443550Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:62c23c0dfb700b1a4821b415ab73d6db8daead4b09d070145fd6b4383f7867a7","observation_id":"f8b17d0b-2f27-4366-b396-ce17535c1107","resolution":{"observed_at":"2026-08-03T13:16:11.443550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-03T13:16:11.540208Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen LLM,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.540208Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:6f39d006c464731ef2f06413a48bed84bcff385b138725a24050a012af91415a","observation_id":"b26e331d-2228-47ad-a1d3-b11dd57b5500","resolution":{"observed_at":"2026-08-03T13:16:11.540208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:16:11.681586Z","title":"PersonaPlex: V oice and role control for full duplex conversational speech models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.681586Z"},"links":{"citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:71354fff233f6bd1ec1e28759047abad95f06de70d2f69a0a59f2d0bfd61a840","observation_id":"78fa95bd-d1a4-452b-a6e9-065d51382d03","resolution":{"observed_at":"2026-08-03T13:16:11.681586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.29125."}