{"as_of":"2026-08-21T07:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8db679e9850ed09d891c40c3068ba560100f16a90e5803ed32f0be7922f5980b","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:04:33.908292Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:04:28.710605Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:04:34.616301Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"cited_work":{"arxiv_id":"2506.00722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00722","snapshot_observed_at":"2026-08-07T12:04:34.616301Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","venue":"cs.CL","work_id":"1c986848-18b9-4034-a15e-4d1dc740997f","year":2025},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:28.710605Z"},"links":{"cited_paper":"/paper/2506.00722","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:ee2443ab22c65cd77f1f6c7beb63e11ed27d389f6f8b37e847f024261fe94157","observation_id":"5fffcd6a-6b6d-4969-a009-cc3ca9c495d5","resolution":{"observed_at":"2026-08-07T12:04:34.675702Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00722","snapshot_observed_at":"2026-08-01T11:20:17.708968Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19932","last_updated":"2026-08-07T08:39:15Z","snapshot_observed_at":"2026-08-14T00:00:01.957485Z","submitted_at":"2026-07-22T09:04:55Z","title":"Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:20:17.708968Z"},"links":{"cited_paper":"/paper/2506.00722","citing_paper":"/paper/2607.19932"},"observation_digest":"sha256:a5f00bca8a890f32cc15714603b886f8a9776eeaad999fbdca578f7b4e8d7f4d","observation_id":"73327330-5df7-4140-8d91-b147b4471cc2","resolution":{"observed_at":"2026-08-01T11:20:17.708968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00722/citation-record","integrity":"/paper/2506.00722/integrity","json":"/paper/2506.00722/citation-record.json","paper":"/paper/2506.00722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:39.381413Z","title":"De- spite their growing importance, building effective spoken dia- logue systems remains a challenging task due to the complexity of human communication","venue":null,"work_id":"91a2d0a9-77ae-4e6a-bf47-a7db2dc3136c","year":null},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:28.638049Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:7e2487ad036d6fcba84da254c0dff8c942213579256b1b9ed844d47235118af2","observation_id":"3275385d-1d06-4ed2-8613-0cdec743b139","resolution":{"observed_at":"2026-08-07T12:04:39.408493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"cited_work":{"arxiv_id":"2506.00722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00722","snapshot_observed_at":"2026-08-07T12:04:34.616301Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","venue":"cs.CL","work_id":"1c986848-18b9-4034-a15e-4d1dc740997f","year":2025},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:28.710605Z"},"links":{"cited_paper":"/paper/2506.00722","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:ee2443ab22c65cd77f1f6c7beb63e11ed27d389f6f8b37e847f024261fe94157","observation_id":"5fffcd6a-6b6d-4969-a009-cc3ca9c495d5","resolution":{"observed_at":"2026-08-07T12:04:34.675702Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:39.271371Z","title":"tar- get","venue":null,"work_id":"0844e58c-7078-4177-ac70-d8568fdada2f","year":2000},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:28.818087Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:34b88615bc809b48a79b89e2cd4d7bfa5a493e78173fe2a98316852ebbbc92d5","observation_id":"af1bdbe0-775b-45a9-9b10-a04dfaab3ac2","resolution":{"observed_at":"2026-08-07T12:04:39.324937Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:39.185008Z","title":"Spk prompt","venue":null,"work_id":"267a865c-b58d-4f5b-8b74-2c953fb44219","year":2000},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:28.894332Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:b7df5d258820ece3e7c660b3c5a2fd207f0001aea84a21d6ceb9638b153eab78","observation_id":"7f383818-59a6-4a87-9a7e-97b0aa8c134a","resolution":{"observed_at":"2026-08-07T12:04:39.221087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:39.068095Z","title":"SpeechLM E2E","venue":null,"work_id":"6fa831f1-0bcb-4413-a5dc-38e6c9e3faed","year":null},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:28.982116Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:6a1e34561a6c8a43d03b4d887ac96a4bfcefc64dad261ce5c44a664294533ff7","observation_id":"afa856c3-a135-46ca-929e-57e1462259e6","resolution":{"observed_at":"2026-08-07T12:04:39.117633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.981712Z","title":"speaking while listening","venue":null,"work_id":"5b3ae48c-51fe-4615-b22f-92734a06dd0d","year":null},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.048752Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:d74d5fde23057bdc409e41f45d00e3afea7c9ba23790123a2b416d88ccb203c2","observation_id":"70b3e8e3-7e1a-49c7-9d27-3dabb78b0cf4","resolution":{"observed_at":"2026-08-07T12:04:39.025377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.896207Z","title":null,"venue":null,"work_id":"5f647ed0-2abb-4b44-ae45-40b47521da1e","year":null},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.145753Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:5302f91fe2156dab07f9d634fe3599083d71830f03b081d3f58fdf7e0896aa55","observation_id":"8d259898-2dec-4611-a3ce-c87381376359","resolution":{"observed_at":"2026-08-07T12:04:38.929616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.831160Z","title":"Jokinen et al.,Spoken dialogue systems","venue":null,"work_id":"9962c2da-bc19-4312-817c-5d8c78492e41","year":2009},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.250887Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:7e8e1d7a3321e7ba309e561e666cade6d5980468dbda8e003357f6cf1df2e93a","observation_id":"b2c97fe5-98a3-4316-9d69-d2c50c8ea88d","resolution":{"observed_at":"2026-08-07T12:04:38.869816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.737265Z","title":"Social robots that interact with people,","venue":null,"work_id":"41e7b873-0942-4efd-93fe-0e224ed47411","year":2008},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.396887Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:006991b085e32369612126cff5342c104629baf3decd37dafe5a1bfe5a8f1e46","observation_id":"a079a368-b231-47f0-91b7-c43cdf491c52","resolution":{"observed_at":"2026-08-07T12:04:38.776514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.652858Z","title":"Challenges for spoken dialogue systems,","venue":null,"work_id":"4f6c0056-7313-41e8-babb-6e27576dd2f6","year":1999},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.504095Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:75d8c488ba580eab84233ce3b8900d8e1e9e121edaf139e17ffec049d7362c2e","observation_id":"8472b116-2319-4b95-87d9-a369c48c10a4","resolution":{"observed_at":"2026-08-07T12:04:38.692861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.555057Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head,","venue":null,"work_id":"3f64f47d-7af0-4324-8a99-3ba4b7d97402","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.586574Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:1427ed54a08a76d3296cdb16a610acf17059e37fc96d90678b5890c219f9ebc0","observation_id":"514ec6ee-90e9-4dfe-8809-956b2a07f4f0","resolution":{"observed_at":"2026-08-07T12:04:38.597766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.477527Z","title":"Wiseman,Py-webrtcvad, Accessed: 2024-12-10, 2024","venue":null,"work_id":"492ba98c-1d29-4452-9811-7b0be80e46f6","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.669640Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:f5c904bc095055a4a0328d0e4eec9520ba95d13361abe3b33aeadc30288b7fb9","observation_id":"3b013b1b-f082-4a50-99fd-6b676cd1ea02","resolution":{"observed_at":"2026-08-07T12:04:38.519634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.398366Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"023ccd52-0e5c-4532-9d15-819f773da9ce","year":2023},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.751567Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:9f97725851e28c6ba83bcff3db88eebed802b8b16d1b5a9e1a3bbf0477160592","observation_id":"06609268-711b-450f-8a9a-47370e6c77d8","resolution":{"observed_at":"2026-08-07T12:04:38.429081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.340852Z","title":"Reproducing whisper-style training using an open-source toolkit and publicly available data,","venue":null,"work_id":"385dc381-bf4c-4996-b217-45bfa68ecc6f","year":2023},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.822980Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:a03e46aa2632507ff6ca75cb5eaa31333cd291eeeb06d2c50fbd49f32176f1b4","observation_id":"7f481491-5ca4-4e27-990f-76770b03126c","resolution":{"observed_at":"2026-08-07T12:04:38.362200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13570","last_updated":"2020-10-01T00:00:19Z","snapshot_observed_at":"2026-08-17T16:43:47.942270Z","submitted_at":"2020-09-28T18:36:23Z","title":"DialoGLUE: A Natural Language Understanding Benchmark for Task-Oriented Dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13570","snapshot_observed_at":"2026-08-07T12:04:29.893689Z","title":"Dialoglue: A natural language understand- ing benchmark for task-oriented dialogue,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.893689Z"},"links":{"cited_paper":"/paper/2009.13570","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:f5f2abed05d37d4b21e65a95781fe200f3dece93f969454409bf5fd50b1b5ec8","observation_id":"3ffa3e26-6c9e-48d2-980b-135322202982","resolution":{"observed_at":"2026-08-07T12:04:29.893689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.268255Z","title":"Few-shot natural language generation for task- oriented dialog,","venue":null,"work_id":"bce23cdd-37b5-4f14-828c-01a4c11bf5e5","year":2020},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:29.989176Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:6336a8d9e41090d46df27e60f5305b154f6b63de1811e35a08b2f2530f0e82c4","observation_id":"f22beea7-eb57-4278-b3f3-8187c0f29798","resolution":{"observed_at":"2026-08-07T12:04:38.297387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.181544Z","title":null,"venue":null,"work_id":"8e35abb5-d45e-45e7-813d-2ffabea320bb","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.088918Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:860dfdaa2839eec1568406475b5edd6f6b3c5d869f6133f25699bd494a66f5ab","observation_id":"180a7f64-491d-4f52-ad85-7dae5c7f94df","resolution":{"observed_at":"2026-08-07T12:04:38.229983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.101453Z","title":"Switchboard: Telephone speech corpus for research and development,","venue":null,"work_id":"9a492c3a-aebb-4f2f-8012-7028506c20e3","year":1992},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.193100Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:93f138cb57de7677c5fd90f1765e1f48da6ed166afe4a7fa540103cf7b7db494","observation_id":"2f8f7c4a-e6c6-4d0f-b914-11d8bf95a6c8","resolution":{"observed_at":"2026-08-07T12:04:38.127983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00207","last_updated":"2019-08-28T21:35:38Z","snapshot_observed_at":"2026-08-19T13:07:14.478846Z","submitted_at":"2018-11-01T03:43:10Z","title":"Towards Empathetic Open-domain Conversation Models: a New Benchmark and Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00207","snapshot_observed_at":"2026-08-07T12:04:30.292162Z","title":"Towards empathetic open-domain conversa- tion models: A new benchmark and dataset,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.292162Z"},"links":{"cited_paper":"/paper/1811.00207","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:cb20118dca50176ea37c0f3a1a5060f5f6cb9ee305b20184e7096e21c6703ddd","observation_id":"95fc4281-880e-4086-8e0f-1fa147969e57","resolution":{"observed_at":"2026-08-07T12:04:30.292162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:38.019600Z","title":"Prediction of turn-taking using multitask learn- ing with prediction of backchannels and fillers,","venue":null,"work_id":"fada121a-241c-4d6f-850e-b911317b5575","year":2018},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.378219Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:b81b20c89163b3f0f6996eb03414a07ffc7f29367500426d8e283c42c87ed2b4","observation_id":"0fecf16e-49b4-4a13-a455-e77b8ff2b8c8","resolution":{"observed_at":"2026-08-07T12:04:38.058133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.935697Z","title":"Prosodic features which cue back-channel re- sponses in english and japanese,","venue":null,"work_id":"3a3ec047-860f-4449-9d5d-178b55032000","year":2000},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.483496Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:d31245d6b5498289fb17fef71ff95d68dc98cb6f4cf937b7ab55e79b9320de55","observation_id":"582cf38a-c8f3-45d9-92f7-7d0a489993ae","resolution":{"observed_at":"2026-08-07T12:04:37.966742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.893629Z","title":"Automatic acoustic synthesis of human- like laughter,","venue":null,"work_id":"5feb57c7-324b-4077-8051-14230123687a","year":2007},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.568396Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:27f6876ed73504f772ea8505dfda4782ac2ff6ae397486818b0f8218c713717b","observation_id":"47ca166e-e7cd-480c-8db5-630e5d806b0a","resolution":{"observed_at":"2026-08-07T12:04:37.907951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.837278Z","title":"A conversation robot with back-channel feed- back function based on linguistic and nonlinguistic informa- tion,","venue":null,"work_id":"8d666f0b-5deb-47f2-a26e-3d74f9ea7e1b","year":2004},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.633919Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:7ca126c661ced257aabbf97bd86b29f84d81d2441e387185dc786732891a2153","observation_id":"9962d161-8fb8-4812-90ed-a8086abefb5d","resolution":{"observed_at":"2026-08-07T12:04:37.849661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-19T05:23:55.031463Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T12:04:30.764440Z","title":"Speechgpt: Empowering large language mod- els with intrinsic cross-modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.764440Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:38e19b6e8e0766f24d8c42bc598b8e64f22d506de212e2e88bf5b63abd49de0b","observation_id":"fb68686b-f3e2-40f9-a196-7ecebfb1fc38","resolution":{"observed_at":"2026-08-07T12:04:30.764440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.785150Z","title":"Xie et al.,Mini-omni: Language models can hear, talk while thinking in streaming, 2024","venue":null,"work_id":"7cc6e181-749a-4223-aa97-772d938a6a11","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.863948Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:c908ab183f6c9989b2721cc18b544e30f69f9eeecc9fe707544e9e3545104603","observation_id":"67f1c7fa-4684-4f89-8cd1-5f1bef68f736","resolution":{"observed_at":"2026-08-07T12:04:37.808636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.742980Z","title":"Moshi: A speech-text foundation model for real-time dialogue,","venue":null,"work_id":"23691399-e196-4033-8ec0-04230c6fe9d7","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:30.967213Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:2f09fded289d8963bb3ad973eba09a2b1c452986d7c8969c1aa8b7b45db591f1","observation_id":"f772bbac-eeff-4ee5-9d4e-38c156476194","resolution":{"observed_at":"2026-08-07T12:04:37.750467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.710969Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"ed78d001-2123-45b4-9f1b-93080f4647c1","year":2022},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.052552Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:38123d933d80956d0101cc81d51fe5c13a1f1937e8ec664e211340dc665a0adb","observation_id":"eaffa489-33da-48a6-b95d-88405054ab5a","resolution":{"observed_at":"2026-08-07T12:04:37.719663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T12:04:31.120330Z","title":"Automatic chain of thought prompting in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.120330Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:3fede2a8b48154408d9a694d917a75543ae11c60528f55a0c287c8f41a194edf","observation_id":"b0695da3-f98b-49b1-8eb9-cef407085ef6","resolution":{"observed_at":"2026-08-07T12:04:31.120330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.673710Z","title":"ESPnet-SpeechLM: An open speech language model toolkit,","venue":null,"work_id":"4c939598-aa2f-481a-994e-5186469bed22","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.235594Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:fad164c17c8ef597243e97d3ce6ad6ddb3da2aab511637fa8139f215816d0396","observation_id":"a1903272-164d-427e-bbcb-05979ce78046","resolution":{"observed_at":"2026-08-07T12:04:37.688594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.648508Z","title":"Ji et al.,Wavchat: A survey of spoken dialogue models, 2024","venue":null,"work_id":"878171b5-0b99-4f6d-b675-9b21f0be1301","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.334137Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:084e2b42e8fdee7d42bd96aa49efcdd89e322e5be35c9ca871ba885ca84dbef7","observation_id":"75b37a5b-155b-4e53-8385-de08dc27b3bf","resolution":{"observed_at":"2026-08-07T12:04:37.654547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T12:04:31.419862Z","title":"Qwen-audio: Advancing universal audio under- standing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.419862Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:fef4b413345bded8a38aa3549c3bd3e23c95dc743927d672ec584da36fe5ceea","observation_id":"eb42478d-6c08-4a06-b236-b8db484a2420","resolution":{"observed_at":"2026-08-07T12:04:31.419862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-16T13:27:24.086813Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T12:04:31.519528Z","title":"Vita: Towards open-source interactive omni multi- modal llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.519528Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:2f868e30f84cf64ac7a430d2dd88561513d7108cc9d1c8a9bfe9756daa84a715","observation_id":"8e9d583b-8ef8-4035-a643-3f27cd917c3a","resolution":{"observed_at":"2026-08-07T12:04:31.519528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T12:04:31.596425Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.596425Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:2284d81b4f334592952709820eb468d720b18403951f6cd755356eb8fdedbe15","observation_id":"e9c68199-96f5-4c3a-8ce6-0ca1a4b2e412","resolution":{"observed_at":"2026-08-07T12:04:31.596425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13527","last_updated":"2024-01-25T17:24:52Z","snapshot_observed_at":"2026-08-19T05:26:28.592552Z","submitted_at":"2024-01-24T15:25:01Z","title":"SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13527","snapshot_observed_at":"2026-08-07T12:04:31.706485Z","title":"Speechgpt-gen: Scaling chain-of-information speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.706485Z"},"links":{"cited_paper":"/paper/2401.13527","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:bbd886028e985bc22b725316d4636a072e8de02ae6f5d396e03a8269370dfa3f","observation_id":"f639d97f-b435-4472-8113-e18b01eb2ec4","resolution":{"observed_at":"2026-08-07T12:04:31.706485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.626618Z","title":"Generative spoken dialogue language mod- eling,","venue":null,"work_id":"fb2c83de-24b3-4866-b215-b8dfac023ea5","year":2023},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.796410Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:6f36d8ec58f03fbf01003c5a3c26a98b5b58f712189714085b675dd102ff299a","observation_id":"d8644870-f3ed-4279-bc91-0e79b8f81c5c","resolution":{"observed_at":"2026-08-07T12:04:37.633454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15594","last_updated":"2024-09-23T23:01:31Z","snapshot_observed_at":"2026-08-16T13:16:03.933803Z","submitted_at":"2024-09-23T23:01:31Z","title":"Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15594","snapshot_observed_at":"2026-08-07T12:04:31.862397Z","title":"Beyond turn-based interfaces: Syn- chronous llms as full-duplex dialogue agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.862397Z"},"links":{"cited_paper":"/paper/2409.15594","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:02ebe792a7a7cee3b53c25263970c10f890d12b90119035c1322ef590ad31eff","observation_id":"60021f98-1691-4f71-81f2-fde300de9fd8","resolution":{"observed_at":"2026-08-07T12:04:31.862397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T12:04:31.966356Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.966356Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:14396dbcc514ae44de6eb0e941b847bb5f8dbd985cf360c14144345ee333aca4","observation_id":"ce5592c6-903f-44ff-ae2d-861a45d3c6c1","resolution":{"observed_at":"2026-08-07T12:04:31.966356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.571087Z","title":"Parrot: Autoregressive spoken dialogue lan- guage modeling with decoder-only transformers,","venue":null,"work_id":"b9793eb6-edf0-4706-91fb-e02c0cf63eed","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.062938Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:bdf41728ae29e951c7e5dfd248e92c5f5f652034bd9157bae3e14b9f329adf79","observation_id":"214678fc-2ea0-4cd8-a8c5-dd8f580ac8c3","resolution":{"observed_at":"2026-08-07T12:04:37.588627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-08-16T13:06:39.141902Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T12:04:32.164735Z","title":"Omniflatten: An end-to-end gpt model for seamless voice conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.164735Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:9958c751cf9300a4f3cad8930465a096f99ff7450a3912caaabaaf3ef0dd84c5","observation_id":"eb7c36ed-3245-4565-994f-66586859dc67","resolution":{"observed_at":"2026-08-07T12:04:32.164735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:37.208263Z","title":"Audiolm: A language modeling approach to audio generation,","venue":null,"work_id":"330ed66c-c1b0-4b94-a5c9-0babc22c0c1f","year":2023},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.266205Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:b03352b83b93475d234794ca09c015d833072d3250e8443c9a2d2081f1be72c4","observation_id":"47ee95e5-9b67-404d-876b-63204613dbb3","resolution":{"observed_at":"2026-08-07T12:04:37.386081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:36.833464Z","title":"The fisher corpus: A resource for the next gener- ations of speech-to-text.,","venue":null,"work_id":"302e1e3f-2d71-44c2-b0b5-108692b7def0","year":2004},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.358762Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:97bf624fa860b23d746eaa22b2048e5d69ec68530222df5decb1916b43a1ea78","observation_id":"2222b6f6-6cbf-4cef-b04f-68ad6c0c3849","resolution":{"observed_at":"2026-08-07T12:04:36.985959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:36.499216Z","title":"Rouge: A package for automatic evaluation of sum- maries,","venue":null,"work_id":"555aae48-eecd-47e8-816e-bca87f5cf84d","year":2004},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.465673Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:a19bc80387372b936a2742657d304f48d8a37f90ef64c416acfd26b43dfeb694","observation_id":"d97f2445-8715-493a-8ee8-d148d4e8905c","resolution":{"observed_at":"2026-08-07T12:04:36.654739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:36.265425Z","title":"Meteor: An automatic metric for mt evalua- tion with improved correlation with human judgments,","venue":null,"work_id":"fd11a439-bd45-431b-95f8-fff2cbacb97e","year":2005},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.665718Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:7457bf502502fa21b7a311a623bb460e982334b1d01b6b34aa9bb322bc6738b1","observation_id":"cac99c06-27e6-4692-9a43-a2b6a703725b","resolution":{"observed_at":"2026-08-07T12:04:36.373483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:36.087708Z","title":"Perplexity—a measure of the difficulty of speech recognition tasks,","venue":null,"work_id":"5e02f203-0592-42da-92f8-291e2f88644e","year":1977},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.778357Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:e2c645a69c0560c439d960d80298e81500ffe62e64c97eaf69c5e774127c9239","observation_id":"2eaad0fa-a80c-4e64-bba2-1534c9972aa7","resolution":{"observed_at":"2026-08-07T12:04:36.149602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.965122Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"436d7589-753c-4c55-8e3f-64c7efb329fe","year":2019},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.845649Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:c0fa9be0eacb37c71ead3b410aa2a22b3a6ccc8ecbccbb74c91691b58699769e","observation_id":"9c5b451e-04dc-41a6-999c-8e3bd1f95894","resolution":{"observed_at":"2026-08-07T12:04:36.031174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-11T15:07:28.270038Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-07T12:04:32.968338Z","title":"Versa: A versatile evaluation toolkit for speech, audio, and music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.968338Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:b57a90012b5bc254faa5357166424ff524bbd29f549d4fa2897f40369a9a7093","observation_id":"bce3c563-952d-44de-802d-51e9c9e8c4c1","resolution":{"observed_at":"2026-08-07T12:04:32.968338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.837438Z","title":"UTMOS: UTokyo-SaruLab system for voice- MOS challenge 2022,","venue":null,"work_id":"868d0569-8806-4f9e-80d1-e22c5eca11ad","year":2022},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.040888Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:9086b54542167ad52e027e00529a0384c0193610e710b2a2e323f22f8ed31520","observation_id":"82344473-cb3b-46fa-8cf3-083ae7ee41df","resolution":{"observed_at":"2026-08-07T12:04:35.907626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.696470Z","title":"Emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":"0f26b337-cbe9-4e40-b747-4d87a0ffc79e","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.146326Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:da01d23e83ff2122e619be567e3798ec3f77429825fc3f593d42c59256945109","observation_id":"6450d69a-9098-42c2-b047-1a05570eae17","resolution":{"observed_at":"2026-08-07T12:04:35.766771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.552384Z","title":null,"venue":null,"work_id":"7894ecfc-8648-4f26-940e-5a8a4ec220b5","year":2025},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.208286Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:45e0684a660915be94663fe87f2f06e114c156345ecca9a544a6c02ce0a32b32","observation_id":"14252891-b28a-48bc-ae12-c02a804efde9","resolution":{"observed_at":"2026-08-07T12:04:35.616128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.427585Z","title":"Espnet-tts: Unified, reproducible, and in- tegratable open source end-to-end text-to-speech toolkit,","venue":null,"work_id":"067abb03-1abb-44cf-8690-4399f06d6ac3","year":2020},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.278872Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:b4886e45377c57ad50f81aa967b007ea9e4db733409437f892ef38a250967c43","observation_id":"e05b9044-e744-4503-ad34-fa414f63e486","resolution":{"observed_at":"2026-08-07T12:04:35.475910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.267641Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"df5e042d-d83b-4b21-82bd-9f313325ea24","year":2018},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.392059Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:b159faa4df5a1a334a554f468c567e316d42917dbdfc4b4344009b036c5b7b0f","observation_id":"22873f7f-566a-4fd0-89ef-69f90fd64827","resolution":{"observed_at":"2026-08-07T12:04:35.328041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:35.140523Z","title":"Espnet-slu: Advancing spoken language under- standing through espnet,","venue":null,"work_id":"6e097af3-74a7-445a-991e-ef2327a945a3","year":2022},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.509515Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:74dd173d06b01b1ce80ad404083ff5111e673fe7b50f42a38ff80b826b2cd540","observation_id":"837a7668-1b24-4819-8fc7-6e16cedccd22","resolution":{"observed_at":"2026-08-07T12:04:35.183696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:34.987917Z","title":"Simple and controllable music generation,","venue":null,"work_id":"5f605c11-539a-4159-9d51-8955d745a575","year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.641917Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:7ab428f944a8732360b8bad26e6f19e24ace1fcf183e7183e0598fcd83821ab6","observation_id":"4b3d05f1-1b0e-4db2-af8c-02e4934e1445","resolution":{"observed_at":"2026-08-07T12:04:35.032799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15897","last_updated":"2025-02-24T18:34:41Z","snapshot_observed_at":"2026-08-18T10:40:37.420100Z","submitted_at":"2024-09-24T09:16:11Z","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15897","snapshot_observed_at":"2026-08-07T12:04:33.706834Z","title":"Espnet-codec: Comprehensive training and eval- uation of neural codecs for audio, music, and speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.706834Z"},"links":{"cited_paper":"/paper/2409.15897","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:216aee2dfb84c776ebf5755b924217dfc221a86a662aedec480df78fbf05b411","observation_id":"8a5f30cd-9596-4953-bc6d-a8f17d175927","resolution":{"observed_at":"2026-08-07T12:04:33.706834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00837","last_updated":"2024-07-02T17:23:44Z","snapshot_observed_at":"2026-08-16T13:38:19.826616Z","submitted_at":"2024-06-30T21:40:26Z","title":"Towards Robust Speech Representation Learning for Thousands of Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00837","snapshot_observed_at":"2026-08-07T12:04:33.822916Z","title":"Towards robust speech representation learning for thousands of languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.822916Z"},"links":{"cited_paper":"/paper/2407.00837","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:54af35c6aa34a63f920ad4d57da19337a13cb9606669ebd66758beb6ac3f4766","observation_id":"e7ef973d-14e2-43c9-964e-96bbab9d46dc","resolution":{"observed_at":"2026-08-07T12:04:33.822916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:34.793487Z","title":"ESPnet-SDS: Unified toolkit and demo for spoken dialogue systems,","venue":null,"work_id":"201f88e8-41b7-4528-95d4-6cb8e7a4c77d","year":2025},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:33.908292Z"},"links":{"citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:e5d3add4edf723aa3c11ac2549ee44339d61a70fbcd6bdf6394fe9929775734b","observation_id":"e4a9e794-3aeb-409d-95c4-bb5094a10da0","resolution":{"observed_at":"2026-08-07T12:04:34.881160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2506.00722."}