{"as_of":"2026-08-23T00:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:102db1e054a96454565410a258f8ab81a7ae5c2e85317b12503764129ba6a8f0","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:45:45.876390Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:53.542723Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:32:03.639643Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00805","snapshot_observed_at":"2026-08-07T11:28:53.542723Z","title":"Slide: Integrating speech language model with llm for spontaneous spoken dialogue generation.arXiv preprint arXiv:2501.00805, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-13T12:54:08.987275Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.542723Z"},"links":{"cited_paper":"/paper/2501.00805","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:0aaf8ffef2cf5b18db41a191e5387cd855c81300f6c6d40d10fbe1d72f90d0be","observation_id":"497f7294-6426-4c88-8ee4-a722d4b124f6","resolution":{"observed_at":"2026-08-07T11:28:53.542723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"cited_work":{"arxiv_id":"2501.00805","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00805","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slide: Integrating speech language model with llm for spontaneous spoken dialogue generation","venue":null,"work_id":"5ec582dc-4b97-4747-9e8b-4512804f6a11","year":2025},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-14T15:29:48.583976Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2501.00805","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:c58d03f7a7c485b6380ec34641ea3f3534c2cbc4473e222496ec87e3ef98f01d","observation_id":"7bd9e1fe-4305-4104-9a73-1fdd6317cf05","resolution":{"observed_at":"2026-05-19T04:32:03.641862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00805/citation-record","integrity":"/paper/2501.00805/integrity","json":"/paper/2501.00805/citation-record.json","paper":"/paper/2501.00805"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.446952Z","title":"Generative spoken dialogue language modeling,","venue":null,"work_id":"e1f6fd9d-bd9c-4846-b2ed-f416227af9d6","year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.703473Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:5ff1d3014baf2f98f9253cdf499c5ed362fa0a12da83ce9a74ea39a33ca1dccc","observation_id":"c1f13b47-4266-4b13-a672-b7e0e900163a","resolution":{"observed_at":"2026-08-10T22:45:46.452793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.710816Z","title":"Audi- olm: a language modeling approach to audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.710816Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:2c37a6e7fa74eee6f83fed66bc9ed7453839a3243946b5956d65b220ad63c831","observation_id":"e90331e2-b278-4970-a764-49d840f4a831","resolution":{"observed_at":"2026-08-10T22:45:45.710816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-21T19:19:25.551780Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-10T22:45:45.716220Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.716220Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:ac794060b05043d3239faf884e6441b2625b78e8b1fe846688caf8b1db611514","observation_id":"acd24cf1-1811-4016-bba1-ac85bbff0373","resolution":{"observed_at":"2026-08-10T22:45:45.716220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.723251Z","title":"Recent advances in deep learning based dialogue systems: A systematic survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.723251Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:85c4c777800e27b90f02fbc5af3dfca06ecb7b575ee1219cdef6fcfd8501c23d","observation_id":"201c3ad0-9b03-45eb-8bd1-e1e7b63e572d","resolution":{"observed_at":"2026-08-10T22:45:45.723251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.405639Z","title":"On temporal aspects of turn taking in conversational dialogues,","venue":null,"work_id":"dd2590cf-dfed-4c2a-88e0-c4f1ce133e17","year":2005},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.729756Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:81b0cd4bd59c74ec938ebdfeb7556775dc77c0f2cbd6cc4dc68ba081f7889c97","observation_id":"c84f050a-679c-4bcc-af45-b4aa5639eded","resolution":{"observed_at":"2026-08-10T22:45:46.411463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.388464Z","title":"Pauses, gaps and overlaps in conversations,","venue":null,"work_id":"e5b1b655-ff35-4538-bcb0-4d92fe247e3a","year":2010},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.735494Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:1fd34abc91924fe9b50ba0c88a7d4e7f562381c1d00b82a41d4a40bf0053eaf6","observation_id":"21c358df-fe1a-4d25-824e-6247b26cc346","resolution":{"observed_at":"2026-08-10T22:45:46.393468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.371032Z","title":"Conversational short-phrase speaker diarization via self-adjusting speech segmentation and embedding ex- traction,","venue":null,"work_id":"29dd9430-a886-49ba-99b5-6a92b8d0dedc","year":2024},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.741341Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:b8b881217e03b9718e6113ff96843f2c0e01c8f8dee4b26b22db17f5e8a4d681","observation_id":"11429796-fa42-4df1-82f7-533cbc482687","resolution":{"observed_at":"2026-08-10T22:45:46.377277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.351354Z","title":"Improving spoken question answering using contex- tualized word representation,","venue":null,"work_id":"c40c00ef-c52d-4b4f-aaed-8e506562329a","year":2020},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.746228Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:b1bf311ba9dabf4a06b636acaedf943bc13dfce72b78269810c4eba95e1fa61f","observation_id":"164d34c5-ad3d-42a5-acab-ad72d66fd1c2","resolution":{"observed_at":"2026-08-10T22:45:46.357317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.332617Z","title":"Towards Machine Comprehension of Spoken Content: Initial TOEFL Listening Compre- hension Test by Machine,","venue":null,"work_id":"fe1aed8b-8193-4eaf-b694-b63b9026067d","year":2016},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.751804Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:eff8d3b446c0a106b47639a560e4b8946341a1580d7eaa7c8bea9ae96e05087f","observation_id":"9e29aa47-60df-43fd-9411-d16ad58fbb97","resolution":{"observed_at":"2026-08-10T22:45:46.338297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.305871Z","title":"Unsupervised domain adaptation on end-to-end multi-talker overlapped speech recognition,","venue":null,"work_id":"154ca6b5-c93a-45f0-86fe-0768d7e2e789","year":2024},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.756796Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:b09d44715d7de2d756620cce24b5007d162fc06fbdcb73aed9ebe3a109aaa668","observation_id":"274817dc-4519-47b6-af30-8f395b22c2e9","resolution":{"observed_at":"2026-08-10T22:45:46.319697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.290046Z","title":"Ada and grace: Direct interaction with museum visitors,","venue":null,"work_id":"e2678552-1035-49e7-88e1-22453ef280f9","year":2012},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.761686Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:45620e12ff6603e97166554ca90cc1cb95e6f37d8ed8afe3743c4d74d8a9b917","observation_id":"e57ab63f-7f48-447b-a47b-494ee226a9c6","resolution":{"observed_at":"2026-08-10T22:45:46.295012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.274740Z","title":"Turn-taking in conversational systems and human-robot interaction: A review,","venue":null,"work_id":"8c184579-6f18-403c-8941-1791616f784e","year":2021},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.766483Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:2dd9b9748659e82196350d9411a5570379a0bcdbf171c652bf1064979a412ff3","observation_id":"9bcdade7-744e-4a57-8126-3d7d7481778a","resolution":{"observed_at":"2026-08-10T22:45:46.279689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.258732Z","title":"Can a robot laugh with you?: Shared laughter generation for empathetic spoken dialogue,","venue":null,"work_id":"1c442c1d-0cb7-4865-b558-e14aceffcc6c","year":2022},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.771349Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:5b2bb1c8bf887db0a8594f35556270a066f9d55dc210aa83a03a307806ce71c7","observation_id":"d67d6f99-992b-4725-a2c2-4ac3f8b982d7","resolution":{"observed_at":"2026-08-10T22:45:46.263870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.775914Z","title":"On gener- ative spoken language modeling from raw audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.775914Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:a83e9c548c5281e986d6c9660d6dd3c3dc2271dccbc7ba2daa7e5ca87c70cab1","observation_id":"7c2fe453-018e-4522-a8ae-666394fcce7d","resolution":{"observed_at":"2026-08-10T22:45:45.775914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06690","last_updated":"2024-12-15T16:30:54Z","snapshot_observed_at":"2026-08-18T09:11:20.517508Z","submitted_at":"2024-04-10T02:32:58Z","title":"CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations","version":3},"cited_work":{"arxiv_id":"2404.06690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.06690","snapshot_observed_at":"2026-08-10T22:45:45.952747Z","title":"CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations","venue":"eess.AS","work_id":"20f28980-0c00-48ef-a944-97355dbad09d","year":2024},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.780416Z"},"links":{"cited_paper":"/paper/2404.06690","citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:213ca56410138b19eeb366e9aed88dec5ce5d4e4b24ee647470dae5dccd79020","observation_id":"6956d664-a7a5-4bbc-881d-7bf63c664fe4","resolution":{"observed_at":"2026-08-10T22:45:45.960730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01088","last_updated":"2023-10-02T11:03:20Z","snapshot_observed_at":"2026-08-16T14:55:55.102426Z","submitted_at":"2023-10-02T11:03:20Z","title":"Towards human-like spoken dialogue generation between AI agents from written dialogue","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01088","snapshot_observed_at":"2026-08-10T22:45:45.785365Z","title":"Towards human-like spoken dialogue generation between ai agents from written dialogue,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.785365Z"},"links":{"cited_paper":"/paper/2310.01088","citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:afd9ce61f646f0719eccd1c0fc98d184a6f30306834f9347a97caa9e068b27af","observation_id":"693c18de-3e3f-49ca-bd38-1c3933efa3dd","resolution":{"observed_at":"2026-08-10T22:45:45.785365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.790584Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.790584Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:db3e779ebc118acdb2ab30a4a2937fb678dda4583b9dbbe060d0cfaff5972c74","observation_id":"8771c1af-5131-4bcd-8e5e-d16ec87820db","resolution":{"observed_at":"2026-08-10T22:45:45.790584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.795291Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.795291Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:1d159fb5fd73aadc662cd37e1b0e42e092eaff9d765b5aa55521adb4890ee90e","observation_id":"2c35f0b9-6185-4317-a8ba-7cf5d52b2856","resolution":{"observed_at":"2026-08-10T22:45:45.795291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.800097Z","title":"Asq: An ultra-low bit rate asr-oriented speech quantization method,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.800097Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:e0776c6d2705cb1b6885a3e32074941a5218cb79853cbc5ff3abe410332ca663","observation_id":"d4432d16-84d4-4885-b814-d4d215301349","resolution":{"observed_at":"2026-08-10T22:45:45.800097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.191712Z","title":"Self-supervised pre- training for attention-based encoder-decoder asr model,","venue":null,"work_id":"54bb7b01-3fc4-46ec-b877-1bad1e453b38","year":2022},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.805290Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:7c26b7b4e2542cda8c8f1b8d745b2461a0975a543d5e750948ff3a4aefe1cf1e","observation_id":"525c54f2-c31a-49b8-a7e6-ee176b0879cd","resolution":{"observed_at":"2026-08-10T22:45:46.197219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.810349Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.810349Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:919469720733b79a3a0b94164d3f2db04448d5e098af6dc323921f6bd151123d","observation_id":"e39b22d4-a555-4164-9233-9a0dad8387f9","resolution":{"observed_at":"2026-08-10T22:45:45.810349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.165493Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations,","venue":null,"work_id":"bdb56d4c-a144-48eb-bb48-1487dad54fd7","year":2021},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.814802Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:9b1defdb7b70570ebe27ccc759836ffa595ecb3e225298bed9c47bb9ea1baf4c","observation_id":"0c116020-6a96-4fef-9b11-db530a13886a","resolution":{"observed_at":"2026-08-10T22:45:46.171063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.819442Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.819442Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:5c457d93df226474f9fbf97b4c80107df868fa63817565c81f03ea3ed4409c04","observation_id":"0c46f2c8-a693-492d-a601-41ab705d5429","resolution":{"observed_at":"2026-08-10T22:45:45.819442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.140011Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"9820712a-a610-43f0-916a-fcb328331d8f","year":2024},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.823653Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:a455264839b7872b6b19c05e1a2309646244ee57aaf90de2403d2a98aed14ac6","observation_id":"5cfbc1d0-2916-46a0-a086-97fbaa7d6201","resolution":{"observed_at":"2026-08-10T22:45:46.144679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.123814Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A compar- ative study,","venue":null,"work_id":"9d265305-2bb5-4772-99af-fb21882f84bd","year":2024},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.828921Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:28c5c11c8f53ff3f815babbd19487740fcdab3a76873bbc43f88d1cda409bcb5","observation_id":"296a36ba-acff-4f73-9302-aa3e644f23c7","resolution":{"observed_at":"2026-08-10T22:45:46.129258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.105242Z","title":"The fisher corpus: A resource for the next generations of speech-to-text","venue":null,"work_id":"6041a497-84c0-4f4a-8d48-fa9a9235b7d9","year":2004},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.834641Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:04dfb3268aa9fd06ef0e7c6158a79d76d808237d341593f9461ebec0fb9463cf","observation_id":"c0fdd959-96bf-4f28-b536-3cb486d317f8","resolution":{"observed_at":"2026-08-10T22:45:46.111162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.086772Z","title":"Torchaudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for pytorch,","venue":null,"work_id":"87af4533-3b72-4f11-b523-2bfe546735a1","year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.840451Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:e307ea90eec4529eec7d96713f49f652076c47737f31f6c179cdcb1674e86416","observation_id":"e8b9763d-5e98-4bae-aa94-df9cd64aa802","resolution":{"observed_at":"2026-08-10T22:45:46.092773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.845728Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.845728Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:4971a61c9aa8e05c8e615dbe0a5e8653541dcfb04957052e77bec95f3e195890","observation_id":"6d7b7f74-e19c-4e79-ac74-da75cdb3eeda","resolution":{"observed_at":"2026-08-10T22:45:45.845728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:45:45.852022Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.852022Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:2545f1e381b3980de6303b862a677876d7be5ca89f54a15757acd781cf992145","observation_id":"d7825b56-12e1-401c-9f1b-5c8c8155044a","resolution":{"observed_at":"2026-08-10T22:45:45.852022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.857136Z","title":"Park and J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.857136Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:c83c695c41b9ba9b861c4f26498c865a97f8ab6b03ed915d3cf5ee488255dc98","observation_id":"db416ff3-16a0-4d68-b017-fbe7f120d87a","resolution":{"observed_at":"2026-08-10T22:45:45.857136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.047298Z","title":"Montreal forced aligner: Trainable text-speech alignment using kaldi","venue":null,"work_id":"ac0ecb2c-4d2c-43b5-9c52-408725bd85ba","year":2017},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.861771Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:374c2ecdabb03d8771a13ee3426eb42dc2f7723aa7e349e1e67751df0cdb2825","observation_id":"de0c52ae-1e58-4bc2-90f9-150170ce3067","resolution":{"observed_at":"2026-08-10T22:45:46.052561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.030570Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":"79e23401-0bab-4a68-9e4e-6da726ef844b","year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.867083Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:b4a10a75a475a2f66e0650b6f27ad8a76ae4a518c437bd59149912f62ef88c21","observation_id":"433cf986-2a44-4312-8716-9d4b95b1cda9","resolution":{"observed_at":"2026-08-10T22:45:46.035864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:46.010855Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe,","venue":null,"work_id":"2d23c7b2-8590-44d1-a4cc-04ec99307190","year":2023},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.871585Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:1fc85a57463b234a95a2ac6d7196c723df5c551b0d85314bc42660477d2c4a6f","observation_id":"6dba7d08-9e29-46ad-a501-c2d0ccb2defb","resolution":{"observed_at":"2026-08-10T22:45:46.018113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:45.988527Z","title":"Dialogpt: Large-scale generative pre-training for conversational response generation,","venue":null,"work_id":"68ac8fab-a29f-4dbc-9fb4-1a84cc596fca","year":2020},"citing_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:45.876390Z"},"links":{"citing_paper":"/paper/2501.00805"},"observation_digest":"sha256:f033116f46a7893cdc7b700997b425b65a5d73e9b7a84f0c0109b6e1773067c7","observation_id":"66aa7c8c-3258-4548-b179-a856b212f780","resolution":{"observed_at":"2026-08-10T22:45:45.993518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T22:40:01.895752Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2501.00805."}