{"as_of":"2026-08-11T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e8a21768d89310d760525cacc520086eb7c215b0de6492188b251278bd2fe80","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:32:05.104984Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T23:17:03.456746Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:17:28.830734Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2508.18167","last_updated":"2026-05-14T18:20:00Z","snapshot_observed_at":"2026-08-04T20:09:49.064679Z","submitted_at":"2025-08-25T16:16:42Z","title":"DiscussLLM: Teaching Large Language Models When to Speak","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T22:09:03.740109Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2508.18167"},"observation_digest":"sha256:63ff645bb55a6bae2e8e4ec1274d0e79eca4b915c72168830a13668b4e3a3d40","observation_id":"98d0d316-9867-42b6-906e-0f4a5197af4f","resolution":{"observed_at":"2026-05-21T22:10:42.302323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2605.23954","last_updated":"2026-05-11T06:30:25Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-05-11T06:30:25Z","title":"EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T22:52:43.396119Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2605.23954"},"observation_digest":"sha256:1d452f9b0f947193cea52d12a8b8db3ea9e2bdb115737ea3ae37080301a58b98","observation_id":"591a55c2-6b29-4495-81f7-6d9c3820f334","resolution":{"observed_at":"2026-07-01T13:45:45.501676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T15:18:17.427707Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:be58ccb642378702497378b9e67ac1510933e2ef08e5ec4ad34ecd16a0630aeb","observation_id":"34137ee2-642b-454d-b847-092e5d8a2f04","resolution":{"observed_at":"2026-07-01T22:36:17.001064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-02T23:17:03.456746Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:8cc6f3e9307d10c7e9f3504c0c4021be0b2ede453dd56ab17bdae511ee3a6047","observation_id":"166861d5-7603-435a-95a3-54759ec464b2","resolution":{"observed_at":"2026-07-02T23:17:28.832711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2606.04306","last_updated":"2026-06-03T00:25:56Z","snapshot_observed_at":"2026-08-05T10:27:41.050145Z","submitted_at":"2026-06-03T00:25:56Z","title":"Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T04:17:18.483765Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2606.04306"},"observation_digest":"sha256:e7406ba5cbf373da0d145281208e6fdd7c31182d9acbb344cd33dadc42777420","observation_id":"719381de-8387-42fb-8ead-4d789199210c","resolution":{"observed_at":"2026-07-02T11:16:53.731741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01384/citation-record","integrity":"/paper/2501.01384/integrity","json":"/paper/2501.01384/citation-record.json","paper":"/paper/2501.01384"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.13340","last_updated":"2025-01-16T08:34:36Z","snapshot_observed_at":"2026-08-06T08:45:30.995210Z","submitted_at":"2024-06-19T08:46:29Z","title":"SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13340","snapshot_observed_at":"2026-08-10T22:32:04.897175Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.897175Z"},"links":{"cited_paper":"/paper/2406.13340","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:153df80db2066f3d0a375469801d07f63b137a442ab27474b14c379f17acd7d8","observation_id":"6f033cc8-adac-4012-aae0-4cf27578d44c","resolution":{"observed_at":"2026-08-10T22:32:04.897175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-10T22:32:04.927050Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.927050Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:8090251cb7de97a71e1dcdf927823fd592ac51cb70c3e4ed8b14bd5b6e3bffbd","observation_id":"0d6982a2-999e-4f38-8807-0b918d657330","resolution":{"observed_at":"2026-08-10T22:32:04.927050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T22:32:04.952630Z","title":"20 Preprint version Kristina Jokinen and Michael McTear","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.952630Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:b5ab73560daacd70cfac6536ed2adecea6880b59eb04ec8aa50167d553b1c8c7","observation_id":"ac489d20-9269-4d47-9b1f-015ee9aef61b","resolution":{"observed_at":"2026-08-10T22:32:04.952630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.782062Z","title":"Dailytalk: Spoken dialogue dataset for conversational text-to-speech","venue":null,"work_id":"2cf613d2-9416-47f5-b351-e2ce18cf83f4","year":2023},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.973121Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:77e0dca9e6c077375e1e0504a3877307927a01164d178ac82e0ef5143e58980d","observation_id":"eea48f33-c7b0-4afa-98f3-7c95a493b137","resolution":{"observed_at":"2026-08-10T22:32:05.788900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12786","last_updated":"2024-05-30T09:06:34Z","snapshot_observed_at":"2026-08-10T19:45:32.749050Z","submitted_at":"2024-02-20T07:51:43Z","title":"Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12786","snapshot_observed_at":"2026-08-10T22:32:04.980466Z","title":"Advancing large language models to capture varied speaking styles and respond properly in spoken conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.980466Z"},"links":{"cited_paper":"/paper/2402.12786","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:a97e595d4e6094dbf86500fcea71d6fead622350f373cd5de39b5cdce260e693","observation_id":"a1bda65c-69da-42a3-9bee-ba9a7428ecda","resolution":{"observed_at":"2026-08-10T22:32:04.980466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-10T23:36:01.623927Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-10T22:32:04.987198Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.987198Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:b7d66a3412a2a14794953ab8a700c502a7b32c7f5e07c741e8d8aaefdeadbbef","observation_id":"cab6075e-e96e-4126-8053-974c7a93de7b","resolution":{"observed_at":"2026-08-10T22:32:04.987198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-07-06T16:04:58.235073Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-10T22:32:04.997721Z","title":"Expresso: A benchmark and analysis of discrete expressive speech resynthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.997721Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:f09a575afc049e1118c1da4a12c11c97ccec73df8f09f683385f586ea1c8c7f3","observation_id":"ee9a3be0-a176-45b5-bda9-b2bdf0e8327e","resolution":{"observed_at":"2026-08-10T22:32:04.997721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-09T15:41:11.041317Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-10T22:32:05.020670Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.020670Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:979cdd9c8ff58f01a322cd21a59604b78527402539c554cb67a235809db7c95a","observation_id":"afe84b7f-9da2-47d1-bc17-7dabddfe33cb","resolution":{"observed_at":"2026-08-10T22:32:05.020670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.682692Z","title":"A neural network approach to context- sensitive generation of conversational responses","venue":null,"work_id":"ea7d8ce5-2a10-46bd-af21-6c3425d9e15d","year":2015},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.039082Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:1bc110e33c7a68d4d57e81e2c0db3fdaaf7a1b5869c845fe6b0e0359f4825a0b","observation_id":"9671ed34-5a79-4e7e-bbbb-c4cda352f985","resolution":{"observed_at":"2026-08-10T22:32:05.692164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-10T22:32:05.053591Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.053591Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:88f41c28282275042a50efb3ba42aa96d8b3f3aef4d03fd0a17f7eece142b152","observation_id":"1ad2cbf5-6b74-41b7-9b27-00e041e858cf","resolution":{"observed_at":"2026-08-10T22:32:05.053591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:32:05.059346Z","title":"Llama 2: Open founda- tion and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.059346Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:73744b3b94bb5eadd64c69bebd91ac6f072799b5d04372d62f23a0b65d1da348","observation_id":"88a7abdf-79f4-43e8-81b2-56563feb7325","resolution":{"observed_at":"2026-08-10T22:32:05.059346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00475","last_updated":"2024-07-27T07:45:43Z","snapshot_observed_at":"2026-08-04T15:15:20.818594Z","submitted_at":"2023-12-31T12:29:12Z","title":"E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00475","snapshot_observed_at":"2026-08-10T22:32:05.068528Z","title":"E- chat: Emotion-sensitive spoken dialogue system with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.068528Z"},"links":{"cited_paper":"/paper/2401.00475","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:5c68c46112ba376766938deec9dfba169d8c1ebe163ba58f7f259135a0f774de","observation_id":"a5841562-877b-45c3-bd93-eb0892b3e020","resolution":{"observed_at":"2026-08-10T22:32:05.068528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.653920Z","title":"AIR-bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":"87b377ac-92ff-426c-982c-8fc0e7b67cf5","year":1979},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.076706Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:2688fee96cd1f0be4a8080725400c1b43c2c3691884b94d34c551edfe77982ca","observation_id":"e43f5829-5526-46f4-9607-2323038d955b","resolution":{"observed_at":"2026-08-10T22:32:05.661560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.625694Z","title":"URL https://aclanthology.org/2024.acl-long.109","venue":null,"work_id":"5a4e0b73-f2d6-4fc3-9231-f85f84c3bdc5","year":2024},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.086658Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:f66b5235dd11a38acb4ce2ff1dc27138714d31704aae73d47c263dacc8966b60","observation_id":"adc1fbc1-a86d-44fb-aee8-b0fc8579a74b","resolution":{"observed_at":"2026-08-10T22:32:05.634168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-10T22:32:05.104984Z","title":"Bertscore: Evaluat- ing text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.104984Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:028070b9cce611c7d564c7261272f9f4c4027077abcdbfb11ce8ccdc7559bffc","observation_id":"01ab8409-5a99-4ad8-afe2-e538f4505f41","resolution":{"observed_at":"2026-08-10T22:32:05.104984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.763077Z","title":"The cocktail fork problem: Three-stem audio separation for real-world soundtracks","venue":null,"work_id":"8321f3b4-abb4-4b69-a939-b0c74aecfc4f","year":2022},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.003775Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:5da096e3d30dd1328c8fa96ffb8902f6359c37741e70cf206520424ec87f98cb","observation_id":"877814fe-560f-402c-b46d-27869174b329","resolution":{"observed_at":"2026-08-10T22:32:05.769732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-10T22:32:04.935843Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.935843Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:ff2f4f07b8962e28aab399d3313f2c798f84a207660dd74051659dd6d03e55d4","observation_id":"5dc1f954-88bb-4038-835a-2cee7b608670","resolution":{"observed_at":"2026-08-10T22:32:04.935843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18042","last_updated":"2025-03-20T08:47:39Z","snapshot_observed_at":"2026-08-10T23:03:30.048848Z","submitted_at":"2024-09-26T16:44:02Z","title":"EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18042","snapshot_observed_at":"2026-08-10T22:32:04.906306Z","title":"Emova: Empowering language models to see, hear and speak with vivid emotions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.906306Z"},"links":{"cited_paper":"/paper/2409.18042","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:9762ca066389da8fa36d70326193f0032f90f65aad9994d018ac76518a0c6190","observation_id":"52a13339-d729-401b-a598-487c74ecd778","resolution":{"observed_at":"2026-08-10T22:32:04.906306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.802823Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"1e67573e-da0f-46a4-a6b0-e863b07d83b3","year":2019},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.958676Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:79cb424a994bbde10588b59ee6d0571d43637df9d350f3fa757c765ad6c842e2","observation_id":"6c7903c7-8257-44d3-9781-757f4e9e1fec","resolution":{"observed_at":"2026-08-10T22:32:05.808751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-10T22:32:05.045777Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.045777Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:9ad84581fa24f1464405cf36c49db5b58fe41b782e77af6ebe4ff6c622990c6e","observation_id":"d88343bf-aec6-4c1d-8fe9-89664e868fb1","resolution":{"observed_at":"2026-08-10T22:32:05.045777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-10T22:32:05.095673Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abil- ities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.095673Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:f6a69c1b0c72e7e4e88212cdaaabad00cd8b2252646a03fbdb820326b1fe8dc2","observation_id":"f3b5d209-1f93-46e1-82d0-411060b47e74","resolution":{"observed_at":"2026-08-10T22:32:05.095673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.707204Z","title":"End-to-end task-oriented dialogue: A survey of tasks, methods, and future directions","venue":null,"work_id":"c8520e38-d97f-476b-ba00-bd1cc42c0edc","year":2023},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.028644Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:23ddb168a83a7d8ca84c7c704b28b68c65ae32c202af14f41d71e4e65478b9cd","observation_id":"fbdf322f-519a-4dba-b972-20fc0eb0faa9","resolution":{"observed_at":"2026-08-10T22:32:05.713573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-07T19:26:44.980429Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-10T22:32:04.966190Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.966190Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:85753cda73aad2e202ea5801715115afae906fdf1f40fa86f19991b43653c89f","observation_id":"b9183a36-597e-44dd-b039-53690bfd8af4","resolution":{"observed_at":"2026-08-10T22:32:04.966190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.735785Z","title":"Powerset multi-class cross entropy loss for neural speaker diariza- tion","venue":null,"work_id":"7bd8bac5-ece7-493b-9c0d-917d71e80fa6","year":2023},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.011324Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:1cd982aeb1e189b928020b4c19370e412fcdd97aff48044d59691a8eb35eaa8c","observation_id":"80b7864c-4b9e-420f-8ed2-081b2ee94f50","resolution":{"observed_at":"2026-08-10T22:32:05.744280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T22:32:04.916461Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.916461Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:b5d6da966a95ccd08444d101d2b094cf5c75ae4592adef50cd50f15084a1fca0","observation_id":"988a7467-632c-4296-85ca-059b6b981f90","resolution":{"observed_at":"2026-08-10T22:32:04.916461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:32:04.944578Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.944578Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:4fa90bda1c8290ebb423689dd422e867732c0765ff3fa3ef3ee022a812544177","observation_id":"11f15a96-f792-494b-9a28-65498dc40a30","resolution":{"observed_at":"2026-08-10T22:32:04.944578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T12:27:45.606908Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 5 inbound Pith citation observations for arXiv:2501.01384."}