{"as_of":"2026-08-09T12:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3801ab1f63cb1ba8ad705bd51e2cd7c0462e9d813e53b165792b8de4ca2d59b","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:17.917163Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:59:35.258176Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19978","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2505.19978 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2505.19978","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0676f420c8f817e604f4e6538eba9344be1aaae9daaedaf4c055cbdb759be99b","observation_id":"4c03c341-584d-49d8-96e2-1f86307a08dc","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19978/citation-record","integrity":"/paper/2505.19978/integrity","json":"/paper/2505.19978/citation-record.json","paper":"/paper/2505.19978"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-07T14:09:11.764749Z","title":"Phi-4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.764749Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:93f76cf8aad6dc451acd14c1cb7ce540edde4a76c90e09ca0d19553626a30796","observation_id":"1360fef1-4093-4df7-a7fe-2ce753ffff14","resolution":{"observed_at":"2026-08-07T14:09:11.764749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T14:09:11.857945Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.857945Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:cc71bf00b11084d89fd865693d386070ec104d0a5a13e6c1febbf19c665919b2","observation_id":"e68a2899-a994-4d0a-a3f5-1df6f94cfb16","resolution":{"observed_at":"2026-08-07T14:09:11.857945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:09:11.985785Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.985785Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:c5bf91b95be2e3753fa1d5449e8a6c3c5bf8e7f916978df6e69c8f0a1dfd4345","observation_id":"2e349aba-a190-40b1-9015-97e924ca7ed4","resolution":{"observed_at":"2026-08-07T14:09:11.985785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:27.018912Z","title":"Sd-eval: A benchmark dataset for spoken dialogue understanding beyond words","venue":null,"work_id":"46463a48-30d1-4d85-aedb-42fe38532a36","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.106842Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:f224c564ec2b6dac04b1826ab9ef4c8140f6c2515ff04fc709ef50376e1b18f7","observation_id":"cfe91b68-098a-4b67-bc65-6aab87b01e71","resolution":{"observed_at":"2026-08-07T14:09:27.137963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.317889Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.317889Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:90ab73af8e0169ecf6e35b572d9afa7fde024ca16bea7d4929a34c40e91e1d34","observation_id":"d7d80c69-c3f8-466f-be26-f6e43c8daf34","resolution":{"observed_at":"2026-08-07T14:09:12.317889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:09:12.448640Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.448640Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:b844d41ad508bd6bc440584f4850aa586ea2f2353239dd13f7dc70ef32a47a58","observation_id":"9a9ce9ae-f8ef-46d7-b35c-d913d8d7f1d7","resolution":{"observed_at":"2026-08-07T14:09:12.448640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.546074Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.546074Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:5f886dea0c7a3c02653bf5248a04ae7cbc141a09f5081fe9f0c3eb0d2e346290","observation_id":"6f955de4-0b77-4b80-b2ea-85277d5850c1","resolution":{"observed_at":"2026-08-07T14:09:12.546074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.726848Z","title":"Concreteness ratings for 40 thousand generally known english word lemmas","venue":null,"work_id":"fe930538-0271-419f-8510-ea50881b1bbe","year":2014},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.678845Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:35e4b585b33759a430980b223cff80bfd6ba55937ae131c8a14fbfb68a126320","observation_id":"47a73d2d-d6a1-4181-84bb-7ff230ab8f4e","resolution":{"observed_at":"2026-08-07T14:09:26.846819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.379956Z","title":"MultiWOZ - a large-scale multi-domain Wizard-of-Oz 10 dataset for task-oriented dialogue modelling","venue":null,"work_id":"9d4a97a3-3b55-46a7-8b02-b535d033f705","year":2018},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.777533Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:59086a159ffdca8256da409e9b1836f23ddb09e4e57ce937da3926d552351637","observation_id":"d39a4552-7a84-4051-8655-94773c962ddd","resolution":{"observed_at":"2026-08-07T14:09:26.554993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.897767Z","title":"Iemocap: Interactive emotional dyadic motion capture database","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.897767Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:a6488d6165849fa1760fbfd3c301ae3b52a70e23816ab4e54e9a5c8a1cffb87c","observation_id":"6b33e38a-4e64-4492-8e4a-8a9251f1f1bc","resolution":{"observed_at":"2026-08-07T14:09:12.897767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.080079Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model","venue":null,"work_id":"596b2813-7d68-4c3e-ad44-d3d48ea455e1","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.029314Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:748bbf15e2f199c816eb881513c7ca818310597940d47a26fad2ca88b9c2fe82","observation_id":"0bf86c33-147c-4841-8c92-635478940c87","resolution":{"observed_at":"2026-08-07T14:09:26.218036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.809419Z","title":"Action-based conversations dataset: A corpus for building more in-depth task-oriented dialogue systems","venue":null,"work_id":"cf1cfd37-16c7-4597-b245-eb4f9a819f30","year":2021},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.122204Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:8ed3e0907945f259d6f5f2303a14e532b2ed57f05a0d3d0502a9705bbfc58e5d","observation_id":"635c61b5-3d5a-4547-bfe5-12b421cf344b","resolution":{"observed_at":"2026-08-07T14:09:25.953485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:13.242355Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.242355Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:d2409ac0f9a07ea606446bcf81e2f9b623dcfeaa3682331003c3e95f3fd9f828","observation_id":"a335e1d0-8dd2-4177-9a9a-9df337521cc5","resolution":{"observed_at":"2026-08-07T14:09:13.242355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:13.395659Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.395659Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:df59a2c373b74320b8a3c2fd1b3edf147fac95df09a625a6b18c32a5dbba0ac5","observation_id":"cc88514d-0eb2-4578-8883-d3bf4ffbe5fd","resolution":{"observed_at":"2026-08-07T14:09:13.395659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03650","last_updated":"2024-10-19T14:23:57Z","snapshot_observed_at":"2026-08-06T16:42:25.988567Z","submitted_at":"2024-08-07T09:25:17Z","title":"Towards Multimodal Emotional Support Conversation Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03650","snapshot_observed_at":"2026-08-07T14:09:13.593491Z","title":"Towards multimodal emotional support conversation systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.593491Z"},"links":{"cited_paper":"/paper/2408.03650","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:0016c82397a510bd3bf008e9687a81a0e6ede1d06b2aa7057091cafe6d7bfc5e","observation_id":"17a1e3e9-e0f8-411b-bb26-a139f427a0f2","resolution":{"observed_at":"2026-08-07T14:09:13.593491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00698","last_updated":"2025-04-14T12:37:51Z","snapshot_observed_at":"2026-08-07T16:17:41.511601Z","submitted_at":"2025-04-01T12:08:07Z","title":"Command A: An Enterprise-Ready Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00698","snapshot_observed_at":"2026-08-07T14:09:13.765501Z","title":"Command a: An enterprise-ready large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.765501Z"},"links":{"cited_paper":"/paper/2504.00698","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:10663a062ea982ee37266a9dbc5b216b04d5be33e0ca35977b7a19372df022f6","observation_id":"b9fb4e5a-3b69-4192-bc50-75b2f995673f","resolution":{"observed_at":"2026-08-07T14:09:13.765501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.451812Z","title":"Key-value retrieval networks for task-oriented dialogue","venue":null,"work_id":"50f0bd6d-f9fa-4c6d-a8aa-f9fb50b7f065","year":2017},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.858887Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:21611869f9cff509ef9ab1e4e96ad6b2048f82944d13f9ffc6ae8145976af0a5","observation_id":"b064822d-02d1-4325-bae0-09c9af57f461","resolution":{"observed_at":"2026-08-07T14:09:25.562986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.161828Z","title":"The equivalence of weighted kappa and the intraclass correlation coefficient as measures of reliability","venue":null,"work_id":"01fba60c-3cba-4c9a-b5d0-a6aca8fe2579","year":1973},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.950065Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:dbc440a95112fda7d019c92a3c3a36d44ee752593aaec7d28d4fc06b6b0c9c7f","observation_id":"52714835-3b2e-479a-ac6a-be739dcaeb13","resolution":{"observed_at":"2026-08-07T14:09:25.293654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.912035Z","title":"Gemini 2.0 flash, 2025","venue":null,"work_id":"f27aa64b-af5f-4cab-90fb-456247734dc7","year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.050791Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:194acfe293b101f353586e6fed7422b849cca8497186cba6833d52803dbb29b4","observation_id":"0a4678bc-d114-43e9-8208-0777dc4ae267","resolution":{"observed_at":"2026-08-07T14:09:25.010816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.672426Z","title":"Gemini 2.5 flash preview, 2025","venue":null,"work_id":"14d721b1-e8f2-4ed3-8e74-a3218a94199b","year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.136665Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:d65abd881d2c2b3cc06af15b5ba48f4a11145bf09d319e254e23d23806b5fe81","observation_id":"22807ca6-c952-4d80-b2b4-6f5fcdcfa88f","resolution":{"observed_at":"2026-08-07T14:09:24.787091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.373275Z","title":"Gemini 2.5 pro preview, 2025","venue":null,"work_id":"e0a8f6dc-b846-4317-9257-3981c3b80bf9","year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.262164Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:9653403dd1b1f8b51a2ef16ea6f018bb549be1a7ccccabcb4b11dc40fbbe4b28","observation_id":"f33ac129-66c8-406d-8d76-e2530b799f87","resolution":{"observed_at":"2026-08-07T14:09:24.496300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:09:14.353799Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.353799Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:ab87de0bc0fcc52607e541f97f3bfa79cee05fa2632f6eb00102e5c781615fc3","observation_id":"1671db5c-f7ba-4dce-8775-821cd3c41c4a","resolution":{"observed_at":"2026-08-07T14:09:14.353799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.153207Z","title":"Williams","venue":null,"work_id":"0c2400d0-de5c-4736-becf-c50678465273","year":2014},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.476399Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:64f545905594febd1aa70f1788f8016a9ebf31d967e88fb7a1fd90939780d667","observation_id":"da9260e2-f214-4b88-8d5a-8557ca8d5dd9","resolution":{"observed_at":"2026-08-07T14:09:24.256900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.861427Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"dfe88857-90aa-4e5b-a141-6ae0e151352c","year":2021},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.596169Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:4df8e018905e240e354a524e4937b5ce38657e189cada00897d2fe38df627c96","observation_id":"0c2c5b0e-42d0-438e-8b56-1e15cf37ca4a","resolution":{"observed_at":"2026-08-07T14:09:23.993744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:09:14.734208Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.734208Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:63c1ccc7831cf6f739eaae2b2828150c70c59745c823c98bdebcc5302602d112","observation_id":"187ddcf6-49bd-4689-8411-ceedeba22d9f","resolution":{"observed_at":"2026-08-07T14:09:14.734208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.637851Z","title":"Benchmarking representations for speech, music, and acoustic events","venue":null,"work_id":"3787b674-db95-4699-afc0-604dd5925b9b","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.857235Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:7dcbf1bf860c0a9490aee6e23c262728176172208dce27d694faa6c47ed3607d","observation_id":"786d48ed-2a0f-4edc-9d79-8237525fced0","resolution":{"observed_at":"2026-08-07T14:09:23.785333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.463690Z","title":"Llms get lost in multi-turn conversation, 2025","venue":null,"work_id":"e7fe3297-e5d2-4a33-9233-c0b08f1be467","year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.020964Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:0d28afc61b90daa7ea7b03054ef9de714a3a4f296b1448feab2f2361289110c7","observation_id":"5fad3ad5-a96e-4560-af51-8d6392320129","resolution":{"observed_at":"2026-08-07T14:09:23.496032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.252621Z","title":"Orpheus-3b-0.1-ft: A multilingual text-to-speech model","venue":null,"work_id":"e56aa02e-cde8-472a-a92c-941bbb595233","year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.123933Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:79af79fcaf27a07b2c69c55fa39dead3a4a51704bb358be8d2e9692f1b2aef9b","observation_id":"38d82fbb-1c4d-4354-a5c9-a7ca1afd78a1","resolution":{"observed_at":"2026-08-07T14:09:23.334489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.039127Z","title":"Dailytalk: Spoken dialogue dataset for conver- sational text-to-speech","venue":null,"work_id":"bd827a36-8cc2-4e9e-a068-dc0c53c392dd","year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.200534Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:710e5417c42a0dbf46f6344ead361433170c6ef2a49b3cab6ba69e0ff190bf97","observation_id":"b92bd2f0-0ac4-49c3-b4cb-f90b9218a733","resolution":{"observed_at":"2026-08-07T14:09:23.143097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.793581Z","title":"DailyDialog: A manually labelled multi-turn dialogue dataset","venue":null,"work_id":"2587786b-567f-41ff-b380-14a9d708473b","year":2017},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.346795Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:1a0118253835c59e3876a592f00c4562a64c291f7463b69ca91ea219d75ce47f","observation_id":"30d8bdd3-a6c0-48be-94ed-7cb9b00e6b85","resolution":{"observed_at":"2026-08-07T14:09:22.898196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.605329Z","title":"Concept understanding in large language models: An empirical study","venue":null,"work_id":"139f36f1-400c-4755-a5a8-5a1cf4555f93","year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.461304Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:2e0a7360e5377e7852294e737858148361a6e782fa17728701f94d32d4f0f043","observation_id":"439731d9-2de2-4f22-99d2-f2e26a29b4e5","resolution":{"observed_at":"2026-08-07T14:09:22.699366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.389860Z","title":"Advancing large language models to capture varied speaking styles and respond properly in spoken conversations","venue":null,"work_id":"c440fed3-02de-444d-ae15-7f939d9d79f1","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.568005Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:6a8e3e5b4213dfde6cacfe136179a34d72789ebdd2a793c8af55626976574f8d","observation_id":"d05c5d0b-2226-4b06-b623-ad1e8596f2d4","resolution":{"observed_at":"2026-08-07T14:09:22.484401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.134662Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english","venue":null,"work_id":"0c2b43f7-4f0b-4986-b06e-6ea128be3def","year":2018},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.631519Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:1cfc9542035d7e6b9682d82221e42cf7aa202f0079e7c8ef0da90b4eb3cc7d2b","observation_id":"7d8bbe9b-c513-427e-bcad-e7ea85759f94","resolution":{"observed_at":"2026-08-07T14:09:22.248784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.927995Z","title":"Expresso: A benchmark and analysis of discrete expressive speech resynthesis","venue":null,"work_id":"96bc28f7-b2c1-4150-87a7-af07fdbe9f3b","year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.714947Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:1a203543ed3f61f9bcb707e5bb2d96a7bc31ebcef7943441008a77862581ec3c","observation_id":"ffe18551-ff90-410d-bbdf-f76795ad1a77","resolution":{"observed_at":"2026-08-07T14:09:22.016473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.719732Z","title":"Gpt-4o-mini: Advancing cost-efficient intelligence, 2024","venue":null,"work_id":"3535b29d-1570-40ca-9fc3-f0f22e321dac","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.781647Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:11df349ba9132cb5f7780d2a5ecbca365d0b807fd5571e2d2f56780731fed241","observation_id":"2411d293-e593-476c-a152-2d16476da07d","resolution":{"observed_at":"2026-08-07T14:09:21.771388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.453142Z","title":"Let’s go real talk: Spoken dialogue model for face-to-face conversation","venue":null,"work_id":"7ee4e699-7019-4f78-897b-3ac92d0e870e","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.899943Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:d4cd9b1bc39c063a26eee73cb80a1273dfb36db2bf0fbbd380a603df9ea601ce","observation_id":"a6ed56cc-9183-4f3e-be39-cee815b4363a","resolution":{"observed_at":"2026-08-07T14:09:21.562716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.318791Z","title":"The nature of emotions: Human emotions have deep evolutionary roots, a fact that may explain their complexity and provide tools for clinical practice","venue":null,"work_id":"775494cb-c317-4f46-8008-f44ece533340","year":2001},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.986569Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:f95eb8db53e3760942fb498532dd7656721088272acf5f85a737badf8961cf40","observation_id":"1d144571-10f3-4cec-8e25-a828534c921c","resolution":{"observed_at":"2026-08-07T14:09:21.385472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.046404Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conver- sations","venue":null,"work_id":"0c0a7431-b4b8-42a5-ac8b-b49c12c3e689","year":2019},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.072791Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:65940b5aebc13cc1abf1d9834325d13fb034928b89165904068e59f0d5279769","observation_id":"dbadef81-eb34-4607-9eab-f43bfe454c18","resolution":{"observed_at":"2026-08-07T14:09:21.209315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.802457Z","title":"Emotion recognition in conversation: Research challenges, datasets, and recent advances","venue":null,"work_id":"f4922cab-156c-4416-8974-e089920b154f","year":2019},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.196518Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:7d558da6b445c7ad10657a03fe2b6becaaa8e982c6ee2b3686730167aeaef507","observation_id":"d4913e3f-30d3-4542-aa35-3bca96765785","resolution":{"observed_at":"2026-08-07T14:09:20.900413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.586814Z","title":"Recipes for building an open- domain chatbot","venue":null,"work_id":"1f553f2f-725b-439f-9973-a93e95c75e49","year":2021},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.355303Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:c5d241bc67dc0d15beab5560a6eb3d90b050e439ff51184cd30fcb839c1ee4ff","observation_id":"3e4c4e75-6ee0-4aa2-96dd-f3d0ab5c457e","resolution":{"observed_at":"2026-08-07T14:09:20.675675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.349634Z","title":"A circumplex model of affect","venue":null,"work_id":"14ead9bd-a8ac-4964-9bc0-fb7011129047","year":1980},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.512385Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:31b6f8e2485d29d18c25278151dd958de38f0ff692946fe7cca6e89a11debf33","observation_id":"d897dd04-1ef8-4c1e-bdb2-e8b32a26b3c5","resolution":{"observed_at":"2026-08-07T14:09:20.426304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.04871","last_updated":"2018-01-15T16:45:56Z","snapshot_observed_at":"2026-08-08T03:33:28.775960Z","submitted_at":"2018-01-15T16:45:56Z","title":"Building a Conversational Agent Overnight with Dialogue Self-Play","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.04871","snapshot_observed_at":"2026-08-07T14:09:16.618808Z","title":"Building a conversational agent overnight with dialogue self-play","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.618808Z"},"links":{"cited_paper":"/paper/1801.04871","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:47f30263fa7dd71be5101affdf8f2894c61e4266288f26efb0dbf811dc731d91","observation_id":"571fd4a6-5ead-4129-8bb7-b0b22d8f8d6d","resolution":{"observed_at":"2026-08-07T14:09:16.618808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.201068Z","title":"Spokenwoz: A large-scale speech-text benchmark for spoken task-oriented dialogue agents","venue":null,"work_id":"2d129e7a-5247-41a2-9363-d065f04099de","year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.738310Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:7810c7410c4f2c58a2dc62a40ca44e3025ba6a6aa866915d6ca9f60a06155558","observation_id":"19b2011d-479d-4c90-b5b0-7f284e7e5b3b","resolution":{"observed_at":"2026-08-07T14:09:20.279937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T14:09:16.906554Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.906554Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:6f8b921a6737d41c5517a66a748748e03b5355dd1fc4cf67ff60de11252d4a8a","observation_id":"8ca0a767-c80a-4ff4-812c-7e539f32343a","resolution":{"observed_at":"2026-08-07T14:09:16.906554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T14:09:17.010253Z","title":"Lamda: Language models for dialog applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.010253Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:ac75fd8e5a9f06463d86e364e6e2c1f83fd73bf1d058ee3e4938e7c07ceba5c6","observation_id":"43d5867c-d0df-4114-8dd3-779a2f100c78","resolution":{"observed_at":"2026-08-07T14:09:17.010253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.986865Z","title":"Dawn of the transformer era in speech emotion recognition: closing the valence gap","venue":null,"work_id":"9ba93773-4a6a-4e79-91fb-b45443db4f42","year":2023},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.121794Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:7ea05edd809aea302562d30924aea9e9ec8a0e469d467ff2e9fbd787ec850ce3","observation_id":"93d318d5-a128-4dbe-90f1-e7ee4c7cf167","resolution":{"observed_at":"2026-08-07T14:09:20.067108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.688431Z","title":"E-chat: Emotion-sensitive spoken dialogue system with large language models","venue":null,"work_id":"354cd450-f15d-478a-a94e-e395258aed51","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.262304Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:85afcd41eac0a4d63cc99fe62ba5e9c2b5c8d08b74b1f745a9b55a68f8a11136","observation_id":"e5e98a62-4d15-4c60-b438-984e4abdb11d","resolution":{"observed_at":"2026-08-07T14:09:19.796719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:09:17.397735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.397735Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:9f2e1e2f443b805e5d3248443678184e24ce2be16cf2ab436736f591aa60e912","observation_id":"94536af6-8551-46bf-83a7-acfd50434741","resolution":{"observed_at":"2026-08-07T14:09:17.397735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.413631Z","title":"Overview of the tenth dialog system technology challenge: Dstc10","venue":null,"work_id":"cc2f142d-5948-4cd0-9704-f12a6c898905","year":null},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.475011Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:fb40ebfb2a007da667bcad0445129cc65c71c7353ad815526fa683b7b28ad5f9","observation_id":"f48da0cf-b54e-4bdb-bcb0-8189110ff230","resolution":{"observed_at":"2026-08-07T14:09:19.520207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.556864Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.556864Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:a4e8ed83ad608981ed1e2223a17f4e9a93fd5d15ae77eff6e8cddaef668b4cb3","observation_id":"16ac87ef-d6b1-4c13-8661-3e1fae8c2230","resolution":{"observed_at":"2026-08-07T14:09:17.556864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.152146Z","title":"Have you heard about the new Tesla model?","venue":null,"work_id":"3b191063-b7d6-4e20-aa61-897cb733a6f4","year":2024},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.661155Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:a68e391a4c49d20862ff94894a43cd97bb800f07f1b60061e0d3988f93787db0","observation_id":"b6234213-a0df-470d-80c8-bd59fa75ce56","resolution":{"observed_at":"2026-08-07T14:09:19.240823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.904737Z","title":null,"venue":null,"work_id":"b661d402-6e07-4190-883d-ac499403f03a","year":null},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.802582Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:babc6c04f5eba01e114e77d7ecb80bc1183102d538e31a5bf93a726fe6466542","observation_id":"7c3601f9-6ae9-4b47-a08d-9274ceea4856","resolution":{"observed_at":"2026-08-07T14:09:19.000186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.659816Z","title":"Angry”, “Surprised","venue":null,"work_id":"57a440ca-f28a-4d3c-8443-3d82ae1a9981","year":null},"citing_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.917163Z"},"links":{"citing_paper":"/paper/2505.19978"},"observation_digest":"sha256:85268c91da79a422fe401a1d774a601cead81834dd3be7331b106f009cffcf51","observation_id":"cb3bc7f2-73bc-4bae-a671-bfe079d0456e","resolution":{"observed_at":"2026-08-07T14:09:18.770786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:00:08.083323Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2505.19978."}