{"as_of":"2026-08-20T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb92922397bba4169695411d38181346b0e219d95c0be767bbca4caee0a40228","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:46:16.782429Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:52:16.074875Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T08:24:03.552101Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01078","snapshot_observed_at":"2026-08-16T11:52:16.074875Z","title":"Advancing speech language models by scaling supervised fine-tuning with over 60,000 hours of synthetic speech dialogue data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14482","last_updated":"2025-04-20T04:14:30Z","snapshot_observed_at":"2026-08-19T12:28:41.415429Z","submitted_at":"2025-04-20T04:14:30Z","title":"DialogueAgents: A Hybrid Agent-Based Speech Synthesis Framework for Multi-Party Dialogue","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:52:16.074875Z"},"links":{"cited_paper":"/paper/2412.01078","citing_paper":"/paper/2504.14482"},"observation_digest":"sha256:633d39a6566920b91e75f054dd920062d392df918b7fe68dcfd673a94578c4f7","observation_id":"46fcac79-c811-47f7-8aa0-85c9f5e7ab93","resolution":{"observed_at":"2026-08-16T11:52:16.074875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"cited_work":{"arxiv_id":"2412.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01078","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.01078 , year=","venue":null,"work_id":"d3d909a2-2afa-4240-aa79-df9015a9471c","year":2023},"citing_paper":{"arxiv_id":"2601.04638","last_updated":"2026-04-18T12:24:30Z","snapshot_observed_at":"2026-08-16T07:03:35.242660Z","submitted_at":"2026-01-08T06:14:58Z","title":"SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T17:00:59.421441Z"},"links":{"cited_paper":"/paper/2412.01078","citing_paper":"/paper/2601.04638"},"observation_digest":"sha256:de616129cd06b746c9c6fdc3126dda4f860a9f1bbc1a2393df247a9b77e1e688","observation_id":"69e3da9f-8225-4c8d-bd59-84db56e65a27","resolution":{"observed_at":"2026-05-16T17:01:07.569586Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"cited_work":{"arxiv_id":"2412.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01078","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.01078 , year=","venue":null,"work_id":"d3d909a2-2afa-4240-aa79-df9015a9471c","year":2023},"citing_paper":{"arxiv_id":"2605.16578","last_updated":"2026-05-26T19:32:15Z","snapshot_observed_at":"2026-08-15T03:37:38.100631Z","submitted_at":"2026-05-15T19:32:28Z","title":"Voice \"Cloning\" is Style Transfer","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-19T21:01:24.307137Z"},"links":{"cited_paper":"/paper/2412.01078","citing_paper":"/paper/2605.16578"},"observation_digest":"sha256:15a8c34ceeb1d8d2fbbe0832d938a2ae435368d4c08d6e09d13b38015d6ece3c","observation_id":"f8ff0edb-4d33-4701-92c7-17ec5418c873","resolution":{"observed_at":"2026-05-19T21:02:47.145012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"cited_work":{"arxiv_id":"2412.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01078","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.01078 , year=","venue":null,"work_id":"d3d909a2-2afa-4240-aa79-df9015a9471c","year":2023},"citing_paper":{"arxiv_id":"2605.16578","last_updated":"2026-05-26T19:32:15Z","snapshot_observed_at":"2026-08-15T03:37:38.100631Z","submitted_at":"2026-05-15T19:32:28Z","title":"Voice \"Cloning\" is Style Transfer","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-21T08:20:29.918036Z"},"links":{"cited_paper":"/paper/2412.01078","citing_paper":"/paper/2605.16578"},"observation_digest":"sha256:dcaef2154d9f02e979d1669d35e11009bfa93bebe6adbb253199f2d893cf3f65","observation_id":"a54bac18-3bdd-4ef9-9df4-cdabaf8bb88b","resolution":{"observed_at":"2026-05-21T08:24:03.553542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01078/citation-record","integrity":"/paper/2412.01078/integrity","json":"/paper/2412.01078/citation-record.json","paper":"/paper/2412.01078"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.979704Z","title":"this\" or","venue":null,"work_id":"0bcf0be8-a998-428e-9c1f-82d28c4ef9db","year":null},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.760093Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:d302d90a570ebf553c05c583d5dc93e05fa34571624d6844a715a192561358f9","observation_id":"1b052b07-b8ff-4569-8727-922ce7be9484","resolution":{"observed_at":"2026-08-12T04:46:16.985455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-12T04:46:16.729612Z","title":"arXiv preprint arXiv:2407.10759","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.729612Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:8a966fe550621e1722f061b984dca1cb882f2e715ba630321bb502001151b2e4","observation_id":"7a01eef5-f9ec-4282-b3cf-a5c3ccfe2db8","resolution":{"observed_at":"2026-08-12T04:46:16.729612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.949560Z","title":null,"venue":null,"work_id":"95755687-122a-4d33-92ff-34e5d1881731","year":null},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.769330Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:25b1da2605022e42a0ea7b4db142a8f6e4e4c99f40096b7aefead00651d92b91","observation_id":"91cf2943-42c7-470c-a3dc-3a76cd0cb803","resolution":{"observed_at":"2026-08-12T04:46:16.953950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-19T13:44:12.385881Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-12T04:46:16.739240Z","title":"arXiv preprint arXiv:2407.05361","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.739240Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:38fe313973272b04c8a0cfc9915720702d69e3fa92212f6900d5ce4459718394","observation_id":"27835fd9-0449-4821-bda1-84734b888dcf","resolution":{"observed_at":"2026-08-12T04:46:16.739240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-08-15T16:45:09.638988Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-12T04:46:16.744798Z","title":"[OpenAI2024] OpenAI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.744798Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:c2d09ef782e82b25ab1036d021fce8eea5b8b7021e1a3f73a7712d3c37b5e57e","observation_id":"83205df4-17bf-443e-9a74-7d2871d0382f","resolution":{"observed_at":"2026-08-12T04:46:16.744798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-08-16T13:09:22.197235Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-12T04:46:16.749983Z","title":"arXiv preprint arXiv:2410.11190","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.749983Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:bcf82d5a17a789c58266bf5041167483326ffa17ad9b61079ee889e5a9eaaa47","observation_id":"5aaaaffc-32d2-4273-977e-4108622727d1","resolution":{"observed_at":"2026-08-12T04:46:16.749983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-19T05:23:55.031463Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-12T04:46:16.755242Z","title":"[Zhang et al.2022] Binbin Zhang, Hang Lv, Pengcheng Guo, Qijie Shao, Chao Yang, Lei Xie, Xin Xu, Hui Bu, Xiaoyu Chen, Chenchen Zeng, Di Wu, and Zhendong Peng","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.755242Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:ac26e5c90e005f9bc3d4d2c99ad982ebc98ca393f0a987490585a36b0e07060e","observation_id":"5efdad44-6388-4046-acd6-3c62a542dd26","resolution":{"observed_at":"2026-08-12T04:46:16.755242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.963818Z","title":null,"venue":null,"work_id":"10781e79-290f-4d85-a018-23493b1164fd","year":null},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.764723Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:b358252a24311bf128b67ec49789a6c93bbdf8dbb1640b1977b976e160714532","observation_id":"36698443-574c-4354-b9f7-88641718841d","resolution":{"observed_at":"2026-08-12T04:46:16.968375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.934824Z","title":null,"venue":null,"work_id":"025b1afb-f679-49c2-a429-5692ca095760","year":null},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.774097Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:ed5d07ca0ebb43c8c2e0079b06ce5e5ba0f51150981cfb28fbe9bcb545522083","observation_id":"1fdf82f8-b84e-45c2-a7b1-230f50630767","resolution":{"observed_at":"2026-08-12T04:46:16.939317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.920219Z","title":null,"venue":null,"work_id":"000fd272-8368-477e-9e11-98786f9df008","year":null},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.778156Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:2b9da98be38cb29e8ef7f96307db8046b210cf6c8d6383f6acfe68243b1ddcd5","observation_id":"d0fc32ca-08c7-43ad-97a6-c069c226c1a3","resolution":{"observed_at":"2026-08-12T04:46:16.924599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.904756Z","title":"is_suitable_for_speech","venue":null,"work_id":"7c193d62-558b-4c13-9be9-a0ffa6f2d495","year":null},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.782429Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:1a753c1cb97b71373258c7ac30eb49e9eee406052be0aa084ba91ef62d5da32b","observation_id":"56bdf33f-6dbe-4b09-91c6-31a3af7406b5","resolution":{"observed_at":"2026-08-12T04:46:16.909892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:16.995825Z","title":"In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Pro- cessing (ICASSP), pages 6968–6972","venue":null,"work_id":"ee51efae-2e84-41fb-b484-a9e25a1e932a","year":2021},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.734607Z"},"links":{"citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:aea0e1c1d34c3f2c1aadc18ec47fdf1f4f6970241bbfbc6ac88ba125d69d8c4f","observation_id":"88578298-d84e-4d76-9086-eb5c3100786c","resolution":{"observed_at":"2026-08-12T04:46:17.001536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-12T04:46:16.724250Z","title":"arXiv preprint arXiv:2410.17196","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:16.724250Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2412.01078"},"observation_digest":"sha256:0c91d3c0afa542a7367f1400b642abfcb7e3ce6f630d32323119bc7d3a83b276","observation_id":"4e5744f6-03e9-4d65-8dd9-c5a8f5045879","resolution":{"observed_at":"2026-08-12T04:46:16.724250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01078","last_updated":"2024-12-03T02:59:43Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T01:25:09.929826Z","submitted_at":"2024-12-02T03:31:46Z","title":"Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 4 inbound Pith citation observations for arXiv:2412.01078."}