{"as_of":"2026-08-21T10:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db8366b5cb2fd864e0bf845a5a027119f1998674606e4d886b070cf6625f68e1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:27:27.223349Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:37:34.403610Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":"2410.02678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-07-10T20:37:34.403610Z","title":"Distilling an end-to-end voice as- sistant without instruction training data","venue":"cs.CL","work_id":"9b6edce5-5624-4acc-9681-f196b3a6c0ba","year":2024},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:7b5c831b54740b918531b5de00105f09ed54e107695df24fc89cb5a3aa572ff4","observation_id":"08370aae-ac17-40f6-9ace-641da07db20c","resolution":{"observed_at":"2026-05-17T00:50:13.980645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-11T14:27:27.223349Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.223349Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:66d79771251c77b592caa63717cce93027b9bbd3c11e6f2d5d820f85555513ac","observation_id":"91cc5029-1500-4b98-b8c1-4dd268680a26","resolution":{"observed_at":"2026-08-11T14:27:27.223349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-11T12:56:13.139774Z","title":"Distilling an end-to-end voice assistant without instruction training data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13702","last_updated":"2024-12-19T17:36:38Z","snapshot_observed_at":"2026-08-18T10:39:43.720912Z","submitted_at":"2024-12-18T10:45:24Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:56:13.139774Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2412.13702"},"observation_digest":"sha256:547b33ccf5f4c009df6d145470a0c33bef252e1d79dbf4577b867636bac32b0b","observation_id":"fdab8341-e8c9-4432-9e39-391f534c8a06","resolution":{"observed_at":"2026-08-11T12:56:13.139774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-11T11:13:48.475360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15712","last_updated":"2025-05-30T16:35:44Z","snapshot_observed_at":"2026-08-18T08:01:18.112437Z","submitted_at":"2024-12-20T09:33:31Z","title":"Contrastive Learning for Task-Independent SpeechLLM-Pretraining","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:13:48.475360Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2412.15712"},"observation_digest":"sha256:695e5127b194f0677313ada38cd151785f6ad98368face31af8307f6aa57943e","observation_id":"0d9e04fd-c1fd-4b44-95e7-e2073d6d9188","resolution":{"observed_at":"2026-08-11T11:13:48.475360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":"2410.02678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-07-10T20:37:34.403610Z","title":"Distilling an end-to-end voice as- sistant without instruction training data","venue":"cs.CL","work_id":"9b6edce5-5624-4acc-9681-f196b3a6c0ba","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-08-14T11:32:49.145887Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:7917fe2f7065badf5afeae12cc8b9f893bd948fb01f7177010bb31876102aab1","observation_id":"1d580a2c-1d04-4963-96aa-98457ad445ca","resolution":{"observed_at":"2026-05-22T20:45:08.182294Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T15:23:01.636740Z","title":"Distilling an end-to-end voice assistant without instruction training data // arXiv preprint arXiv:2410.02678","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.636740Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d950a1dd009217089ad18911165c369d908eedd68835d4a9b6a052e077d5c160","observation_id":"e9bebd05-8fbe-4d53-b74d-843f9e9c173f","resolution":{"observed_at":"2026-08-07T15:23:01.636740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T14:51:17.014767Z","title":"Dis- tilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-17T02:24:20.568852Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:17.014767Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2505.17417"},"observation_digest":"sha256:c637f419afea53bad183a4d293e31f5bafb9999008503bfe77ca762556ca0d65","observation_id":"caa0ee6b-f3a4-45e4-98b1-de8f6327de53","resolution":{"observed_at":"2026-08-07T14:51:17.014767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T14:24:33.963171Z","title":"Dis- tilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19037","last_updated":"2025-05-25T08:37:55Z","snapshot_observed_at":"2026-08-17T12:03:52.615757Z","submitted_at":"2025-05-25T08:37:55Z","title":"Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:33.963171Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2505.19037"},"observation_digest":"sha256:64bb6aa860c3115f24c8053c645284d8bbcbbdc2b33fb34c9c23f620864854e0","observation_id":"9b55b015-bacf-4433-979d-63512062722d","resolution":{"observed_at":"2026-08-07T14:24:33.963171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T12:04:31.596425Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.596425Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:2284d81b4f334592952709820eb468d720b18403951f6cd755356eb8fdedbe15","observation_id":"e9c68199-96f5-4c3a-8ce6-0ca1a4b2e412","resolution":{"observed_at":"2026-08-07T12:04:31.596425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T11:58:41.386187Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-17T08:11:21.214669Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.386187Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:397efb4ca0554494264ef24d8746d10fa0541383e74764d9952ad98b0b376e51","observation_id":"3fec8c50-3c76-4ff4-837a-7c90a0fa5985","resolution":{"observed_at":"2026-08-07T11:58:41.386187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-06T16:47:55.927357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-13T13:24:03.399635Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:47:55.927357Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2507.12705"},"observation_digest":"sha256:a4a87cc1f56faf9058a30a5e7267e4dc2f78c87a91404d27f0f0c43483a40e3b","observation_id":"7fb330a8-2c7b-4421-a33b-10711326c2a2","resolution":{"observed_at":"2026-08-06T16:47:55.927357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":"2410.02678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-07-10T20:37:34.403610Z","title":"Distilling an end-to-end voice as- sistant without instruction training data","venue":"cs.CL","work_id":"9b6edce5-5624-4acc-9681-f196b3a6c0ba","year":2024},"citing_paper":{"arxiv_id":"2509.19858","last_updated":"2026-05-22T14:38:31Z","snapshot_observed_at":"2026-08-18T21:25:47.358585Z","submitted_at":"2025-09-24T07:57:10Z","title":"Benchmarking Gaslighting Attacks Against Speech Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:06:59.951859Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2509.19858"},"observation_digest":"sha256:1cb08f44a55ea813e7d20046f72a6c50fb44bd99193dc9beafbfbdc1800e3e0e","observation_id":"5ab66f10-a6c1-4589-a7d7-238edc5ca84d","resolution":{"observed_at":"2026-05-25T08:10:31.487105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":"2410.02678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-07-10T20:37:34.403610Z","title":"Distilling an end-to-end voice as- sistant without instruction training data","venue":"cs.CL","work_id":"9b6edce5-5624-4acc-9681-f196b3a6c0ba","year":2024},"citing_paper":{"arxiv_id":"2607.06827","last_updated":"2026-07-07T21:45:04Z","snapshot_observed_at":"2026-08-20T18:17:38.588909Z","submitted_at":"2026-07-07T21:45:04Z","title":"Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T20:30:11.127007Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2607.06827"},"observation_digest":"sha256:1c04b1555fef27ebe6c5ed5868e9e4bf1e0ceab96f15028ebab8d84fdff7afc8","observation_id":"14c54e88-8246-4c65-b344-c9b593196b10","resolution":{"observed_at":"2026-07-10T20:37:34.405190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02678/citation-record","integrity":"/paper/2410.02678/integrity","json":"/paper/2410.02678/citation-record.json","paper":"/paper/2410.02678"},"outbound":[],"paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2410.02678."}