{"as_of":"2026-08-04T11:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b759682f1b099fb58655fa12d6245b5840ff5ae273f8f7f5c424a1b09f8a09b","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T01:01:24.536821Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.30944/citation-record","integrity":"/paper/2606.30944/integrity","json":"/paper/2606.30944/citation-record.json","paper":"/paper/2606.30944"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.869897Z","title":"Recent advances in speech language models: A survey","venue":null,"work_id":"6448c462-075f-441a-a2aa-08fe07f3d62b","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:cb137e6f38b660330a077ec6c3d13fa744aecf8e4c93c6a7db111d4cba662c41","observation_id":"300eb9ff-6fef-4fb1-b473-b40dd573e2f9","resolution":{"observed_at":"2026-07-07T07:43:30.871588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2504.08528","doi":"10.48550/arxiv.2504.08528","metadata_source":"pith","pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-07-10T20:37:34.410494Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","venue":"cs.CL","work_id":"92746bbc-1fe6-410d-a1e9-8afab3e0a8e5","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:bd0fc780735398de79f1d28dc2e4f06cc0c7159924e0ebca01d3ef792a208ea0","observation_id":"5fed312d-0459-4563-8504-e014a0f908ed","resolution":{"observed_at":"2026-07-01T13:05:45.883322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.895115Z","title":"Whislu: End-to-end spoken language under- standing with whisper,","venue":null,"work_id":"e69086c8-f955-416e-88e6-7b13315de339","year":2023},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:f72719bc8ac69e4c98601007df67575da390e1a51da75e9305a7908943a4e805","observation_id":"ff8859a0-4e56-439c-bd81-20434726eb29","resolution":{"observed_at":"2026-07-07T07:43:30.896735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.861548Z","title":"Adapting large language model with speech for fully formatted end- to-end speech recognition,","venue":null,"work_id":"246b89ee-4620-420b-adeb-173fe05620eb","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:f5cd8114ea947015ce0397d3c8ce27dd6260e8d1cb717aa9f9a697e34ecceb0d","observation_id":"0ea9fb9d-5818-477d-8733-3062002070c3","resolution":{"observed_at":"2026-07-07T07:43:30.863174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.872571Z","title":"Speechgpt: Empowering large language models with intrinsic cross- modal conversational abilities","venue":null,"work_id":"01bf74b4-f463-4f30-99e5-6be5d6edb150","year":2023},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:12a28f4b652893967a2ea73f0797ef75c91de4c9c47b45438523dc6e3209eb16","observation_id":"389a6a33-c15d-43d9-8cf5-abd64ccdf160","resolution":{"observed_at":"2026-07-07T07:43:30.874224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-10T12:57:07.670593Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:566bd5416d53ce0b63c146ff0eb2070e91cacd37e24c30623cbecb616f683a9e","observation_id":"5e81ae1d-a6f6-4baa-9178-f24eeb577039","resolution":{"observed_at":"2026-07-01T13:05:45.874065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:34f491f4edc5a4bdd83579f52f61fb2797ca1d2060afc83f5d2a3dd6bf1f2585","observation_id":"0e0b2984-01f7-4fab-b5c3-ffcd1abad8e1","resolution":{"observed_at":"2026-07-01T13:05:45.877482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.866921Z","title":"Understanding the modality gap: An empirical study on the speech-text alignment mechanism of large speech language models,","venue":null,"work_id":"73290842-7341-43fa-8473-26da2701f74a","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:15788fbcda8bacbdaf3c14b627de2b2c16632f27123fbeec63c7e187cc212d04","observation_id":"93fe1a6b-ad6a-4f55-ad08-6aff920b25bc","resolution":{"observed_at":"2026-07-07T07:43:30.868810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.853036Z","title":"Alignformer: Modality matching can achieve better zero-shot instruction-following speech-llm,","venue":null,"work_id":"2f82047d-b055-4f0d-85dc-029d6626248a","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:9a8d3e0b680c52da9f5612842c9fa0e41be03aef6d0e597921e682b9bd97ecb6","observation_id":"c4d0555f-3f17-48b2-871e-541e176a93f1","resolution":{"observed_at":"2026-07-07T07:43:30.855242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13632","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.619849Z","title":"Closing the gap between text and speech under- standing in llms","venue":null,"work_id":"3d4fe369-c396-4eb2-b021-8c3fe119526d","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:78bdfd88810bda0707d6c33c0323d20147396183b23c521370636d9cd82fb919","observation_id":"f041ffa6-11a8-425f-af65-d53aae0d00bb","resolution":{"observed_at":"2026-07-01T13:05:45.880630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.849111Z","title":"Speech discrete tokens or continuous features? a comparative analysis for spoken language understanding in speechllms,","venue":null,"work_id":"50480b25-3f1a-4ccc-b0ad-8952c084b3c9","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:f269a24d58cf20a1cbc3ade90db315fb67be86bdd85db524e2fc5cb8d4656c3d","observation_id":"902335f4-2250-40f8-80a1-404cd4776d29","resolution":{"observed_at":"2026-07-07T07:43:30.851735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05543","last_updated":"2026-04-20T10:33:45Z","snapshot_observed_at":"2026-07-31T08:03:40.121303Z","submitted_at":"2026-01-09T05:51:56Z","title":"Closing the Modality Reasoning Gap for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2601.05543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05543","snapshot_observed_at":"2026-07-03T01:37:30.611503Z","title":"Closing the Modality Reasoning Gap for Speech Large Language Models","venue":"cs.CL","work_id":"952409f6-737a-4ba4-a626-821db6d76ff8","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2601.05543","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:5c2a23d7726f40122c1c42ae754eff4247dfc7898b1c1e97f110eafbe3f66509","observation_id":"2f5244f6-835b-4b1b-aa46-d3a482c1ba55","resolution":{"observed_at":"2026-07-01T13:05:45.861469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.864107Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":"4842a982-3f81-462c-bd50-4faf6eb7c10a","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:092486b5b2792b2d256661dc0684373d68c3be7e7fee3bb140a2baa64b94ff49","observation_id":"36f65776-7fda-4dcc-8e86-e7f4e60b5a83","resolution":{"observed_at":"2026-07-07T07:43:30.866228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:36:02.735663Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":"5028fe78-0af0-47e6-908e-e3473ea88b49","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:e7ebc9a6c9e39eefac85786a3ae832f7bb2eaaeff3116b4da1ddd5ca44333473","observation_id":"a5a1814d-23ba-44b9-b394-ba3af7ed3611","resolution":{"observed_at":"2026-07-07T07:43:30.901398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-10T10:37:01.589123Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:c6a52c103682f32838a67c5fe1bba1a6656b3617341ddfa255e879fd3af4b4b1","observation_id":"c9232717-a8ce-44d3-b864-9e668f4e3b41","resolution":{"observed_at":"2026-07-01T13:05:45.867950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:4012ddf1ec982d9dc65958fced08842ce9ff79594707f7d73c0185c982e22b8f","observation_id":"4ba1e5bb-777c-4576-960b-85610a148913","resolution":{"observed_at":"2026-07-01T13:05:45.854863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.887809Z","title":"Pseudo-autoregressive neural codec language models for efficient zero-shot text-to-speech synthesis,","venue":null,"work_id":"d0e9c8ef-8d79-4db0-ad6b-707a52500a75","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:6eb0791700a10b2b449d29a41bc3e348b3efcfe62b8cb5b6c1d6efcc3592edcc","observation_id":"b5b13e28-7619-4746-90bf-68e753d28afd","resolution":{"observed_at":"2026-07-07T07:43:30.889481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.882585Z","title":"Indextts2: A breakthrough in emotionally expressive and duration- controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":"07dc96c1-b6ed-403e-955a-962844961157","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:10f50774fa3abf799fd71c66f5c93b402cf89ec2214b16bcb50cc1a8d58e82b2","observation_id":"d599cbf4-104d-49dd-baff-0f6bad2c5390","resolution":{"observed_at":"2026-07-07T07:43:30.884335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:29:42.191088Z","title":"Fish audio s2 technical report","venue":null,"work_id":"91571db3-6f7a-4f09-b62f-7174bb3f83ce","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:acb417738ed2b51fa0a25347b1d95fd13fa59a10324ae15b5cfeda8bf7bb83b2","observation_id":"38a83d7b-9754-4a12-a95c-4ce473a84579","resolution":{"observed_at":"2026-07-01T13:05:45.844200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.885271Z","title":"Zipvoice-dialog: Non-autoregressive spoken dialogue generation with flow matching,","venue":null,"work_id":"80dd7b3b-ee4c-4a18-8aba-00ef663ed9aa","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:35a3a29aa609b29cecab1d0650f20983211d203bd2721bb3630acf4beae50d64","observation_id":"7fa710d7-b84e-4d7a-a5e8-d77392b18b4e","resolution":{"observed_at":"2026-07-07T07:43:30.887023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:bc1ad991a51fc0fd85d08c42f1c809ed3db4746b4f7cb2e3d08f34cb9387285f","observation_id":"bb39d317-dfdd-4d0c-91ab-35088b251255","resolution":{"observed_at":"2026-07-01T13:05:45.840599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:ffbe501c3caa75a4a503f60a3ce437124a00836e55a52bb2718dcfdef0d544d0","observation_id":"3cbc1c14-2319-4db7-a69a-b13171bb03a9","resolution":{"observed_at":"2026-07-01T13:05:45.847968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23808","doi":"10.48550/arxiv.2512.23808","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Mimo-audio: Audio language models are few-shot learners","venue":null,"work_id":"8c438dfc-e0fb-45e5-983b-3708cd7afa91","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:e18d5c1cd59b0367e4eac5e92df36ed12d2aab8e81d48b8372182e8c1733a5f6","observation_id":"e39f0f1d-08dc-41f0-9592-42e850563044","resolution":{"observed_at":"2026-07-01T13:05:45.851849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:0807df21014363c20743ad9d68ef2077f6d450d5756b89b99d91ec73a4568d74","observation_id":"4b757680-88ed-4970-a735-e69877b02bfa","resolution":{"observed_at":"2026-07-01T13:05:45.857825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.877562Z","title":"Slam-omni: Timbre-controllable voice interaction system with single-stage training,","venue":null,"work_id":"1097b4d7-536f-4b6c-ae8c-aa4773a22211","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:985e3bbe37af2e617f1aa9a508f1efbcb9e292bde75e7a446b9790492334c490","observation_id":"f667b127-47d2-4a9e-9010-6a67b987b411","resolution":{"observed_at":"2026-07-07T07:43:30.879207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.841947Z","title":"Fun-audio-chat technical report","venue":null,"work_id":"3aab8cff-d938-401b-a33e-ed1821101046","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:9a7a41c89c3342825a2a40db139489a708ccfd08b1bdc60d15f0616cf782eeb9","observation_id":"6284bc4d-a100-4ddd-a54e-bcf61a6de7ff","resolution":{"observed_at":"2026-07-01T13:05:45.864542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":"2606.01802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-07-07T14:53:55.822643Z","title":"MOSS-Audio Technical Report","venue":"cs.SD","work_id":"e194ce1a-90cb-4faf-aecf-94ab7ceec215","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:3ee9fd7b711eeb890ff4aa427d47d33371d1a103fdc485307ab5bf237cba2e2b","observation_id":"72f844c2-04dc-4cec-9949-df97b3a813a5","resolution":{"observed_at":"2026-07-01T13:05:45.831036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:6371b5ca8bc636736be90f3d5dbf4f9cf100d30ee62814ae902a6702155a257b","observation_id":"dd8dc385-a372-410b-8289-a590a05290c1","resolution":{"observed_at":"2026-07-01T13:05:45.834436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02625","last_updated":"2025-05-05T12:53:09Z","snapshot_observed_at":"2026-07-06T21:19:05.157643Z","submitted_at":"2025-05-05T12:53:09Z","title":"LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2505.02625","doi":"10.48550/arxiv.2505.02625","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02625","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Llama-omni2: Llm-based real-time spoken chatbot with autoregressive streaming speech synthesis","venue":null,"work_id":"ebfa628e-d823-44f5-a686-0ac0a7d5f4ba","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2505.02625","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:eecb6389ba69675ab407b2229713014345ee1c30a99b3a33564762814fa0c040","observation_id":"b9d06f2e-9fcc-459b-87e8-153712bfeec4","resolution":{"observed_at":"2026-07-01T13:05:45.816779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:e16c1881b9dfa2f80bfc2b45bb7fb0e464ef685d7f4c6a6db95641914a7a5171","observation_id":"1147bd70-7f4b-4557-a576-e455ba885218","resolution":{"observed_at":"2026-07-01T13:05:45.819741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:78feb7dd85ba588f6677ddac1552b0852491294a74a651dc6aa68adcc7f90732","observation_id":"5a8cc085-5f67-4bc4-a36c-60adafae2633","resolution":{"observed_at":"2026-07-01T13:05:45.809038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:edeef35218714fc4da5168589c24c009a0fa6df55e1c4a0d74f5f6b937f1221d","observation_id":"0f5caf8f-c1c8-4e9e-b8fe-ac27a14719bb","resolution":{"observed_at":"2026-07-01T13:05:45.805334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Chen, Y","venue":null,"work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:5917cc7a2056739960fbc88a00a57312f210c4249412917425597fe59dd331c8","observation_id":"32763740-303e-4d41-870f-d964311c304e","resolution":{"observed_at":"2026-07-01T13:05:45.810988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:dd7b38fcda5d77eb5ea3f551c095c4cf346d320ef03c79b64b1f09a3a2e045ce","observation_id":"152cf258-b15f-43c8-81c8-60d6d204e8b2","resolution":{"observed_at":"2026-07-01T13:05:45.788459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:3f9c9ac57948af6948bf43dfd2da1930f8dcb0faa08703e66a1cd133efe21ea5","observation_id":"ad9c68d7-5822-4c77-bd6e-dadc3a363a96","resolution":{"observed_at":"2026-07-01T13:05:45.791055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.880075Z","title":"Better & faster large language models via multi-token prediction,","venue":null,"work_id":"9e28ab2a-b5cf-416b-8fcb-2e76c06c740c","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:f041a84c40cecdc4ef71fbdad8c318f3d84b042306767e09397e3c90d34cca25","observation_id":"a14c16ae-f3aa-48e1-bf3e-fc1ca63c2bde","resolution":{"observed_at":"2026-07-07T07:43:30.881490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:05:45.811020Z","title":"Vita-audio: Fast interleaved cross-modal to- ken generation for efficient large speech-language model","venue":null,"work_id":"b95ed2e2-a122-49ab-901b-4f06fc3ae0c0","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:f6a1155994f3edd1b8e8ed0e77c8d32df1578a8d6c7cc59e5045333dd7b63e7d","observation_id":"646895cf-01a7-4a82-aa94-c4542d973006","resolution":{"observed_at":"2026-07-01T13:05:45.813181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.892613Z","title":"V ocalnet: Speech llm with multi-token prediction for faster and high- quality generation,","venue":null,"work_id":"ca0ef4ab-86ad-491f-95a1-b2b560c0a3a6","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:9cacef3c18784f10ae7f6230372a60a4ebcf0d13e446608c81e77a7105c40fbf","observation_id":"ffef7a5f-8d1f-4a94-8c56-2abd76e49ffb","resolution":{"observed_at":"2026-07-07T07:43:30.894341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.902086Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":"a236f59f-dbd4-4a6f-ac92-ef7b61447925","year":2019},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:dd1600054936379013e392ef88d1c400ec9755752ebdf57a2977200b038d27d9","observation_id":"284d6510-4b87-4449-8a25-cf50737a712c","resolution":{"observed_at":"2026-07-07T07:43:30.904137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:37:34.706203Z","title":"Libriheavy: a 50,000 hours asr corpus with punctuation casing and context,","venue":null,"work_id":"9c792d98-82af-40ab-ac4b-f50cb97d92b5","year":2023},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:48df7950fd65caa3bfc57c520a7305409dee531033ace976f4833c68bdd67088","observation_id":"54f3c543-76f8-4265-9022-990960a64bf8","resolution":{"observed_at":"2026-07-07T07:43:30.891831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.897433Z","title":"Covost 2 and massively multilingual speech translation,","venue":null,"work_id":"da352dfb-bdee-4d87-a2ce-facbe8a1977b","year":2021},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:60f7bc48916b797d8e8604b3bed6540d2dd40044afcf0a1cb99b57e133b9c725","observation_id":"0a63bf1d-d401-45f8-b874-0cafc1f2d112","resolution":{"observed_at":"2026-07-07T07:43:30.899075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:a774d97013c26f8dbf14a69c88347c1bd653a4995475e895da8d1f62fa00e565","observation_id":"2a62a2a5-5f38-43e4-a3cf-359a9620df83","resolution":{"observed_at":"2026-07-01T13:05:45.823291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:05:45.825670Z","title":"Towards efficient speech-text jointly decoding within one speech language model,","venue":null,"work_id":"40169d43-88a8-4364-bc4f-0f13720f140b","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:38247f19a58a562e66727a8fdcb05a965727e03f202caf4790985e214896a629","observation_id":"f53f3c67-8aba-40e1-9f0a-f97c394ae11f","resolution":{"observed_at":"2026-07-01T13:05:45.827711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.875059Z","title":"Cvss corpus and massively multilingual speech-to-speech translation,","venue":null,"work_id":"6a21255d-408c-4b51-a0b6-7ea07bc69710","year":2022},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:3df38fc36bf9eb739ccaf92bc69a40f1c54686c5f4b31915dbb3a3b459472939","observation_id":"d4fec4bf-a7f2-43ad-9246-5f7d04420371","resolution":{"observed_at":"2026-07-07T07:43:30.876551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:18:32.638439Z","title":"SLM-S2ST: A multimodal language model for direct speech- to-speech translation,","venue":null,"work_id":"53345431-9c80-429d-9e88-df6ed22e49f9","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:7952cc775caadbca2738c1eaa80a8a949e6da037a99911d729abab5c6b3ba1a8","observation_id":"4ef932e0-924c-4dc8-a955-0ffc0f0082a8","resolution":{"observed_at":"2026-07-01T13:05:45.793848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:3835d2859b9861169b5a4ec8d9599ec64256968ac787ede3c2e0e46a5ed6cc97","observation_id":"ac4e1bae-a699-4041-a37b-3006168c7580","resolution":{"observed_at":"2026-07-01T13:05:45.801831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.904986Z","title":"Hello gpt-4o,","venue":null,"work_id":"651bce63-0f14-4fcb-93a7-a98775eff1e9","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:90f7863efba71a0e1686d0b0e5e67a14a9d65ceec51577ba34cbc34d941bc2a4","observation_id":"7b7ddd3d-8416-466c-891b-aad929053b09","resolution":{"observed_at":"2026-07-07T07:43:30.906505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:14:01.390497Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech","venue":null,"work_id":"a78f5a65-13e2-4ec7-a02c-1c87bfd6fa5b","year":2023},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:079a7bfe43f019dc2f1366adb7e3a2491080a739973c0bdf8a2acb1c9dd7c473","observation_id":"f7551b2a-e575-4830-96ee-99ca274072c9","resolution":{"observed_at":"2026-07-07T07:43:30.858208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.01373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:18:32.652948Z","title":"Ultraeval-audio: A unified framework for comprehensive evaluation of audio foundation models,","venue":null,"work_id":"520b3bb4-8d68-4e92-9f58-929ae01fcdae","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:6dda4856dd79228e5eea0d0ef99847296ce3e715f8aa6918c84afa69548d42f9","observation_id":"4352eb73-d13b-46e8-9f44-9d7a586a73fb","resolution":{"observed_at":"2026-07-01T13:05:45.797735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":"2206.04615","doi":"10.1162/tacl_a_00688","metadata_source":"pith","pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":"cs.CL","work_id":"bb63abb3-0d50-4362-b97c-b5e725b03b39","year":2022},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:6e08fce30ada843504c33b18d74c06e8eda4e021940a0782e29cf1f24e57a144","observation_id":"a4ad798f-ee07-4c15-9f5d-1f73655c1a4f","resolution":{"observed_at":"2026-07-01T13:05:45.837610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:00:05.337825Z","title":"Vocalbench: Benchmarking the vocal conversational abilities for speech interaction models","venue":null,"work_id":"c3125692-20ab-4e87-8b2e-9b5ae17a15c1","year":2025},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:4b5ca5f5cfb8b272edbac20c2c88731a86cd06e2d5dc669c3c4bad399e784599","observation_id":"dbdb48ea-2166-4f36-8e38-5cf7a9447902","resolution":{"observed_at":"2026-07-01T13:05:45.870823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.859070Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":"1dbf7586-5934-431a-a188-b6db570129a8","year":2023},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:56394121d3980d2c4e512b778478a9331ecbf331e5e4dcfc0c0e7b49e7565e59","observation_id":"da0035ce-93ca-427e-bcaa-12191012280f","resolution":{"observed_at":"2026-07-07T07:43:30.860708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-01T20:28:09.347213Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":22},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2606.30944."}