{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f9d455483d98957991d8fb11a9b501331c379802b402915aa147608b9ea6116","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:58:44.194819Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:50:33.363981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06343","snapshot_observed_at":"2026-08-01T05:50:33.363981Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22100","last_updated":"2026-07-24T08:52:44Z","snapshot_observed_at":"2026-08-06T21:56:48.867318Z","submitted_at":"2026-07-24T08:52:44Z","title":"MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T05:50:33.363981Z"},"links":{"cited_paper":"/paper/2506.06343","citing_paper":"/paper/2607.22100"},"observation_digest":"sha256:bb4e4ab100f14e7adab05fdb1a269f404d4effc3431482a18dffa2640557e04e","observation_id":"1302492f-f91d-49b9-82bd-e80a90afee7b","resolution":{"observed_at":"2026-08-01T05:50:33.363981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06343/citation-record","integrity":"/paper/2506.06343/integrity","json":"/paper/2506.06343/citation-record.json","paper":"/paper/2506.06343"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T11:58:40.491594Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.491594Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:2434326c37cf8ffb22fd421a9c5b1bfaf7efb53bf6dc37ec60906720bb4fd44e","observation_id":"c806618a-d343-424a-993a-e6ff54626dfd","resolution":{"observed_at":"2026-08-07T11:58:40.491594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T11:58:40.561463Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture- of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.561463Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:7987848d5fdd917601f83a2cf59b49a0f6d325538f141dcd2c1b9cf48a81762f","observation_id":"cb7aac0f-dd7d-4a7b-b1c4-2e3a9c3bc669","resolution":{"observed_at":"2026-08-07T11:58:40.561463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:58:40.684392Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.684392Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:9212bb2778f68b00b3e0070b06822e6ee69e5abcfbbaf678dea60350160a0fd7","observation_id":"4a70dcad-3b11-496f-98e0-1fda8883fab2","resolution":{"observed_at":"2026-08-07T11:58:40.684392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:40.810890Z","title":"Baichuan-omni-1.5 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.810890Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:fb142e163c101268455b3473376c686b25258df592dcbeb44edf859ccbc665dc","observation_id":"631d0733-5633-44b9-8519-626565e9a63e","resolution":{"observed_at":"2026-08-07T11:58:40.810890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:58:40.924179Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.924179Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:e9b0d99d6a17aeeba50b8e23b65f2f05450ba72c7f1b03c23f69de4efeca3e06","observation_id":"076e0b54-13c8-48fa-aa92-1a3b5b45342a","resolution":{"observed_at":"2026-08-07T11:58:40.924179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T11:58:41.015033Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.015033Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:9ed88382eaddf2f3ba1db4f34108713cf3456b6bbea8749625412807416bc0e9","observation_id":"0e806ba7-755f-4f05-b107-ee54be2e91b8","resolution":{"observed_at":"2026-08-07T11:58:41.015033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-07T11:58:41.157874Z","title":"Blsp: Bootstrapping language-speech pre-training via behavior align- ment of continuation writing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.157874Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:3d4972333bbabedfaacfc41ac05a1440d38472107c9c7829bf060c4f658e7be3","observation_id":"123184ec-ddfa-45d5-854a-097c2d554f96","resolution":{"observed_at":"2026-08-07T11:58:41.157874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02769","last_updated":"2025-06-04T08:53:07Z","snapshot_observed_at":"2026-08-07T17:29:58.036368Z","submitted_at":"2025-03-04T16:34:14Z","title":"InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02769","snapshot_observed_at":"2026-08-07T11:58:41.275667Z","title":"Inserter: Speech instruction following with unsupervised interleaved pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.275667Z"},"links":{"cited_paper":"/paper/2503.02769","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:b1273695ffd1aa252f77fd7d8c495865ebc50dbbfda7015d64f7ef2a1d935f8e","observation_id":"bed4a7ab-c49e-4df2-8453-db75df57dc7e","resolution":{"observed_at":"2026-08-07T11:58:41.275667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-07T07:21:28.700705Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T11:58:41.386187Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.386187Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:43bf67f33dd4e30111fdc768165e8035a621e622285e66f29352fff0e86b32ad","observation_id":"3fec8c50-3c76-4ff4-837a-7c90a0fa5985","resolution":{"observed_at":"2026-08-07T11:58:41.386187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-07T14:45:17.010729Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"cited_work":{"arxiv_id":"2505.17417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17417","snapshot_observed_at":"2026-08-07T11:58:44.561636Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","venue":"eess.AS","work_id":"fb047d49-2daa-4f8f-83a6-13e06715a80c","year":2025},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.531921Z"},"links":{"cited_paper":"/paper/2505.17417","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:eaeaac75fb9b1c230d2e144bbb849a0a26566691b32bae1bfe5bd4660e52ccfb","observation_id":"6df42d5f-d314-4609-a221-5560619ae578","resolution":{"observed_at":"2026-08-07T11:58:44.627131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-07T11:58:41.673699Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.673699Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:198814dd67edceff0775639f71c13dca28994443051c67e3bc8043d6f90b41bc","observation_id":"4e0f11e2-22a8-4db6-94d5-26769db66329","resolution":{"observed_at":"2026-08-07T11:58:41.673699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.10329","last_updated":"2021-10-20T00:59:36Z","snapshot_observed_at":"2026-07-06T11:59:43.025772Z","submitted_at":"2021-10-20T00:59:36Z","title":"SLAM: A Unified Encoder for Speech and Language Modeling via Speech-Text Joint Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.10329","snapshot_observed_at":"2026-08-07T11:58:41.805991Z","title":"Slam: A unified encoder for speech and language modeling via speech-text joint pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.805991Z"},"links":{"cited_paper":"/paper/2110.10329","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:6ba33e5d8d2f2ef52fb13b7ce023d5c090fe0f3990fafd3ab24be217e3cdb1c4","observation_id":"c6c26aea-4ace-4858-abee-3cebbce44cf4","resolution":{"observed_at":"2026-08-07T11:58:41.805991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01374","last_updated":"2022-02-03T02:26:40Z","snapshot_observed_at":"2026-07-06T12:34:00.262764Z","submitted_at":"2022-02-03T02:26:40Z","title":"mSLAM: Massively multilingual joint pre-training for speech and text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01374","snapshot_observed_at":"2026-08-07T11:58:41.929162Z","title":"mslam: Massively multilingual joint pre-training for speech and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.929162Z"},"links":{"cited_paper":"/paper/2202.01374","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:bd6136e0fa266db427daa741800704c2dd0103e191ae47bf092279e0cf1ab5c1","observation_id":"073b2990-7cce-476c-be3a-76ec126d729b","resolution":{"observed_at":"2026-08-07T11:58:41.929162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T11:58:42.065571Z","title":"Seam- lessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.065571Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:52fb25339196c9aadb6f83652a1ae8540233a931509eb825dd8ada703c2e63eb","observation_id":"7cc83ce2-6990-4d94-9e94-e5b4ad163fc3","resolution":{"observed_at":"2026-08-07T11:58:42.065571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-07T11:58:42.240760Z","title":"No language left behind: Scaling human-centered machine translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.240760Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:b3c40fd60034137c693c64290fe04e4cdc013b497f7b2683f79a4fb6877d0394","observation_id":"d1f7fc13-e024-4ffa-882b-2ba265f37872","resolution":{"observed_at":"2026-08-07T11:58:42.240760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:42.346892Z","title":"W2v-bert: Combining contrastive learning and masked language mod- eling for self-supervised speech pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.346892Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:a83acbaa4e8e8c1cb7a9d9a69f738b999dd63e2a7af5ff408f4f64f58599e7f7","observation_id":"4e7d927f-2eff-4969-982b-308d2f6ec336","resolution":{"observed_at":"2026-08-07T11:58:42.346892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-07T11:58:42.482144Z","title":"V oicebench: Benchmarking llm-based voice assistants,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.482144Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:7b3f7cf9e3fdcdf3175e03c30be7aee82339ebf86ecf26a5530776dcbccb3227","observation_id":"a3c87180-6074-434f-bc2e-2c9d23dd2acd","resolution":{"observed_at":"2026-08-07T11:58:42.482144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T11:58:42.585526Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.585526Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:b68da028f5381188da8456df1699cd96b14b60f4040759ebb8be3155d58a8bdb","observation_id":"6ad31277-d93e-4068-a1cd-f9b30221ff29","resolution":{"observed_at":"2026-08-07T11:58:42.585526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05706","last_updated":"2024-11-28T01:10:49Z","snapshot_observed_at":"2026-07-31T16:59:06.271065Z","submitted_at":"2024-02-08T14:35:09Z","title":"Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05706","snapshot_observed_at":"2026-08-07T11:58:42.752950Z","title":"Paralinguistics-aware speech- empowered large language models for natural conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.752950Z"},"links":{"cited_paper":"/paper/2402.05706","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:d50b20006c606e552a382400022c62b67c58975d71f4a8ad232cf8bed3005f58","observation_id":"87aa7824-7b99-471b-86b6-de5acded7abb","resolution":{"observed_at":"2026-08-07T11:58:42.752950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.419027Z","title":"Spirit-lm: Interleaved spoken and written language model,","venue":null,"work_id":"5a7d7b05-2161-4913-a883-adda81382b94","year":2025},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.886123Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:0aae5bf5310255216fb6498a05371c58f5b7aa58a5bed8a226edfa924e513d35","observation_id":"f8818343-d73f-4f41-966a-38e8a1e32526","resolution":{"observed_at":"2026-08-07T11:58:46.543567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.055107Z","title":"Dissecting learning and forgetting in language model finetuning,","venue":null,"work_id":"3bceb685-1080-4d43-9937-d3dadd773b9c","year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.012070Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:464c2f92a309dc0950fc8ce845c62f9dd8a164a110e8967a54f30151de20d733","observation_id":"cb7bff6c-c7a8-4840-8086-89d7b676e829","resolution":{"observed_at":"2026-08-07T11:58:46.248933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:58:43.136188Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.136188Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:11ebf85757402353d5658ec22f5e0e592175978fa3e3898dcd93b698d3bac2dc","observation_id":"12c6ad8f-6c7b-484d-8d59-4e2841806b24","resolution":{"observed_at":"2026-08-07T11:58:43.136188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.788917Z","title":"Openwebtext corpus,","venue":null,"work_id":"4f50418a-26c5-435a-a3f5-bddb8ec502e7","year":2019},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.312559Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:5b2e58be5315d7ab9b18ab377ef5d56c6a7b631ce0646efed0ff0a7a072a4934","observation_id":"e3aa62cf-f587-4f1a-a40b-15fce72d20b0","resolution":{"observed_at":"2026-08-07T11:58:45.929557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.507149Z","title":"Enhancing chat language models by scaling high-quality instructional conversations,","venue":null,"work_id":"d850f199-a9e0-4bfe-97d1-0187e7f677d9","year":2023},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.450637Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:a8e330deb73b3beac5a216986a7301af12ddcd018352c302d54413b71d88ddda","observation_id":"09a79cd4-a638-4dfc-a433-35c79d77fbd4","resolution":{"observed_at":"2026-08-07T11:58:45.639363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.260142Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants,","venue":null,"work_id":"6e66bfd2-4ff4-4951-bcea-98032a8962b0","year":2023},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.579967Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:f1347eafe3e1c195a57ec7c27a9d7773dd6332e2f459965d3f9447a4abcb8f6b","observation_id":"46b02533-0f52-45e5-9613-d44a4c88cc04","resolution":{"observed_at":"2026-08-07T11:58:45.383713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:43.752110Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.752110Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:1863d4af856b559a85babb261aefd718e815e67650e1cc15f7da96567913b1e2","observation_id":"b10ec70f-cf80-4788-8a44-f29e9e14ff3e","resolution":{"observed_at":"2026-08-07T11:58:43.752110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.004595Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge,","venue":null,"work_id":"5b30c745-8e6d-49b2-97d0-0081db6ac79a","year":2019},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.896352Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:066164bae7b1e152e540cf7dfaf0a50a7ab65abe9298f64eee93f98da20956bb","observation_id":"dfadb9da-0797-43a0-b1b7-f9913edbc643","resolution":{"observed_at":"2026-08-07T11:58:45.100191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.064280Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:44.064280Z"},"links":{"citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:d7ce95b848359d8592e2cc1df34a7f08195bd925db27ffdd46dea739a0d9e248","observation_id":"bb23e8f6-66ff-44a6-8976-98ff6d1c6755","resolution":{"observed_at":"2026-08-07T11:58:44.064280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-07T11:58:44.194819Z","title":"Covost 2 and massively multilingual speech-to-text translation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:44.194819Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:bead88ff670239714e4c9053c52967d2493ecded2c5663447023088807f39668","observation_id":"2a8231c3-cc6a-4139-afe9-79d01fc0f81a","resolution":{"observed_at":"2026-08-07T11:58:44.194819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2506.06343."}