{"as_of":"2026-08-01T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f84ac1a58ba47200cefd498ce6d38739f398b238106d9ba4ce19f093024b7fd7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:50:03.947364Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.10864/citation-record","integrity":"/paper/2606.10864/integrity","json":"/paper/2606.10864/citation-record.json","paper":"/paper/2606.10864"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Hybrid CTC/Attention architecture for end-to- end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:56aab7f709fce18c2bcb4b04949ace60c43e3e784dd8b48846df7eb0fa4a8526","observation_id":"d1b14169-4b35-4c45-8544-e5f89945c72f","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:9d3035e2dd8e552de301add1232da81f4e9841f7f9d2d319345fe52dbcf7115f","observation_id":"6b01d563-b780-4530-b8d2-e70c5c4481db","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Reproducing Whisper-style training using an open- source toolkit and publicly available data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:722ada0d67a27c77602c25c5e1e1012f236ea2e17073cff64acb650826686074","observation_id":"e1db1406-605b-43c8-a94d-8a2c6faa10cd","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:63f5ac8d168e35c6b0c4c70af5aec152eec649034daabecdadf15aa70aa5779a","observation_id":"669d07a2-23b5-487f-ad7d-b8b78af9ab28","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:c64e7a9785fc4af6bc771ec65bbbe4d1b3a0d5184f858be99a67e302f3403965","observation_id":"986f3fd8-9c41-46e4-9dbb-f71a4806f83d","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:c09d89ac525378160f946cec202fa234b8e6a9eca5b55f91d6fed162771d8e31","observation_id":"04e42d85-8d14-46d5-bd4a-9f700843e86b","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"ICLEval: Evaluating in-context learning ability of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:4e0da7411bc32ea7abc007cb892b8639dee060f71f2070c8c804c35d6dcde30c","observation_id":"992fab96-0548-4444-932c-5eac8b18f3ab","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"AudioChatLlama: Towards general-purpose speech abilities for LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:ecb4564d88f480a72efbb9bbf6f414145300aaab611809cbf68639f6fb5431ba","observation_id":"1b6710c4-8ada-4492-82e0-4abca001297a","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:2cbed8f4cd5d359752ae2fe783858ab7a69db8dd1447696237e81f8a65ec9865","observation_id":"9a2f510a-899c-42b2-a92a-38338f8b3f75","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:192250b4a839218e58026cad43315a4c0fd2639d57e447e21e3ee694eacb8906","observation_id":"ddf5143e-c500-4292-ac28-174acafe8bff","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"On decoder-only architecture for speech-to-text and large language model integration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:31a5e783a00dba16fd56d11bebcfcc25a65b76e41166f2a8bead39fd9958a1f4","observation_id":"53be9f38-2b91-475f-b8bc-f9a32fcf2d5a","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:aba446727967b44cd062d0b35a5f8e4a83d38e70d19bebf439f1173e47ed04fb","observation_id":"e5656288-7fba-4200-8c70-4f65b25316db","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Speech ReaLLM: Real-time speech recognition with multimodal language models by teaching the flow of time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:a930d7d00b4fefe0bf058f70a64d463a4ff8d17bf4b66bace9a05014ddcbbca7","observation_id":"0b8865ce-2074-48db-8f6e-c578995019b6","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SALM: Speech-augmented language model with in-context learning for speech recognition and translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:33d7716eff87fef7a3573f8c4f782f70e446a249d29348fa6b2837152157b29f","observation_id":"09d58f6b-d535-4145-87bc-754bb56ae523","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Investigating decoder-only large language models for speech-to-text translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:eb4962383ab0d94c0aebc8fedc44587aa7ffe20c8d12fd39aa110efa71beabf7","observation_id":"93153887-f10e-4eb3-8b8e-95ff650fa62e","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Prompting large language models with audio for general-purpose speech summarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:616c7951f20279b416df7d41b9d7c79bd02c89dba2827b92d16dbff1f7508d40","observation_id":"7e5de177-0799-46ec-a724-2e35eb519400","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Contextual biasing speech recognition in speech- enhanced large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:053ee1e198a6a43b88b16b8b3c93eef395b7c2e0625fe838d4e254b751d33fb3","observation_id":"df4b2ca7-7ecd-4176-ad0d-0b21386aaf62","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"MaLa-ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:808a92194d787f7151d9dfdd492512cf4f0c984162ceb13e7b4916e6a0831a59","observation_id":"36704c65-2420-4a0c-a8cb-ec950f86c00f","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:d896f79afe43a1ccbc9c4898d4f97c40cc3c42cf5880f5a034e28c5a43e0fb12","observation_id":"a54408b2-a99b-4b86-a9e1-2c66c8191eb1","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Using large language model for end-to-end Chinese ASR and NER,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:61f7703fd5e984373c5c098a537c4a345b327335bfb395ada784b5f75530dc99","observation_id":"284b0de5-918a-404f-9c31-6d890f22f798","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Whispering LLaMA: A cross-modal generative error correction framework for speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:05c44c6f1d1ac08ba6af21ee0c75a7091c11e2f392b27f7ed232f784b6f6a554","observation_id":"83509249-a515-4525-b1cf-39a88a4c44f4","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SLM: Bridge the thin gap between speech and text foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:bf9f224b3675b19fb6ca0fc124d021be6bdee2344085c0ded381e78c846a719b","observation_id":"308dcc7e-753a-4e69-9279-90908678973a","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Connecting speech encoder and large language model for ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:57070740ba3ca88c3d881415eb25a11e1b326eafd922530c17bdb73d0e40b153","observation_id":"0ef9b052-c03a-4603-bc7b-067531d782cd","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Speech recognition meets large language model: Benchmarking, models, and exploration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:1611b6be537d9257286c2e05a61f6134e33c59e3e9f83fa6b75cd1eb27ac963c","observation_id":"8104caaf-e607-4bbb-bff9-2edd8952fe6c","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Improving spoken language modeling with phoneme classification: A simple fine-tuning approach,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:a4ce5b6a32527e61fb4faea4e50b89e564c4c55031bcbe1528b732a826ed958e","observation_id":"2118fe69-6661-4f4f-b71d-3f4584908b88","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Improving large-scale deep biasing with phoneme features and text-only data in streaming transducer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:cbd74e06247e8834f878d305a698abb3b8e5e578d4799fe7f97d0b1e3e192d86","observation_id":"cd7db311-2d99-4413-ae0a-4b4b24da9145","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Phoneme-aware encoding for prefix-tree-based contextual asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:0bffcb2a05b1fb48e48f951c64f8fce299bf65f74a48a290f4a5a1e4e3bcbcaa","observation_id":"6297b633-bdeb-4f11-8f8a-7d709a229f9b","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:01c1d4edafbe7ba9a580559f8f3bd0557fffdf790990253ff4a1cb5c5fd7c70d","observation_id":"cf51188d-07bb-454e-b1ee-08920e00827c","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"AlignFormer: Modality matching can achieve better zero-shot instruction-following speech-LLM,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:6e0a7e6b37b7493f9be7700301cac388a4db3dd88a0652f6744c3fd901add3ea","observation_id":"bbc33d70-9477-4bdd-915f-5130d293ceef","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"QLoRA: Efficient finetuning of quantized LLMs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:54c13663dcdeaab5fcac6c768a57bcdbb87a86e82cc403b8046ccf0987e41a04","observation_id":"ab3def8d-3cf8-419b-8428-2fee0b2640fe","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:a7167634ff12e293a5d22181f71565c4077490a7b5cc74a0f416ee7713bbdacb","observation_id":"f33e143b-118a-4a18-a01b-8699a69ff287","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"TED-LIUM 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:4e73f4fd901861980c267cecfbff9ca63ce27e6c9b1a60222ac22485205661f5","observation_id":"824d3fce-3840-4767-a90b-3331137371d9","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"TED-LIUM: an automatic speech recognition dedicated corpus,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:9665b1cec0febc3007acd6d91f58d0707435e6ce5998bebcd188a401ee2fc82b","observation_id":"58fa854f-d45e-42d8-bd71-f1277dff0ee1","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:48eeb7f626d6e2a8e32dcd0e4ad06fd835f9af7502e5c71edfdce34a5f349317","observation_id":"1978b4ab-abaf-4dca-902c-bbdbccba3c10","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SUPERB: Speech processing universal PERfor- mance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:22728199c0ee63cf849507d1d82d33a27b127369a3a5e093d4ea86b76d6f2e62","observation_id":"15f6a2eb-8be1-4f7e-ad30-5e48f197f1a6","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"The Spoken Dutch Corpus: Overview and first evaluation,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:242d216b50eb0f8367ddcaa97339a2dafeb243ea7d44b672512d2a24539e3716","observation_id":"a4d18cae-9b84-4b3c-aad9-0b18a3a40c0d","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Automatic generation of phonetic transcriptions for large speech corpora,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:9a005c3c5c16645590509929de70c7e883d09161189ce8b083fa6f16185a62d1","observation_id":"b79553a2-623e-482b-838a-fe44156eeb26","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Assessing manually corrected broad phonetic transcriptions in the spoken Dutch corpus,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:fc782054609f2b40e62659dda755e60eea5eed190fbeaf742c6491ee28e8d283","observation_id":"28860d14-9775-4695-8545-8b7daa61a088","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03212","last_updated":"2025-02-05T14:26:58Z","snapshot_observed_at":"2026-07-06T20:31:36.881479Z","submitted_at":"2025-02-05T14:26:58Z","title":"Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling","version":1},"cited_work":{"arxiv_id":"2502.03212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03212","snapshot_observed_at":"2026-07-03T07:47:44.604777Z","title":"Leveraging broadcast media subtitle transcripts for automatic speech recognition and subtitling,","venue":null,"work_id":"00d5cc56-1399-40cf-9ea8-c32366104f46","year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"cited_paper":"/paper/2502.03212","citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:18904b4408d52fb195246efe6cb869a933f264a5a713ca47508890d9131a8e70","observation_id":"1689d178-78d0-42b0-b4b4-48f29e61a808","resolution":{"observed_at":"2026-07-03T07:47:44.606826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:524c23e00ba58186c60e53f1216393723add409f1f526dba83e79cdd39122f9d","observation_id":"0fc1c09f-bcf6-4dd7-926b-0975430163ce","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Montreal Forced Aligner: Trainable text- speech alignment using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:f7118e53922864a7f51264dc0c8e5170e51d9d84146413f2c9f16dc7a9ea5dea","observation_id":"2e9ebee1-5cad-42cd-8cab-f9446785a2fe","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2606.10864."}