{"as_of":"2026-08-01T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:daff0e08cb24c09719ab7b4e9bf92f19472455ecc39a646c8ab686776227a9a1","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:32:58.335783Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:32:58.335783Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T07:57:44.678976Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"2606.10853","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10853","snapshot_observed_at":"2026-07-03T07:57:44.678976Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","venue":"eess.AS","work_id":"eb690997-aaa3-4b6f-ae1b-01684d1869e3","year":2026},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2606.10853","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:52da1600f367a9548f1ca7c9320cce86f71d1f44511e646114886e8254936b10","observation_id":"f6f9d7b5-ca60-4e2a-bb2f-3f8d3fe1937f","resolution":{"observed_at":"2026-07-03T07:57:44.680345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10853/citation-record","integrity":"/paper/2606.10853/integrity","json":"/paper/2606.10853/citation-record.json","paper":"/paper/2606.10853"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:fd7dd3e64916315474c092963ce09f6dfe064dd1fba0b40ea7711beeb3239301","observation_id":"60fed204-647c-4b3c-9f12-58151d5d53f8","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"2606.10853","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10853","snapshot_observed_at":"2026-07-03T07:57:44.678976Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","venue":"eess.AS","work_id":"eb690997-aaa3-4b6f-ae1b-01684d1869e3","year":2026},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2606.10853","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:52da1600f367a9548f1ca7c9320cce86f71d1f44511e646114886e8254936b10","observation_id":"f6f9d7b5-ca60-4e2a-bb2f-3f8d3fe1937f","resolution":{"observed_at":"2026-07-03T07:57:44.680345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:51d30dd9baeef47b7e0bb55a141fadbd9bdbfaa03d9846c6d138e7a1d76b2999","observation_id":"010a30db-6313-4ea5-9202-5a6d35e625d6","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:505bbf1fc521fff26673d4ac821b4d796452b43031345e528607061081a818cf","observation_id":"89867cb9-6195-48ab-9ba3-1f4894f17068","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:fa359d60a54ecac13542ba11a4d8f35ce124d1a37f13518380b9f4f7c95d04a1","observation_id":"35356ebf-7ce3-40e3-b0e7-3e86e9e3077e","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"0: Hello. 1: How are you? 0: I’m fine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:3f65d595ac0f7c69b5b41d5a25cb699a00a69fd004c389d2f6ee25aae3236414","observation_id":"cb5908c9-155e-46a0-b3a7-775e4b9a98b1","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Although speech-LLMs have difficulties at- taining performance of dedicated ASR systems, augmenting LLMs with speech capabilities has much wider applications be- sides ASR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:1b05a0cd80d156ffcd6d62ce86f24c5b7681db88c08b96905d9ac2cf7b5a1ad1","observation_id":"7ada9d18-f7dc-4a05-b059-d6ee9e61bb5c","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"We found that careful fusion outperforms standard feature concatenation in all cases","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:aad58e589e42dbc1095ded455ebf8f575e3e23ba03d492169e7d3c4e83e92e6e","observation_id":"8a87ba39-287d-41aa-8460-838167b111fa","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:9775c4597dbfa8ebd5265b7e94cfe6d926c38952094fa50e2850a3e57470e02d","observation_id":"b477bcbc-5e85-4293-bb4c-730f1b97f521","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"No part of the manuscript’s content or ideas was produced by generative AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:c4676c7883aa1b233f9ea082988c389c73fca1e32d0d37be87f30a37a44dbb91","observation_id":"6049178e-9f83-4431-92f0-7f21f52becfd","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"BLIP-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:0c33eaa3ceaf1cc472fcd939647f69f7110854796f88c1464c142cd658a9da64","observation_id":"487ef033-f0e3-49fc-b85c-7f06de76871a","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:33338a6457b6e7e175b8ba05160268fa3ec702cc6c3b4489da33497bac11d374","observation_id":"2bb29882-95e5-4591-8d44-620d6e41f88a","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:dcee96dbaf505efe98152f50aa9c247abb1949f8d7d1f6efa8e5b71ca30a824d","observation_id":"e4925622-4525-4f07-9bf9-2d1dc972c69e","resolution":{"observed_at":"2026-07-03T07:57:44.685719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:cbcbf5c7f4bde9ae072e096a2ee2e3038e8453c4c0027c48d26d74e81b06a01a","observation_id":"9603f22e-0b20-4bfc-9826-3f197c8a8bef","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"AudioChatLlama: Towards general-purpose speech abilities for LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:cc975238e3fa2f9fff984bcfab9518506772f3cd43f5a694d7191798b98bf53b","observation_id":"9e103e6f-5f4c-4c24-b3fe-00e35ea8fb3b","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Speech ReaLLM – real-time speech recognition with multimodal lan- guage models by teaching the flow of time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:9e5ae72b2416b0b12e19da6ca4a59ac36afbdc5baf7feabbdbbf072f807de4d4","observation_id":"fdd62753-c608-423c-990c-2ba71b132fac","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:507005b19b768d4f9db9ae3f6b76a64a79be345747a158ebc45cd02e22eb0c4f","observation_id":"318b608d-a294-4525-984e-d6a297799777","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"BESTOW: Efficient and streamable speech language model with the best of two worlds in GPT and T5,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:9e85b53775efa9b1dd46b243f99eb7f46d3f617ed8b5c8c54d2556c467242674","observation_id":"ff5e17ce-a7c4-4af2-92ab-3524031ea049","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Speech recognition meets large language model: benchmarking, models, and exploration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:e656c41e837aa4e72eb1bbe933ea045497a978b7571028fc65f5ee8f3c4ffde0","observation_id":"46b05289-1338-4f5b-b589-5d650f88aafe","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Connecting speech encoder and large language model for ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:f9624771e4476744b72b3f90b21fc6497bca8dfcf48ee2724e55cb54d28a13d9","observation_id":"5bfff35c-5238-401a-8381-ced8bbedb4c5","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"How to connect speech foundation models and large language models? What matters and what does not,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:24c54abf46877982ad0c1887576e9fb4ed820bcd7ca2a2fde0c3b9d711e1ec16","observation_id":"0f4fbd24-82ab-41d3-a5b8-df67363b844d","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Prompting large language models with speech recog- nition abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:6445f448ca4c64542469ab023a8d04b7fde66e4b62aad9a82f7be1186c830bb5","observation_id":"fab720ae-6a5c-40a0-adbc-f91b6e861fc4","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:543a01e7dc6eb00cfb24fa15452335ea4fbd91dfd1e87381fd00036973906a70","observation_id":"50653965-3851-4867-a341-582a0d4625e0","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:e3f76e3b76fecc48e8e2b02e16962004d640acca687181b3c60a4e210988b0ed","observation_id":"7b0887a6-ae9c-43fa-910f-679b66637a3c","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:34c315bff596a2b62bf28bd69c5f39a1e827b64097969feb1a31e2ac308f91c5","observation_id":"1c8523ea-90b5-4524-af70-4043a0286dc0","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:118e03a3c12d2e4eeb46e091d8c2a2c0ef3cf0d69b81c1c388bf1d4236ee6628","observation_id":"0698eaf9-bb2a-4352-bfd4-1d80d95273f2","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Better pseudo- labeling with multi-ASR fusion and error correction by speech- LLM,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:a85b6c6fce30fd769a5c7d39a5a92b4dde3d9829a34dfa2df3836f754e2a69d5","observation_id":"82620119-0285-45c0-819e-13e01dbf8397","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:e6c89f6399c6dc42ce528510ab29aa44a034c4fc8965c7d5b28c08d13066501e","observation_id":"962645b5-c3a8-4b21-8318-6fe2577589a6","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Leveraging broadcast media sub- title transcripts for automatic speech recognition and subtitling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:f7fa84197fbe42c7d828b7a35eac634078764fd63cc76568a915c46ff3769c28","observation_id":"d6009c95-e63b-4404-a6a4-4bfbfe68c066","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:4e7bd876df78b522a8ada37f76b47f6c5fb12df47cfdc5f93a9be23b8e81eeff","observation_id":"51d583c8-c661-4845-81b7-2939c33c77aa","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05796","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05796","snapshot_observed_at":"2026-07-03T07:57:44.681677Z","title":"Diarization-aware multi-speaker automatic speech recognition via large language models,","venue":null,"work_id":"6d83eae1-3662-4804-96c8-8ec828090b05","year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2506.05796","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:0c2dd1503c59aa735fce49435e88032613464738743ec052ed674f4f808b5346","observation_id":"491b754c-fb6f-4348-9336-9153c19c506a","resolution":{"observed_at":"2026-07-03T07:57:44.683338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"MoWE-Audio: Multitask audioLLMs with mixture of weak encoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:517407cd844f02cfaa80f44ad2fe11d38e9f0634b64f161eeb10ce26555a4bc9","observation_id":"802cb44b-d06e-405c-84fa-d60e55921e2b","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Enhancing speech large language models with prompt-aware mixture of audio encoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:efc61e0b15286ed5f6e2d5e1d132e5ea81ea630ca9ea66962ab32bee1160130f","observation_id":"43987fa7-989d-40d4-a183-53a5ca314ad3","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Hybrid CTC/Attention architecture for end-to-end speech recog- nition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:6e0cb756768ab745933016b725654895a0b36d7b17b83f798820fa5f395df8d6","observation_id":"6a2344da-645b-48b6-9468-16787507174e","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Learning to jointly transcribe and subtitle for end-to-end spontaneous speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:03dc8b0f3a63cb93e9ce060070f399b61e50289de753ec9cad02cce7cb9cc827","observation_id":"9693f9bd-1ffd-4fcf-8157-511f9c630a2c","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:f50924ec1f5a59f468b53787b88c971bd48fe91e23ff97f93003f60ea8a583b0","observation_id":"3e4501f9-0825-450a-a54e-3f2ef6acbc6f","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"ECAPA2: a hybrid neural net- work architecture and training strategy for robust speaker embed- dings,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:dfd717dec83fd7fe65889b3551a8a4d8e2a726b4ae127f8ae1e469283ad3cf0e","observation_id":"ab6a9c0b-3afe-40e0-9150-5e98d0008ff2","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:2f12032ba67b908e346b3cb43106fe56b8967efc263ab3095f36d2477ca68468","observation_id":"464ba1d2-b0fb-4563-bf84-daaabbcea227","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"AlignFormer: Modality matching can achieve better zero-shot instruction- following speech-LLM,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:d92d159cbc9c3cd69800ddf3d4f8cb368bbfa044b572c7c160d45901f23b9fc1","observation_id":"feffa023-88b5-4fd3-88c2-4af5cbdad417","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"The spoken Dutch corpus. overview and first evalu- ation,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:41ede350b0ee175e4e74e1f2614cf134de2d4094328a850fd4230c1a9d5ca6dc","observation_id":"c8f7c0ef-d25f-47f8-8e0a-65a1d4622628","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:43d560f305e3552adcd3c9535a3c39cb53798b0491fcdff72168b810925de9e8","observation_id":"66106ef6-4cfd-485c-be69-68355538d9b7","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"The rich transcription 2007 meeting recognition evaluation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:36e1d39ad4ec00378988d42cf5cb3e25632fa9d67625b54a02e271f1ad6362f0","observation_id":"39428aff-2077-43df-917f-e697a134724e","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.683068Z","title":"Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation","venue":null,"work_id":"a725e4ec-3331-4b0a-ae53-2084079eb773","year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:86bf7cfa70b59c7f0fcc69eb7c4cd379e5589cf066180c1479aff44f714765b4","observation_id":"9dfbb77c-492b-4d08-887e-995a839d3e90","resolution":{"observed_at":"2026-07-03T07:57:44.688641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:32:58.335783Z","title":"Evaluation of LLMs in speech is often flawed: Test set contamination in large language models for speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:e28b04544c845577450309fc4047586974588716f630a237157f25ab9741a73a","observation_id":"3c489005-8d64-402a-a936-602886a09bba","resolution":{"observed_at":"2026-06-27T11:32:58.335783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2606.10853."}