Pith. sign in

Paper Citation Record · LEDGER

Speech Encoder Fusion for LLM-based Automatic Speech Recognition

As of 1 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2606.10853.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.10853 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-27T11:32:58.335783Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-01T06:32:01.292127+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-27T11:32:58.335783Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-03T07:57:44.678976Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact4
  • verified fuzzy0
  • unresolved39
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 60fed204-647c-4b3c-9f12-58151d5d53f8 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:fd7dd3e64916315474c092963ce09f6dfe064dd1fba0b40ea7711beeb3239301

Observation f6f9d7b5-ca60-4e2a-bb2f-3f8d3fe1937f · outbound

This paper cites Speech Encoder Fusion for LLM-based Automatic Speech Recognition.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech Encoder Fusion for LLM-based Automatic Speech Recognition

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:57:44.680345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:52da1600f367a9548f1ca7c9320cce86f71d1f44511e646114886e8254936b10

Observation 010a30db-6313-4ea5-9202-5a6d35e625d6 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:51d30dd9baeef47b7e0bb55a141fadbd9bdbfaa03d9846c6d138e7a1d76b2999

Observation 89867cb9-6195-48ab-9ba3-1f4894f17068 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:505bbf1fc521fff26673d4ac821b4d796452b43031345e528607061081a818cf

Observation 35356ebf-7ce3-40e3-b0e7-3e86e9e3077e · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:fa359d60a54ecac13542ba11a4d8f35ce124d1a37f13518380b9f4f7c95d04a1

Observation cb5908c9-155e-46a0-b3a7-775e4b9a98b1 · outbound

This paper cites 0: Hello. 1: How are you? 0: I’m fine.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition 0: Hello. 1: How are you? 0: I’m fine

Reference 6

Resolution
malformed identifier
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:3f65d595ac0f7c69b5b41d5a25cb699a00a69fd004c389d2f6ee25aae3236414

Observation 7ada9d18-f7dc-4a05-b059-d6ee9e61bb5c · outbound

This paper cites Although speech-LLMs have difficulties at- taining performance of dedicated ASR systems, augmenting LLMs with speech capabilities has much wider applications be- sides ASR.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Although speech-LLMs have difficulties at- taining performance of dedicated ASR systems, augmenting LLMs with speech capabilities has much wider applications be- sides ASR

Reference 7

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:1b05a0cd80d156ffcd6d62ce86f24c5b7681db88c08b96905d9ac2cf7b5a1ad1

Observation 8a87ba39-287d-41aa-8460-838167b111fa · outbound

This paper cites We found that careful fusion outperforms standard feature concatenation in all cases.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition We found that careful fusion outperforms standard feature concatenation in all cases

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:aad58e589e42dbc1095ded455ebf8f575e3e23ba03d492169e7d3c4e83e92e6e

Observation b477bcbc-5e85-4293-bb4c-730f1b97f521 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:9775c4597dbfa8ebd5265b7e94cfe6d926c38952094fa50e2850a3e57470e02d

Observation 6049178e-9f83-4431-92f0-7f21f52becfd · outbound

This paper cites No part of the manuscript’s content or ideas was produced by generative AI.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition No part of the manuscript’s content or ideas was produced by generative AI

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:c4676c7883aa1b233f9ea082988c389c73fca1e32d0d37be87f30a37a44dbb91

Observation 487ef033-f0e3-49fc-b85c-7f06de76871a · outbound

This paper cites BLIP-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition BLIP-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:0c33eaa3ceaf1cc472fcd939647f69f7110854796f88c1464c142cd658a9da64

Observation 2bb29882-95e5-4591-8d44-620d6e41f88a · outbound

This paper cites Visual instruction tuning,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Visual instruction tuning,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:33338a6457b6e7e175b8ba05160268fa3ec702cc6c3b4489da33497bac11d374

Observation e4925622-4525-4f07-9bf9-2d1dc972c69e · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:57:44.685719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:dcee96dbaf505efe98152f50aa9c247abb1949f8d7d1f6efa8e5b71ca30a824d

Observation 9603f22e-0b20-4bfc-9826-3f197c8a8bef · outbound

This paper cites SALMONN: Towards generic hearing abilities for large language models,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition SALMONN: Towards generic hearing abilities for large language models,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:cbcbf5c7f4bde9ae072e096a2ee2e3038e8453c4c0027c48d26d74e81b06a01a

Observation 9e103e6f-5f4c-4c24-b3fe-00e35ea8fb3b · outbound

This paper cites AudioChatLlama: Towards general-purpose speech abilities for LLMs,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition AudioChatLlama: Towards general-purpose speech abilities for LLMs,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:cc975238e3fa2f9fff984bcfab9518506772f3cd43f5a694d7191798b98bf53b

Observation fdd62753-c608-423c-990c-2ba71b132fac · outbound

This paper cites Speech ReaLLM – real-time speech recognition with multimodal lan- guage models by teaching the flow of time,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech ReaLLM – real-time speech recognition with multimodal lan- guage models by teaching the flow of time,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:9e5ae72b2416b0b12e19da6ca4a59ac36afbdc5baf7feabbdbbf072f807de4d4

Observation 318b608d-a294-4525-984e-d6a297799777 · outbound

This paper cites Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:507005b19b768d4f9db9ae3f6b76a64a79be345747a158ebc45cd02e22eb0c4f

Observation ff5e17ce-a7c4-4af2-92ab-3524031ea049 · outbound

This paper cites BESTOW: Efficient and streamable speech language model with the best of two worlds in GPT and T5,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition BESTOW: Efficient and streamable speech language model with the best of two worlds in GPT and T5,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:9e85b53775efa9b1dd46b243f99eb7f46d3f617ed8b5c8c54d2556c467242674

Observation 46b05289-1338-4f5b-b589-5d650f88aafe · outbound

This paper cites Speech recognition meets large language model: benchmarking, models, and exploration,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech recognition meets large language model: benchmarking, models, and exploration,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:e656c41e837aa4e72eb1bbe933ea045497a978b7571028fc65f5ee8f3c4ffde0

Observation 5bfff35c-5238-401a-8381-ced8bbedb4c5 · outbound

This paper cites Connecting speech encoder and large language model for ASR,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Connecting speech encoder and large language model for ASR,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:f9624771e4476744b72b3f90b21fc6497bca8dfcf48ee2724e55cb54d28a13d9

Observation 0f4fbd24-82ab-41d3-a5b8-df67363b844d · outbound

This paper cites How to connect speech foundation models and large language models? What matters and what does not,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition How to connect speech foundation models and large language models? What matters and what does not,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:24c54abf46877982ad0c1887576e9fb4ed820bcd7ca2a2fde0c3b9d711e1ec16

Observation fab720ae-6a5c-40a0-adbc-f91b6e861fc4 · outbound

This paper cites Prompting large language models with speech recog- nition abilities,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Prompting large language models with speech recog- nition abilities,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:6445f448ca4c64542469ab023a8d04b7fde66e4b62aad9a82f7be1186c830bb5

Observation 50653965-3851-4867-a341-582a0d4625e0 · outbound

This paper cites Robust speech recognition via large-scale weak su- pervision,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Robust speech recognition via large-scale weak su- pervision,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:543a01e7dc6eb00cfb24fa15452335ea4fbd91dfd1e87381fd00036973906a70

Observation 7b0887a6-ae9c-43fa-910f-679b66637a3c · outbound

This paper cites OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:e3f76e3b76fecc48e8e2b02e16962004d640acca687181b3c60a4e210988b0ed

Observation 1c8523ea-90b5-4524-af70-4043a0286dc0 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:34c315bff596a2b62bf28bd69c5f39a1e827b64097969feb1a31e2ac308f91c5

Observation 0698eaf9-bb2a-4352-bfd4-1d80d95273f2 · outbound

This paper cites WavLM: Large-scale self-supervised pre-training for full stack speech processing,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition WavLM: Large-scale self-supervised pre-training for full stack speech processing,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:118e03a3c12d2e4eeb46e091d8c2a2c0ef3cf0d69b81c1c388bf1d4236ee6628

Observation 82620119-0285-45c0-819e-13e01dbf8397 · outbound

This paper cites Better pseudo- labeling with multi-ASR fusion and error correction by speech- LLM,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Better pseudo- labeling with multi-ASR fusion and error correction by speech- LLM,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:a85b6c6fce30fd769a5c7d39a5a92b4dde3d9829a34dfa2df3836f754e2a69d5

Observation 962645b5-c3a8-4b21-8318-6fe2577589a6 · outbound

This paper cites Attention is all you need,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Attention is all you need,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:e6c89f6399c6dc42ce528510ab29aa44a034c4fc8965c7d5b28c08d13066501e

Observation d6009c95-e63b-4404-a6a4-4bfbfe68c066 · outbound

This paper cites Leveraging broadcast media sub- title transcripts for automatic speech recognition and subtitling,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Leveraging broadcast media sub- title transcripts for automatic speech recognition and subtitling,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:f7fa84197fbe42c7d828b7a35eac634078764fd63cc76568a915c46ff3769c28

Observation 51d583c8-c661-4845-81b7-2939c33c77aa · outbound

This paper cites WavLLM: Towards robust and adaptive speech large language model,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition WavLLM: Towards robust and adaptive speech large language model,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:4e7bd876df78b522a8ada37f76b47f6c5fb12df47cfdc5f93a9be23b8e81eeff

Observation 491b754c-fb6f-4348-9336-9153c19c506a · outbound

This paper cites Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:57:44.683338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:0c2dd1503c59aa735fce49435e88032613464738743ec052ed674f4f808b5346

Observation 802cb44b-d06e-405c-84fa-d60e55921e2b · outbound

This paper cites MoWE-Audio: Multitask audioLLMs with mixture of weak encoders,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition MoWE-Audio: Multitask audioLLMs with mixture of weak encoders,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:517407cd844f02cfaa80f44ad2fe11d38e9f0634b64f161eeb10ce26555a4bc9

Observation 43987fa7-989d-40d4-a183-53a5ca314ad3 · outbound

This paper cites Enhancing speech large language models with prompt-aware mixture of audio encoders,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Enhancing speech large language models with prompt-aware mixture of audio encoders,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:efc61e0b15286ed5f6e2d5e1d132e5ea81ea630ca9ea66962ab32bee1160130f

Observation 6a2344da-645b-48b6-9468-16787507174e · outbound

This paper cites Hybrid CTC/Attention architecture for end-to-end speech recog- nition,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Hybrid CTC/Attention architecture for end-to-end speech recog- nition,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:6e0cb756768ab745933016b725654895a0b36d7b17b83f798820fa5f395df8d6

Observation 9693f9bd-1ffd-4fcf-8157-511f9c630a2c · outbound

This paper cites Learning to jointly transcribe and subtitle for end-to-end spontaneous speech recognition,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Learning to jointly transcribe and subtitle for end-to-end spontaneous speech recognition,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:03dc8b0f3a63cb93e9ce060070f399b61e50289de753ec9cad02cce7cb9cc827

Observation 3e4501f9-0825-450a-a54e-3f2ef6acbc6f · outbound

This paper cites Lib- rispeech: An ASR corpus based on public domain audio books,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Lib- rispeech: An ASR corpus based on public domain audio books,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:f50924ec1f5a59f468b53787b88c971bd48fe91e23ff97f93003f60ea8a583b0

Observation ab6a9c0b-3afe-40e0-9150-5e98d0008ff2 · outbound

This paper cites ECAPA2: a hybrid neural net- work architecture and training strategy for robust speaker embed- dings,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition ECAPA2: a hybrid neural net- work architecture and training strategy for robust speaker embed- dings,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:dfd717dec83fd7fe65889b3551a8a4d8e2a726b4ae127f8ae1e469283ad3cf0e

Observation 464ba1d2-b0fb-4563-bf84-daaabbcea227 · outbound

This paper cites Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:2f12032ba67b908e346b3cb43106fe56b8967efc263ab3095f36d2477ca68468

Observation feffa023-88b5-4fd3-88c2-4af5cbdad417 · outbound

This paper cites AlignFormer: Modality matching can achieve better zero-shot instruction- following speech-LLM,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition AlignFormer: Modality matching can achieve better zero-shot instruction- following speech-LLM,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:d92d159cbc9c3cd69800ddf3d4f8cb368bbfa044b572c7c160d45901f23b9fc1

Observation c8f7c0ef-d25f-47f8-8e0a-65a1d4622628 · outbound

This paper cites The spoken Dutch corpus. overview and first evalu- ation,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition The spoken Dutch corpus. overview and first evalu- ation,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:41ede350b0ee175e4e74e1f2614cf134de2d4094328a850fd4230c1a9d5ca6dc

Observation 66106ef6-4cfd-485c-be69-68355538d9b7 · outbound

This paper cites Seri- alized output training for end-to-end overlapped speech recogni- tion,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Seri- alized output training for end-to-end overlapped speech recogni- tion,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:43d560f305e3552adcd3c9535a3c39cb53798b0491fcdff72168b810925de9e8

Observation 39428aff-2077-43df-917f-e697a134724e · outbound

This paper cites The rich transcription 2007 meeting recognition evaluation,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition The rich transcription 2007 meeting recognition evaluation,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:36e1d39ad4ec00378988d42cf5cb3e25632fa9d67625b54a02e271f1ad6362f0

Observation 9dfbb77c-492b-4d08-887e-995a839d3e90 · outbound

This paper cites Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:57:44.688641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:86bf7cfa70b59c7f0fcc69eb7c4cd379e5589cf066180c1479aff44f714765b4

Observation 3c489005-8d64-402a-a936-602886a09bba · outbound

This paper cites Evaluation of LLMs in speech is often flawed: Test set contamination in large language models for speech recognition,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Evaluation of LLMs in speech is often flawed: Test set contamination in large language models for speech recognition,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:e28b04544c845577450309fc4047586974588716f630a237157f25ab9741a73a

Pith citing papers

Observation f6f9d7b5-ca60-4e2a-bb2f-3f8d3fe1937f · inbound

Speech Encoder Fusion for LLM-based Automatic Speech Recognition cites this paper.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech Encoder Fusion for LLM-based Automatic Speech Recognition

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:57:44.680345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:52da1600f367a9548f1ca7c9320cce86f71d1f44511e646114886e8254936b10