Pith. sign in

Paper Citation Record · LEDGER

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

As of 6 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 2 inbound Pith citation observations for arXiv:2606.10368.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.10368 v1

Coverage vector

measured 25 of 25 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-27T12:04:50.483329Z

measured 27 of 27 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-27T18:27:10.422343Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

25 of 25 outbound references displayed

  • verified exact18
  • verified fuzzy0
  • unresolved6
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation eed0431e-a90f-4f89-942b-d2be5ab38cdc · outbound

This paper cites D.; Ho, J.; Tarlow, D.; and van den Berg, R.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation D.; Ho, J.; Tarlow, D.; and van den Berg, R

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:84941c4b830a2f09e7dec86607b689e9edf4ff088131ece31e212a1d36276ad1

Observation 6f78013a-d651-4cec-8e2f-400764c23311 · outbound

This paper cites TransFusion: Transcribing Speech with Multinomial Diffusion.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation TransFusion: Transcribing Speech with Multinomial Diffusion

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.919728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:f6729b1dc99b3bc835ad7cd74f582d19f0860f37f6e308c58223d89a809fc418

Observation 557aa51b-f847-4547-ab6e-a4b8b4f70542 · outbound

This paper cites Prompting Large Language Models with Speech Recognition Abilities.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Prompting Large Language Models with Speech Recognition Abilities

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.927640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:72be0b72315b30c676b8a780301849961fd999032c3cf555802144e5195c3533

Observation 9a660ae8-f036-47e5-b791-8b64ca1e19f4 · outbound

This paper cites Continuous Latent Diffusion Language Model.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Continuous Latent Diffusion Language Model

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.965510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:1a5a8da2864c0eb0f8fceac33b8c696765a015f91e7df1ff4116b69d1fcda0b9

Observation 4ae65cdf-290b-4a4e-86c9-ab96894a1099 · outbound

This paper cites Classifier-Free Diffusion Guidance.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Classifier-Free Diffusion Guidance

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.967712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:6cfbfc74af9574b113131e95f758b537959012d4fb3ed59fb65b93f4c7d38f6b

Observation eb47829e-7c1e-4950-a247-1b97655aebfe · outbound

This paper cites ELF: Embedded Language Flows.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation ELF: Embedded Language Flows

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.960405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:84c2f245013586b605214cfce2eea2599f2362db8362c8963a94e1d8565ff92a

Observation 9343785d-3109-4dab-94d9-14735fc82308 · outbound

This paper cites Whisfusion: Parallel ASR Decoding with Masked Diffusion.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Whisfusion: Parallel ASR Decoding with Masked Diffusion

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.958180Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:11c5d5c030090bbd4fbb199c47671244abcb6c1861548ec5b7d16c8de45406ce

Observation af26b459-ad70-4ae0-926e-665a5b91c5a1 · outbound

This paper cites The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.948394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:4617f2e4ed9be555e5f9b1c79e683be4d81dceb6cd84eba5daf64e97cc33ff85

Observation e0c3d23d-ec70-4054-8a10-e679534f9dbc · outbound

This paper cites Flow Matching for Generative Modeling.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Flow Matching for Generative Modeling

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.955627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:9de66d02790b89011e7d838255dc27ebcd7cc8f44c44e66ec4b09c17fe788dc4

Observation 7646612b-42a2-47cf-a2d8-61476aca2dbe · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:29980bf18399efcb5a84d66750a1189b2553ef07db37ef430324851ed545bf8c

Observation ea183f7d-918b-4e36-970f-7b983777c7f2 · outbound

This paper cites An Embarrassingly Simple Approach for LLM with Strong ASR Capacity.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation An Embarrassingly Simple Approach for LLM with Strong ASR Capacity

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.951000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:c26234bf1d8fa4a4bf343d2a4e848016ec9bf89fb53bd38212aad4ddfb13cd3e

Observation 8ca6e48f-af70-47fe-bfd7-a6de0398ca18 · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:11e8daad97ee53d98b7f4bf8482e0e1619dabc45c87e85ac6532054ac3adbb24

Observation 8501cc49-74c5-4f43-8816-9fb3b662bbdb · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:e3dfcbc280621c8a6758de21d039c31044dafe4c8a14f63af0d421a8ab77bab0

Observation 244afa04-8b7b-4edb-afc3-c30304b88345 · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Robust Speech Recognition via Large-Scale Weak Supervision

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T07:27:44.943022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:8ae05c6ebfa976ca13953d97510af878f0e7b6a114dc3a93e6b32d44f452bb1e

Observation 436fa945-165d-42df-8e00-c1dbdc6cefc3 · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.932389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:1fa8a077f2c51a35f62f2d80889199d9574cc1569eaf4b7838e03842d87a8731

Observation b1952000-53c2-4d73-a9c5-e08f287f3a68 · outbound

This paper cites S.; Arriola, M.; Schiff, Y.; Gokaslan, A.; Marroquin, E.; Chiu, J.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation S.; Arriola, M.; Schiff, Y.; Gokaslan, A.; Marroquin, E.; Chiu, J

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:5a5b3a0839cb9874626032885c709fdf685cdab0e6b7b7b82602666925e963e9

Observation 46bb7418-2aad-4f87-bfb2-c54f06791340 · outbound

This paper cites SeamlessM4T: Massively Multilingual & Multimodal Machine Translation.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.963055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:e49078c4a536881ab64459695035e8e15ca09ea0cde746f2c8bb75ec765aa98b

Observation e39b7bde-9dcd-4893-ae80-8826df64c100 · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:6a1ae448bd0d209651fbe6917dae2aa66b4e7a2e3d90e3c9e1bbc74637fbcfcb

Observation 0fe00fc5-ce71-417a-ac73-62988a0f86e5 · outbound

This paper cites CoVoST 2 and Massively Multilingual Speech-to-Text Translation.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation CoVoST 2 and Massively Multilingual Speech-to-Text Translation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.945646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:d526f039e6b45aa8ce58d7bc5fa6189c73493312ac44f2899c68874dd2aaa203

Observation 3667a07c-94e2-4be2-8936-8432bcc774f9 · outbound

This paper cites Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.922554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:9632f76f43dd793ef969a6cd14e99df2d06f8840ff7ff6f7bd9c24a76c0fa675

Observation 0557267d-94f2-42bf-8900-6dedf3e3b4ab · outbound

This paper cites When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.940714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:a4a5a7584e56e1672a7c5679c98816e8a63efaee940d3dbffabc89ddaa8a76b9

Observation 2d5430d1-1a77-47c6-b1ea-3a32dd9c1dc1 · outbound

This paper cites Qwen2.5-Omni Technical Report.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Qwen2.5-Omni Technical Report

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.935145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:ba9ea2e1eb76be68f13a9eb0b1248caf2e339ebfd02b102f61bf2c5f783541c3

Observation 78d114cd-c851-4025-8393-fc58bbcc7d7a · outbound

This paper cites Qwen3-Omni Technical Report.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Qwen3-Omni Technical Report

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.929821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:1a10ec9a00746a7d798dd125d6f74534d7d960873e75cdac892eb007f0836f71

Observation 34d1e018-43e1-48ea-a0a7-07fd4f3b0c90 · outbound

This paper cites Comparing Discrete and Continuous Space LLMs for Speech Recognition.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Comparing Discrete and Continuous Space LLMs for Speech Recognition

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.925129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:03dbc2b8a4afcb684656d401f3df28b2d4efe350b6ea46eafff6f6688c5dcef0

Observation ce16f5cc-2fe7-4e71-9cd8-be813efbbd8a · outbound

This paper cites Connecting Speech Encoder and Large Language Model for ASR.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Connecting Speech Encoder and Large Language Model for ASR

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.953338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:e24b7b5df33e8951896f1d4e80b29fbfbfaf1f92c68eff7f5927cd1b4968e3a7

Pith citing papers

Observation 73d7854d-9053-48c5-b156-189c349dc451 · inbound

Continuous Language Diffusion as a Decoder-Interface Problem cites this paper.

Continuous Language Diffusion as a Decoder-Interface Problem Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-07-02T23:07:27.066481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T18:27:10.422343Z digest=sha256:5faa7b689916bc248a35abb0fc264f2d643808eb54da2b08f498c8a000699094

Observation a0bf6bc0-a788-498d-b7c4-1a2d3b5df3f1 · inbound

Continuous Language Diffusion as a Decoder-Interface Problem cites this paper.

Continuous Language Diffusion as a Decoder-Interface Problem Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

Reference 41

Resolution
metadata mismatch
local_arxiv, observed 2026-06-27T18:31:07.845388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T18:27:10.422343Z digest=sha256:9b0449c342edc232480b8415526322ea9fd5c42a136ae4dd94d2ea6585c7120d