Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-05T14:49:35.967250Z
Paper Citation Record · LEDGER
As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 4 inbound Pith citation observations for arXiv:2508.20869.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-05T14:49:35.967250Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-07-02T21:10:10.548489Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-02T21:17:24.052151Z
46 of 46 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 2b8c50fa-f0f8-417f-a0fc-6962fa20a289 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models @esa (Ref
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f16ef826-5966-4f1c-8ea6-b9be03bdf4df · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a4027b5a-dcce-4b5b-871c-3a83db69eec0 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation a53be3aa-8ec5-4309-b258-77b552674705 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models wav2vec 2.0: A framework for self-supervised learning of speech representations
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 9ba26393-fdbb-4c70-9dcb-01279cbf245d · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Language models are few-shot learners
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 45cc14a7-fb7e-4e29-a232-d72a61ef2a0d · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 77a92c45-9749-4bec-8106-a5f7d4a62324 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 682c347c-a3de-4380-a712-7fb23f8f29a6 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 900ae064-977c-4d74-a7aa-572e700eb92e · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Reproducible scaling laws for contrastive language-image learning
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation ec9f8455-9b87-4e8b-b0a1-64b3bed78d71 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models SeamlessM4T: Massively Multilingual & Multimodal Machine Translation
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7d4ac54e-3603-4ae0-abf1-14c3a91fc101 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49de9e24-2ce4-41a7-af47-255dcafe2c67 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Scaling Laws for Multilingual Neural Machine Translation
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation d25db10f-bf85-49ba-8cf2-497a4913b655 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Datacomp: In search of the next generation of multimodal datasets
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 1f432fba-6a92-4c8f-ba9c-161a51041198 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation c4d2256f-1af1-4c47-afca-c6063468fd93 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The Pile: An 800GB Dataset of Diverse Text for Language Modeling
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation df4d36fb-7e8e-4b06-8ba3-4f5ac8b3c22b · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The Llama 3 Herd of Models
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b3ce6c97-49e4-41d6-96eb-d9643dce6b3b · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Efficient Multimodal Learning from Data-centric Perspective
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 98a64b3f-70a1-4121-85f3-e749e9c46dc6 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Datacomp-lm: In search of the next generation of training sets for language models
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 15706592-4249-49e8-a104-c2c60afb24af · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DataComp-LM: In search of the next generation of training sets for language models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b3033071-6ef2-4481-a540-b6cb3f3d187b · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Rethinking evaluation in asr: Are our models robust enough? In Interspeech 2021, pp.\ 311--315, 2021
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 44e52e4f-419e-46c2-b98f-5d8cde48215b · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DeepSeek-V3 Technical Report
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 23ba3bb7-ef77-40eb-b1f1-c8529bb137ec · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models LLM360: Towards Fully Transparent Open-Source LLMs
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d156c2fd-ff8e-48a2-8f0e-6b0293a3bee1 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models 2 OLMo 2 Furious
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c2196ac7-8ad0-4723-acd5-19f6cce95cee · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Librispeech: An asr corpus based on public domain audio books
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f43bc6f8-36e9-4053-a450-7fe1f5adf9f3 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation db348dcf-507a-424a-8bd9-943dfe95ab13 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The fineweb datasets: Decanting the web for the finest text data at scale
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 2032668c-45c6-4755-aa53-316aadf83f6e · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5b59844e-4f31-4822-b333-b467f11128a9 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Reproducing whisper-style training using an open-source toolkit and publicly available data
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3a539e18-0e44-4631-99f0-f9e9a2daff54 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1ffe5bb-8b3f-4a31-8075-8def0d103b4d · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 444997b4-757c-49bc-ab06-4ef088401716 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Learning transferable visual models from natural language supervision
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4b47c52b-4b1e-43b5-bf2c-1a96ec6a7867 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Robust speech recognition via large-scale weak supervision
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 00330330-7067-41b8-bec8-20d2a45472be · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f304045c-cd08-4355-b774-f76ba91bb9b5 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 606c1c1d-beae-4e9d-9c5f-10930968c799 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f56c8549-05ae-4d8e-9a25-9dde37f1253d · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Measuring Robustness to Natural Distribution Shifts in Image Classification
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 223cd14b-baee-42f1-b604-dbb1fa6504aa · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models On the effects of heterogeneous data sources on speech-to-text foundation models
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 2b765152-9b23-41e0-84b7-b63503410427 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models LLaMA: Open and Efficient Foundation Language Models
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e62ff4b9-ec51-430b-bf83-86240aaabf4c · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Llama 2: Open Foundation and Fine-Tuned Chat Models
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b87bb6eb-8172-433f-af4f-c0fb32fccca0 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Voxlingua107: A dataset for spoken language recognition
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9bbf3e5f-ac51-4f10-b045-a2f423eafe06 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models RedPajama: an Open Dataset for Training Large Language Models
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 500cc621-014d-4ca1-914c-b7e5bd093270 · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation aa64a33b-78f2-4518-9c6d-f1ca4c9108fa · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b806ff3e-2605-4b83-bbff-f5c55da9154e · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7c66f95f-54e2-4129-8f2b-fcf6e94d283b · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a80264bd-ed9d-4d98-a048-9c506230b79f · outbound
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models write newline
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fc227c8f-de6e-4312-a76f-d511be3e2bc3 · inbound
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 1ab59163-2d05-4b37-ae87-60233f5037e2 · inbound
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation e0bf5466-55f8-4e85-b4b5-6beb854b3f21 · inbound
DataComp-VLM: Improved Open Datasets for Vision-Language Models OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
Reference 223
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 43956712-4451-4d17-a601-c845e809003c · inbound
DataComp-VLM: Improved Open Datasets for Vision-Language Models OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
Reference 223
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.