Pith. sign in

Paper Citation Record · LEDGER

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 4 inbound Pith citation observations for arXiv:2508.20869.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.20869 v1

Coverage vector

measured 46 of 46 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T14:49:35.967250Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-02T21:10:10.548489Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T21:17:24.052151Z

Reference resolution

46 of 46 outbound references displayed

  • verified exact3
  • verified fuzzy6
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2b8c50fa-f0f8-417f-a0fc-6962fa20a289 · outbound

This paper cites @esa (Ref.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models @esa (Ref

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.827193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.827193Z digest=sha256:3dea82604f4d88d1ae8aa871609a1adbfa4bfc38dbf6a423e51fe245ad1109fe

Observation f16ef826-5966-4f1c-8ea6-b9be03bdf4df · outbound

This paper cites an unresolved cited work.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.831299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.831299Z digest=sha256:b3987f15630ca5f15f36421bee82f6c7caa6cc65ca4e7c6f724bbbcc72fa856e

Observation a4027b5a-dcce-4b5b-871c-3a83db69eec0 · outbound

This paper cites an unresolved cited work.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-05T14:49:36.441119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.834278Z digest=sha256:515750cae5139eccc20a6007db611632488549e3c48ae784242111e8fb9d2c07

Observation a53be3aa-8ec5-4309-b258-77b552674705 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models wav2vec 2.0: A framework for self-supervised learning of speech representations

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.435029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.837259Z digest=sha256:e90cc518275329b0eb1737369413213fac8ac7e1a40b81f71d2745c30ec1af15

Observation 9ba26393-fdbb-4c70-9dcb-01279cbf245d · outbound

This paper cites Language models are few-shot learners.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Language models are few-shot learners

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.840408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.840408Z digest=sha256:9df40e5597a9eda0335ae236ec67f1585ec7410c8657a261ff569ce29e577678

Observation 45cc14a7-fb7e-4e29-a232-d72a61ef2a0d · outbound

This paper cites SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-08-05T14:49:36.379813Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.843471Z digest=sha256:a07547c5ba9c82ceeba1ac183b71b6c4dd0e7ce04925e7e1befe8bb4ca494f28

Observation 77a92c45-9749-4bec-8106-a5f7d4a62324 · outbound

This paper cites Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.846918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.846918Z digest=sha256:2d4c4f29e259b6d3b26844916ba2d42a569bd3cecb3d69647a293f6d0c71b553

Observation 682c347c-a3de-4380-a712-7fb23f8f29a6 · outbound

This paper cites OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.850120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.850120Z digest=sha256:3c50fdafeabfe1084f9d213a340d34a1cad565e504d26e75fb7d17900e6ee7e2

Observation 900ae064-977c-4d74-a7aa-572e700eb92e · outbound

This paper cites Reproducible scaling laws for contrastive language-image learning.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Reproducible scaling laws for contrastive language-image learning

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.424818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.853152Z digest=sha256:0e00882db6fff1e2644883d84ec449a3e0b15fd385d31fb7e70810b35531b6a7

Observation ec9f8455-9b87-4e8b-b0a1-64b3bed78d71 · outbound

This paper cites SeamlessM4T: Massively Multilingual & Multimodal Machine Translation.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.856563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.856563Z digest=sha256:8f98fc4ba3fd4651a77db795baa75f854e68e8e43dd1bb6a5600ec0a150f95f9

Observation 7d4ac54e-3603-4ae0-abf1-14c3a91fc101 · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.860132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.860132Z digest=sha256:7d9ff0af1a2024d1820c3586b597c291cbe0d81472438634db5be73e50074833

Observation 49de9e24-2ce4-41a7-af47-255dcafe2c67 · outbound

This paper cites Scaling Laws for Multilingual Neural Machine Translation.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Scaling Laws for Multilingual Neural Machine Translation

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-05T14:49:36.351712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.862939Z digest=sha256:3d0273ec2f749e951c58983a7e0a7fd65504aa2121f5c8972737c440fc0653af

Observation d25db10f-bf85-49ba-8cf2-497a4913b655 · outbound

This paper cites Datacomp: In search of the next generation of multimodal datasets.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Datacomp: In search of the next generation of multimodal datasets

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.418245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.865667Z digest=sha256:e48a795ddac34d0b499f82dfe0a462386cc1c0c2bf9af71e067986f379cd4cef

Observation 1f432fba-6a92-4c8f-ba9c-161a51041198 · outbound

This paper cites The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.411406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.868641Z digest=sha256:b3a0f45d0f326a8420cc126fc3c727649ddc9087ca1d420710108c6e5f5c2fde

Observation c4d2256f-1af1-4c47-afca-c6063468fd93 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.871166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.871166Z digest=sha256:91ca332ff680e3757be0afa91eb4c47c2ce8e6882ce542638ec013ec94236a89

Observation df4d36fb-7e8e-4b06-8ba3-4f5ac8b3c22b · outbound

This paper cites The Llama 3 Herd of Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The Llama 3 Herd of Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.873799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.873799Z digest=sha256:1688a8a17d9ca10fc8c266e7c0267f17641e0150c8b3f6a9bb71d20edc2c6ab0

Observation b3ce6c97-49e4-41d6-96eb-d9643dce6b3b · outbound

This paper cites Efficient Multimodal Learning from Data-centric Perspective.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Efficient Multimodal Learning from Data-centric Perspective

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.876386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.876386Z digest=sha256:cd2ea282abfd2d8e7e9f05937edbf03548e2b7d151c6248c7eace8e819511e14

Observation 98a64b3f-70a1-4121-85f3-e749e9c46dc6 · outbound

This paper cites Datacomp-lm: In search of the next generation of training sets for language models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Datacomp-lm: In search of the next generation of training sets for language models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.879751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.879751Z digest=sha256:d321db854c1435e7fcb8733641cbbfa2522a9bab25891c9ab12f5091e297a67a

Observation 15706592-4249-49e8-a104-c2c60afb24af · outbound

This paper cites DataComp-LM: In search of the next generation of training sets for language models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DataComp-LM: In search of the next generation of training sets for language models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.882505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.882505Z digest=sha256:f9c049ea48be3c758df488031250e0b5828077633cc06f1b3c30622c35a96dcd

Observation b3033071-6ef2-4481-a540-b6cb3f3d187b · outbound

This paper cites Rethinking evaluation in asr: Are our models robust enough? In Interspeech 2021, pp.\ 311--315, 2021.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Rethinking evaluation in asr: Are our models robust enough? In Interspeech 2021, pp.\ 311--315, 2021

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.887365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.887365Z digest=sha256:ff97cb9f157770d27ebf563cc5efcd7996f783b1dc384ec86c72e82a3c191e47

Observation 44e52e4f-419e-46c2-b98f-5d8cde48215b · outbound

This paper cites DeepSeek-V3 Technical Report.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DeepSeek-V3 Technical Report

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.890603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.890603Z digest=sha256:0818fda7e049cf8f47c01b5fa49c62f9618e869c4d58ad6cf4b91a1f16558300

Observation 23ba3bb7-ef77-40eb-b1f1-c8529bb137ec · outbound

This paper cites LLM360: Towards Fully Transparent Open-Source LLMs.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models LLM360: Towards Fully Transparent Open-Source LLMs

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.894108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.894108Z digest=sha256:38c3053d9ca42c98a1a4664e3f9828f68016e9c3218a285c855887f8b7558af6

Observation d156c2fd-ff8e-48a2-8f0e-6b0293a3bee1 · outbound

This paper cites 2 OLMo 2 Furious.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models 2 OLMo 2 Furious

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.897657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.897657Z digest=sha256:d3d2bf701779c5d22bd8d8f3d0b6577f9b4f88a0205bc54604c7ca7bff407d1c

Observation c2196ac7-8ad0-4723-acd5-19f6cce95cee · outbound

This paper cites Librispeech: An asr corpus based on public domain audio books.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Librispeech: An asr corpus based on public domain audio books

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.900735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.900735Z digest=sha256:1e311020782329177a63feb193c866031f4940923d361c9a27582f663116fa3e

Observation f43bc6f8-36e9-4053-a450-7fe1f5adf9f3 · outbound

This paper cites The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.904903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.904903Z digest=sha256:e45264252e0720006b8ae6fc3720b9ff24b7538cc0ba06e0ab72a604bc1a0694

Observation db348dcf-507a-424a-8bd9-943dfe95ab13 · outbound

This paper cites The fineweb datasets: Decanting the web for the finest text data at scale.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The fineweb datasets: Decanting the web for the finest text data at scale

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.401363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.907582Z digest=sha256:829673f7250b93031139de250a7b4fafcb7a03e32afb9fc711ce92ee3025783a

Observation 2032668c-45c6-4755-aa53-316aadf83f6e · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.910924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.910924Z digest=sha256:415b055e43bab366845b6aaa651f513cffb3a458e1a1398536aafe6588b614c9

Observation 5b59844e-4f31-4822-b333-b467f11128a9 · outbound

This paper cites Reproducing whisper-style training using an open-source toolkit and publicly available data.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Reproducing whisper-style training using an open-source toolkit and publicly available data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.914257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.914257Z digest=sha256:6b542a6e53aee2fed50a20b8fc238de9b1bdd0309486c5fe7c8136825614603e

Observation 3a539e18-0e44-4631-99f0-f9e9a2daff54 · outbound

This paper cites OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.917170Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.917170Z digest=sha256:e3f1cea4a524a58c60baff9eafbad8d615b6bb8113c04296f8a94262f4c1153f

Observation c1ffe5bb-8b3f-4a31-8075-8def0d103b4d · outbound

This paper cites Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.919841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.919841Z digest=sha256:a9026a67fca702582d4d99cf83da6e4db913a188d210a746d2924a5fac6b741e

Observation 444997b4-757c-49bc-ab06-4ef088401716 · outbound

This paper cites Learning transferable visual models from natural language supervision.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Learning transferable visual models from natural language supervision

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.922387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.922387Z digest=sha256:4db7b33b79021325721f75996a084a0a057c1c1b83bbb9e0dc040beaa0510491

Observation 4b47c52b-4b1e-43b5-bf2c-1a96ec6a7867 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Robust speech recognition via large-scale weak supervision

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.390684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.924817Z digest=sha256:aef4701f062a810d401d1483c6bd47986fee7338665c27f94e110cde6aa1db39

Observation 00330330-7067-41b8-bec8-20d2a45472be · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.927960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.927960Z digest=sha256:e61460853b47270446c0b588ee55af994ba953561c387a4090f07fdd3e0be867

Observation f304045c-cd08-4355-b774-f76ba91bb9b5 · outbound

This paper cites Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.932276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.932276Z digest=sha256:bca6ebcb84159ff32f374915e1fbfb7b9d0451a54a1117552280d9df77b770a1

Observation 606c1c1d-beae-4e9d-9c5f-10930968c799 · outbound

This paper cites Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.938335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.938335Z digest=sha256:dde67fc1e30b5c691b1814443c73fe63296ceb0413b7c26775a28ed1ffaa64a4

Observation f56c8549-05ae-4d8e-9a25-9dde37f1253d · outbound

This paper cites Measuring Robustness to Natural Distribution Shifts in Image Classification.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Measuring Robustness to Natural Distribution Shifts in Image Classification

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.940391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.940391Z digest=sha256:587d5c5287e00486e096bd7df805b180c18ee4970ee3fd9bda5edadd19d5f2f6

Observation 223cd14b-baee-42f1-b604-dbb1fa6504aa · outbound

This paper cites On the effects of heterogeneous data sources on speech-to-text foundation models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models On the effects of heterogeneous data sources on speech-to-text foundation models

Reference 39

Resolution
verified exact
doi, observed 2026-08-05T14:49:35.989918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.942809Z digest=sha256:84b9068751a1154c23d023b2ae7904732f333abf1252446f95143494dc0b0dfd

Observation 2b765152-9b23-41e0-84b7-b63503410427 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models LLaMA: Open and Efficient Foundation Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.945053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.945053Z digest=sha256:ae726a3a54816b7b7f3ddc96f50371ec3fa47035ce807e5d7a3bd9b7aaa26e16

Observation e62ff4b9-ec51-430b-bf83-86240aaabf4c · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.948029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.948029Z digest=sha256:6b83d04b800fbd9fb95d0cb922344e3b7d8b77834732b1b01b3b79c6616f42ea

Observation b87bb6eb-8172-433f-af4f-c0fb32fccca0 · outbound

This paper cites Voxlingua107: A dataset for spoken language recognition.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Voxlingua107: A dataset for spoken language recognition

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.950291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.950291Z digest=sha256:4047d0ad62c74fda6afe4771c69d360b25acf6d1b9f0fdd898cc7e13317880cc

Observation 9bbf3e5f-ac51-4f10-b045-a2f423eafe06 · outbound

This paper cites RedPajama: an Open Dataset for Training Large Language Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models RedPajama: an Open Dataset for Training Large Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.952702Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.952702Z digest=sha256:4d8bfe8887917380bb4fd6ba3c9101a5cf4b421045ed1f60e96da318dd2cfbe4

Observation 500cc621-014d-4ca1-914c-b7e5bd093270 · outbound

This paper cites Organize the Web: Constructing Domains Enhances Pre-Training Data Curation.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Organize the Web: Constructing Domains Enhances Pre-Training Data Curation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.955400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.955400Z digest=sha256:3945e8ffccc10410e079e24182ca2835af1acdd04f5c94dc485d5cd2a1109dd4

Observation aa64a33b-78f2-4518-9c6d-f1ca4c9108fa · outbound

This paper cites DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.959110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.959110Z digest=sha256:ac2dbdb9332b305487e5a2998b8953c23deb5b8057dcc1c664b4fcad9c073044

Observation b806ff3e-2605-4b83-bbff-f5c55da9154e · outbound

This paper cites an unresolved cited work.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.961665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.961665Z digest=sha256:ee75f7a0d4608a571bb00c61551af980ac158121cd974a978549f07633659575

Observation 7c66f95f-54e2-4129-8f2b-fcf6e94d283b · outbound

This paper cites Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.963931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.963931Z digest=sha256:aaa63a2ad1e82ae14c0ee8e683df34257055a2b143072753bfbbe6c065b6b120

Observation a80264bd-ed9d-4d98-a048-9c506230b79f · outbound

This paper cites write newline.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models write newline

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.967250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.967250Z digest=sha256:4988b343ca2bb8c1449e4a5b84af0efcead796aa34411925160a10242e372da9

Pith citing papers

Observation fc227c8f-de6e-4312-a76f-d511be3e2bc3 · inbound

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR cites this paper.

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-11T08:40:59.456272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T16:33:32.012025Z digest=sha256:d15ffe63d16467ee7b3440d99ff633d7fb7eca53f73398fa4bba16f6b836ae60

Observation 1ab59163-2d05-4b37-ae87-60233f5037e2 · inbound

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech cites this paper.

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-21T02:33:55.441620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-21T02:32:26.122526Z digest=sha256:e20d2d84c0824aef569ba83f8fe84bd2f2b18d6d703a3e49cafa71dff36c7251

Observation e0bf5466-55f8-4e85-b4b5-6beb854b3f21 · inbound

DataComp-VLM: Improved Open Datasets for Vision-Language Models cites this paper.

DataComp-VLM: Improved Open Datasets for Vision-Language Models OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 223

Resolution
verified exact
arxiv_id, observed 2026-07-01T15:35:48.916940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-30T01:16:16.834861Z digest=sha256:5c5f125016108f2a7ae28a53cfe3b5257038b46df64802bfe44ec47ad6b9bacc

Observation 43956712-4451-4d17-a601-c845e809003c · inbound

DataComp-VLM: Improved Open Datasets for Vision-Language Models cites this paper.

DataComp-VLM: Improved Open Datasets for Vision-Language Models OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 223

Resolution
verified exact
arxiv_id, observed 2026-07-02T21:17:24.054380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-02T21:10:10.548489Z digest=sha256:7413c6b2471092e367853e967583f0d444106b5b54bb28df3faeb19c9d2a662c