{"as_of":"2026-08-15T20:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67f4d7039dff7c932ea5f35f3133228edb39dd7f30cfee579e533af693bd66c9","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:49:35.967250Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T21:10:10.548489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:17:24.052151Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"cited_work":{"arxiv_id":"2508.20869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20869","snapshot_observed_at":"2026-07-02T21:17:24.052151Z","title":"OLMoASR: Open models and data for training robust speech recognition models","venue":null,"work_id":"42eda713-0158-49c4-be52-d4c8f1e1d332","year":2025},"citing_paper":{"arxiv_id":"2604.09332","last_updated":"2026-04-10T14:00:24Z","snapshot_observed_at":"2026-08-11T18:35:00.578252Z","submitted_at":"2026-04-10T14:00:24Z","title":"Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:33:32.012025Z"},"links":{"cited_paper":"/paper/2508.20869","citing_paper":"/paper/2604.09332"},"observation_digest":"sha256:d15ffe63d16467ee7b3440d99ff633d7fb7eca53f73398fa4bba16f6b836ae60","observation_id":"fc227c8f-de6e-4312-a76f-d511be3e2bc3","resolution":{"observed_at":"2026-05-11T08:40:59.456272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"cited_work":{"arxiv_id":"2508.20869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20869","snapshot_observed_at":"2026-07-02T21:17:24.052151Z","title":"OLMoASR: Open models and data for training robust speech recognition models","venue":null,"work_id":"42eda713-0158-49c4-be52-d4c8f1e1d332","year":2025},"citing_paper":{"arxiv_id":"2605.20830","last_updated":"2026-05-20T07:21:36Z","snapshot_observed_at":"2026-08-14T12:16:23.131331Z","submitted_at":"2026-05-20T07:21:36Z","title":"Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T02:32:26.122526Z"},"links":{"cited_paper":"/paper/2508.20869","citing_paper":"/paper/2605.20830"},"observation_digest":"sha256:e20d2d84c0824aef569ba83f8fe84bd2f2b18d6d703a3e49cafa71dff36c7251","observation_id":"1ab59163-2d05-4b37-ae87-60233f5037e2","resolution":{"observed_at":"2026-05-21T02:33:55.441620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"cited_work":{"arxiv_id":"2508.20869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20869","snapshot_observed_at":"2026-07-02T21:17:24.052151Z","title":"OLMoASR: Open models and data for training robust speech recognition models","venue":null,"work_id":"42eda713-0158-49c4-be52-d4c8f1e1d332","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":223,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2508.20869","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:5c5f125016108f2a7ae28a53cfe3b5257038b46df64802bfe44ec47ad6b9bacc","observation_id":"e0bf5466-55f8-4e85-b4b5-6beb854b3f21","resolution":{"observed_at":"2026-07-01T15:35:48.916940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"cited_work":{"arxiv_id":"2508.20869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20869","snapshot_observed_at":"2026-07-02T21:17:24.052151Z","title":"OLMoASR: Open models and data for training robust speech recognition models","venue":null,"work_id":"42eda713-0158-49c4-be52-d4c8f1e1d332","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":223,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2508.20869","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:7413c6b2471092e367853e967583f0d444106b5b54bb28df3faeb19c9d2a662c","observation_id":"43956712-4451-4d17-a601-c845e809003c","resolution":{"observed_at":"2026-07-02T21:17:24.054380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20869/citation-record","integrity":"/paper/2508.20869/integrity","json":"/paper/2508.20869/citation-record.json","paper":"/paper/2508.20869"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.827193Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.827193Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:3dea82604f4d88d1ae8aa871609a1adbfa4bfc38dbf6a423e51fe245ad1109fe","observation_id":"2b8c50fa-f0f8-417f-a0fc-6962fa20a289","resolution":{"observed_at":"2026-08-05T14:49:35.827193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.831299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.831299Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:b3987f15630ca5f15f36421bee82f6c7caa6cc65ca4e7c6f724bbbcc72fa856e","observation_id":"f16ef826-5966-4f1c-8ea6-b9be03bdf4df","resolution":{"observed_at":"2026-08-05T14:49:35.831299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.439092Z","title":null,"venue":null,"work_id":"7ef5eb8b-5f4c-43ae-a0ec-ea3d46600e93","year":null},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.834278Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:515750cae5139eccc20a6007db611632488549e3c48ae784242111e8fb9d2c07","observation_id":"a4027b5a-dcce-4b5b-871c-3a83db69eec0","resolution":{"observed_at":"2026-08-05T14:49:36.441119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.432715Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"8353bb6d-1dcb-40fc-9dfb-835fb2229ce9","year":2020},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.837259Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:e90cc518275329b0eb1737369413213fac8ac7e1a40b81f71d2745c30ec1af15","observation_id":"a53be3aa-8ec5-4309-b258-77b552674705","resolution":{"observed_at":"2026-08-05T14:49:36.435029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.840408Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.840408Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:9df40e5597a9eda0335ae236ec67f1585ec7410c8657a261ff569ce29e577678","observation_id":"9ba26393-fdbb-4c70-9dcb-01279cbf245d","resolution":{"observed_at":"2026-08-05T14:49:35.840408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-14T06:46:28.505083Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":"2104.02133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-05T14:49:36.377185Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","venue":"cs.CL","work_id":"332ae018-afa8-4ad8-a150-7555ae7c2753","year":2021},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.843471Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:a07547c5ba9c82ceeba1ac183b71b6c4dd0e7ce04925e7e1befe8bb4ca494f28","observation_id":"45cc14a7-fb7e-4e29-a232-d72a61ef2a0d","resolution":{"observed_at":"2026-08-05T14:49:36.379813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.846918Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.846918Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:2d4c4f29e259b6d3b26844916ba2d42a569bd3cecb3d69647a293f6d0c71b553","observation_id":"77a92c45-9749-4bec-8106-a5f7d4a62324","resolution":{"observed_at":"2026-08-05T14:49:35.846918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10373","last_updated":"2025-02-14T18:51:40Z","snapshot_observed_at":"2026-08-14T19:33:12.609183Z","submitted_at":"2025-02-14T18:51:40Z","title":"OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10373","snapshot_observed_at":"2026-08-05T14:49:35.850120Z","title":"Owls: Scaling laws for multilingual speech recognition and translation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.850120Z"},"links":{"cited_paper":"/paper/2502.10373","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:3c50fdafeabfe1084f9d213a340d34a1cad565e504d26e75fb7d17900e6ee7e2","observation_id":"682c347c-a3de-4380-a712-7fb23f8f29a6","resolution":{"observed_at":"2026-08-05T14:49:35.850120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.422592Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"4e7fe4a9-5489-46ab-bf10-bdd3fbdc7df7","year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.853152Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:0e00882db6fff1e2644883d84ec449a3e0b15fd385d31fb7e70810b35531b6a7","observation_id":"900ae064-977c-4d74-a7aa-572e700eb92e","resolution":{"observed_at":"2026-08-05T14:49:36.424818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-14T20:49:45.201003Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-05T14:49:35.856563Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.856563Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:8f98fc4ba3fd4651a77db795baa75f854e68e8e43dd1bb6a5600ec0a150f95f9","observation_id":"ec9f8455-9b87-4e8b-b0a1-64b3bed78d71","resolution":{"observed_at":"2026-08-05T14:49:35.856563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-05T14:49:35.860132Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.860132Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:7d9ff0af1a2024d1820c3586b597c291cbe0d81472438634db5be73e50074833","observation_id":"7d4ac54e-3603-4ae0-abf1-14c3a91fc101","resolution":{"observed_at":"2026-08-05T14:49:35.860132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09650","last_updated":"2023-02-19T18:43:24Z","snapshot_observed_at":"2026-08-13T12:41:54.574228Z","submitted_at":"2023-02-19T18:43:24Z","title":"Scaling Laws for Multilingual Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"2302.09650","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.09650","snapshot_observed_at":"2026-08-05T14:49:36.348957Z","title":"Scaling Laws for Multilingual Neural Machine Translation","venue":"cs.CL","work_id":"8d258ee3-9f9b-4a7f-b34e-19b5eb281def","year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.862939Z"},"links":{"cited_paper":"/paper/2302.09650","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:3d0273ec2f749e951c58983a7e0a7fd65504aa2121f5c8972737c440fc0653af","observation_id":"49de9e24-2ce4-41a7-af47-255dcafe2c67","resolution":{"observed_at":"2026-08-05T14:49:36.351712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.415723Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"cebd1016-4ecb-486b-a77c-15efe6908f96","year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.865667Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:e48a795ddac34d0b499f82dfe0a462386cc1c0c2bf9af71e067986f379cd4cef","observation_id":"d25db10f-bf85-49ba-8cf2-497a4913b655","resolution":{"observed_at":"2026-08-05T14:49:36.418245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.408962Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage","venue":null,"work_id":"feb200e4-70da-4aa5-b583-28ccb303bef7","year":2021},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.868641Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:b3a0f45d0f326a8420cc126fc3c727649ddc9087ca1d420710108c6e5f5c2fde","observation_id":"1f432fba-6a92-4c8f-ba9c-161a51041198","resolution":{"observed_at":"2026-08-05T14:49:36.411406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T14:49:35.871166Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.871166Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:91ca332ff680e3757be0afa91eb4c47c2ce8e6882ce542638ec013ec94236a89","observation_id":"c4d2256f-1af1-4c47-afca-c6063468fd93","resolution":{"observed_at":"2026-08-05T14:49:35.871166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T14:49:35.873799Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.873799Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:1688a8a17d9ca10fc8c266e7c0267f17641e0150c8b3f6a9bb71d20edc2c6ab0","observation_id":"df4d36fb-7e8e-4b06-8ba3-4f5ac8b3c22b","resolution":{"observed_at":"2026-08-05T14:49:35.873799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-14T10:26:56.366247Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T14:49:35.876386Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.876386Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:cd2ea282abfd2d8e7e9f05937edbf03548e2b7d151c6248c7eace8e819511e14","observation_id":"b3ce6c97-49e4-41d6-96eb-d9643dce6b3b","resolution":{"observed_at":"2026-08-05T14:49:35.876386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.879751Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.879751Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:d321db854c1435e7fcb8733641cbbfa2522a9bab25891c9ab12f5091e297a67a","observation_id":"98a64b3f-70a1-4121-85f3-e749e9c46dc6","resolution":{"observed_at":"2026-08-05T14:49:35.879751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-05T14:49:35.882505Z","title":"Dimakis, Yair Carmon, Achal Dave, Ludwig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.882505Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:f9c049ea48be3c758df488031250e0b5828077633cc06f1b3c30622c35a96dcd","observation_id":"15706592-4249-49e8-a104-c2c60afb24af","resolution":{"observed_at":"2026-08-05T14:49:35.882505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.887365Z","title":"Rethinking evaluation in asr: Are our models robust enough? In Interspeech 2021, pp.\\ 311--315, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.887365Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:ff97cb9f157770d27ebf563cc5efcd7996f783b1dc384ec86c72e82a3c191e47","observation_id":"b3033071-6ef2-4481-a540-b6cb3f3d187b","resolution":{"observed_at":"2026-08-05T14:49:35.887365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T14:49:35.890603Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.890603Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:a7fa42edc7fe22d10b0a356a64065885722a3250e39004d0757402114d26ebdd","observation_id":"44e52e4f-419e-46c2-b98f-5d8cde48215b","resolution":{"observed_at":"2026-08-05T14:49:35.890603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06550","last_updated":"2023-12-11T17:39:00Z","snapshot_observed_at":"2026-08-13T05:04:55.673675Z","submitted_at":"2023-12-11T17:39:00Z","title":"LLM360: Towards Fully Transparent Open-Source LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06550","snapshot_observed_at":"2026-08-05T14:49:35.894108Z","title":"Llm360: Towards fully transparent open-source llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.894108Z"},"links":{"cited_paper":"/paper/2312.06550","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:38c3053d9ca42c98a1a4664e3f9828f68016e9c3218a285c855887f8b7558af6","observation_id":"23ba3bb7-ef77-40eb-b1f1-c8529bb137ec","resolution":{"observed_at":"2026-08-05T14:49:35.894108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T14:49:35.897657Z","title":"2 olmo 2 furious","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.897657Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:d3d2bf701779c5d22bd8d8f3d0b6577f9b4f88a0205bc54604c7ca7bff407d1c","observation_id":"d156c2fd-ff8e-48a2-8f0e-6b0293a3bee1","resolution":{"observed_at":"2026-08-05T14:49:35.897657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.900735Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.900735Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:1e311020782329177a63feb193c866031f4940923d361c9a27582f663116fa3e","observation_id":"c2196ac7-8ad0-4723-acd5-19f6cce95cee","resolution":{"observed_at":"2026-08-05T14:49:35.900735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-05T14:49:35.904903Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.904903Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:e45264252e0720006b8ae6fc3720b9ff24b7538cc0ba06e0ab72a604bc1a0694","observation_id":"f43bc6f8-36e9-4053-a450-7fe1f5adf9f3","resolution":{"observed_at":"2026-08-05T14:49:35.904903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.399007Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"84f71e40-72a9-447b-8113-fbd2bc2df323","year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.907582Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:829673f7250b93031139de250a7b4fafcb7a03e32afb9fc711ce92ee3025783a","observation_id":"db348dcf-507a-424a-8bd9-943dfe95ab13","resolution":{"observed_at":"2026-08-05T14:49:36.401363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T14:49:35.910924Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.910924Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:415b055e43bab366845b6aaa651f513cffb3a458e1a1398536aafe6588b614c9","observation_id":"2032668c-45c6-4755-aa53-316aadf83f6e","resolution":{"observed_at":"2026-08-05T14:49:35.910924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.914257Z","title":"Reproducing whisper-style training using an open-source toolkit and publicly available data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.914257Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:6b542a6e53aee2fed50a20b8fc238de9b1bdd0309486c5fe7c8136825614603e","observation_id":"5b59844e-4f31-4822-b333-b467f11128a9","resolution":{"observed_at":"2026-08-05T14:49:35.914257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12654","last_updated":"2024-08-27T02:22:00Z","snapshot_observed_at":"2026-08-13T04:14:53.735819Z","submitted_at":"2024-02-20T02:04:38Z","title":"OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12654","snapshot_observed_at":"2026-08-05T14:49:35.917170Z","title":"Owsm-ctc: An open encoder-only speech foundation model for speech recognition, translation, and language identification, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.917170Z"},"links":{"cited_paper":"/paper/2402.12654","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:e3f1cea4a524a58c60baff9eafbad8d615b6bb8113c04296f8a94262f4c1153f","observation_id":"3a539e18-0e44-4631-99f0-f9e9a2daff54","resolution":{"observed_at":"2026-08-05T14:49:35.917170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.919841Z","title":"Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.919841Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:a9026a67fca702582d4d99cf83da6e4db913a188d210a746d2924a5fac6b741e","observation_id":"c1ffe5bb-8b3f-4a31-8075-8def0d103b4d","resolution":{"observed_at":"2026-08-05T14:49:35.919841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.922387Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.922387Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:4db7b33b79021325721f75996a084a0a057c1c1b83bbb9e0dc040beaa0510491","observation_id":"444997b4-757c-49bc-ab06-4ef088401716","resolution":{"observed_at":"2026-08-05T14:49:35.922387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:36.388165Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"a41e7c61-a901-44fb-aa65-c215f1319c99","year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.924817Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:aef4701f062a810d401d1483c6bd47986fee7338665c27f94e110cde6aa1db39","observation_id":"4b47c52b-4b1e-43b5-bf2c-1a96ec6a7867","resolution":{"observed_at":"2026-08-05T14:49:36.390684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-08-14T16:16:21.567225Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T14:49:35.927960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.927960Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:e61460853b47270446c0b588ee55af994ba953561c387a4090f07fdd3e0be867","observation_id":"00330330-7067-41b8-bec8-20d2a45472be","resolution":{"observed_at":"2026-08-05T14:49:35.927960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-13T04:29:45.563095Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-05T14:49:35.932276Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.932276Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:bca6ebcb84159ff32f374915e1fbfb7b9d0451a54a1117552280d9df77b770a1","observation_id":"f304045c-cd08-4355-b774-f76ba91bb9b5","resolution":{"observed_at":"2026-08-05T14:49:35.932276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-11T23:14:36.681577Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-05T14:49:35.938335Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.938335Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:dde67fc1e30b5c691b1814443c73fe63296ceb0413b7c26775a28ed1ffaa64a4","observation_id":"606c1c1d-beae-4e9d-9c5f-10930968c799","resolution":{"observed_at":"2026-08-05T14:49:35.938335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00644","last_updated":"2020-09-14T09:55:13Z","snapshot_observed_at":"2026-08-13T09:32:00.308636Z","submitted_at":"2020-07-01T17:53:26Z","title":"Measuring Robustness to Natural Distribution Shifts in Image Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00644","snapshot_observed_at":"2026-08-05T14:49:35.940391Z","title":"Measuring robustness to natural distribution shifts in image classification, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.940391Z"},"links":{"cited_paper":"/paper/2007.00644","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:587d5c5287e00486e096bd7df805b180c18ee4970ee3fd9bda5edadd19d5f2f6","observation_id":"f56c8549-05ae-4d8e-9a25-9dde37f1253d","resolution":{"observed_at":"2026-08-05T14:49:35.940391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1938","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"On the effects of heterogeneous data sources on speech-to-text foundation models","venue":null,"work_id":"fc86d239-6611-4190-ad63-903d75e458f9","year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.942809Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:84b9068751a1154c23d023b2ae7904732f333abf1252446f95143494dc0b0dfd","observation_id":"223cd14b-baee-42f1-b604-dbb1fa6504aa","resolution":{"observed_at":"2026-08-05T14:49:35.989918Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T14:49:35.945053Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.945053Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:ae726a3a54816b7b7f3ddc96f50371ec3fa47035ce807e5d7a3bd9b7aaa26e16","observation_id":"2b765152-9b23-41e0-84b7-b63503410427","resolution":{"observed_at":"2026-08-05T14:49:35.945053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T14:49:35.948029Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.948029Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:6b83d04b800fbd9fb95d0cb922344e3b7d8b77834732b1b01b3b79c6616f42ea","observation_id":"e62ff4b9-ec51-430b-bf83-86240aaabf4c","resolution":{"observed_at":"2026-08-05T14:49:35.948029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.950291Z","title":"Voxlingua107: A dataset for spoken language recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.950291Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:4047d0ad62c74fda6afe4771c69d360b25acf6d1b9f0fdd898cc7e13317880cc","observation_id":"b87bb6eb-8172-433f-af4f-c0fb32fccca0","resolution":{"observed_at":"2026-08-05T14:49:35.950291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-14T07:55:53.745138Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T14:49:35.952702Z","title":"Redpajama: an open dataset for training large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.952702Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:4d8bfe8887917380bb4fd6ba3c9101a5cf4b421045ed1f60e96da318dd2cfbe4","observation_id":"9bbf3e5f-ac51-4f10-b045-a2f423eafe06","resolution":{"observed_at":"2026-08-05T14:49:35.952702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-14T15:17:42.222016Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T14:49:35.955400Z","title":"Organize the web: Constructing domains enhances pre-training data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.955400Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:3945e8ffccc10410e079e24182ca2835af1acdd04f5c94dc485d5cd2a1109dd4","observation_id":"500cc621-014d-4ca1-914c-b7e5bd093270","resolution":{"observed_at":"2026-08-05T14:49:35.955400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-05T14:49:35.959110Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.959110Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:ac2dbdb9332b305487e5a2998b8953c23deb5b8057dcc1c664b4fcad9c073044","observation_id":"aa64a33b-78f2-4518-9c6d-f1ca4c9108fa","resolution":{"observed_at":"2026-08-05T14:49:35.959110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.961665Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.961665Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:ee75f7a0d4608a571bb00c61551af980ac158121cd974a978549f07633659575","observation_id":"b806ff3e-2605-4b83-bbff-f5c55da9154e","resolution":{"observed_at":"2026-08-05T14:49:35.961665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-13T12:33:46.085209Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-05T14:49:35.963931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.963931Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:aaa63a2ad1e82ae14c0ee8e683df34257055a2b143072753bfbbe6c065b6b120","observation_id":"7c66f95f-54e2-4129-8f2b-fcf6e94d283b","resolution":{"observed_at":"2026-08-05T14:49:35.963931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:49:35.967250Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.967250Z"},"links":{"citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:4988b343ca2bb8c1449e4a5b84af0efcead796aa34411925160a10242e372da9","observation_id":"a80264bd-ed9d-4d98-a048-9c506230b79f","resolution":{"observed_at":"2026-08-05T14:49:35.967250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T07:56:27.881955Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":6},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 4 inbound Pith citation observations for arXiv:2508.20869."}