{"as_of":"2026-08-08T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb76b83a6e4e6ecccac70f5e366128d569c21098252f1a46ed9fa014f9ab5d8","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:21.174309Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:17.177212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:12:21.729943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"cited_work":{"arxiv_id":"2506.00338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00338","snapshot_observed_at":"2026-08-07T12:12:21.729943Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","venue":"cs.CL","work_id":"7b458030-ade0-40b8-8281-23179f76db02","year":2025},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.177212Z"},"links":{"cited_paper":"/paper/2506.00338","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:fbfa1fcf9af3df16d3e7d694827df3cf02069e84a200591af958514af1b4365f","observation_id":"da98eed8-8609-4fd1-87f4-9a9d2c0507e2","resolution":{"observed_at":"2026-08-07T12:12:21.828937Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00338/citation-record","integrity":"/paper/2506.00338/integrity","json":"/paper/2506.00338/citation-record.json","paper":"/paper/2506.00338"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"cited_work":{"arxiv_id":"2506.00338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00338","snapshot_observed_at":"2026-08-07T12:12:21.729943Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","venue":"cs.CL","work_id":"7b458030-ade0-40b8-8281-23179f76db02","year":2025},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.177212Z"},"links":{"cited_paper":"/paper/2506.00338","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:fbfa1fcf9af3df16d3e7d694827df3cf02069e84a200591af958514af1b4365f","observation_id":"da98eed8-8609-4fd1-87f4-9a9d2c0507e2","resolution":{"observed_at":"2026-08-07T12:12:21.828937Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:27.419851Z","title":"YODAS data cleaning The raw YODAS data has not undergone a rigorous cleaning process and may contain annotation errors [24]","venue":null,"work_id":"9296684e-9d9b-455f-9d0a-b5b51238cc44","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.271724Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:d9e672330e9441cccb6a9ab2fe93eb325cf20efa13281e8f7ee11983351c84c5","observation_id":"8fecf34e-4ab5-4486-8dbe-b28d4b53b12e","resolution":{"observed_at":"2026-08-07T12:12:27.493239Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3007.8815","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:21.540818Z","title":"transcription","venue":null,"work_id":"6f971db9-df7f-4a39-a9ec-c6c7fa965c5d","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.393419Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:40da33b0a001a55734dca60e425a886c8d77f29f46368b0fde14f16ed3db1b61","observation_id":"62ffcb80-8de8-42e8-be83-0757cdfc274f","resolution":{"observed_at":"2026-08-07T12:12:21.617665Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:27.236662Z","title":"We reveal that large-scale web-crawled data contains incorrect lan- guage labels and audio-text misalignments","venue":null,"work_id":"adc7493f-b6fd-46cd-915e-c683b777e199","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.504498Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:9acb1981002c8b33922ed45beb72c9a3148bfe9647e2a3260c5848af0a2b72e4","observation_id":"e9ce723c-d9be-4b7c-b87b-6e61c7bcaf36","resolution":{"observed_at":"2026-08-07T12:12:27.321548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:27.044058Z","title":null,"venue":null,"work_id":"5e846176-175e-43d9-be83-f9ccbb421752","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.586769Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:5e370e7cfb6dcd4c80a2585ac6bf0cbee49f0c73b8fcdfe601d6fe342f793cd9","observation_id":"fc45377e-b74f-4575-826c-4b2c2bab28f7","resolution":{"observed_at":"2026-08-07T12:12:27.141555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.868374Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"353c3489-99f5-47db-b352-bc1069161908","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.675610Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:d7f23decdecbf56a05fcfc24a4346267d1849648d746483b4dca5990deb6a52d","observation_id":"f81a6e80-6bf0-4300-ad75-9e2560fae4d9","resolution":{"observed_at":"2026-08-07T12:12:26.954012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T12:12:17.790407Z","title":"Google USM: Scal- ing automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.790407Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:ef59a67abe5e2adb1dc9256e71b40ac25bb325c2379d5484350fa0228538259d","observation_id":"a49829e8-8114-4c2a-b598-09edd3f5f677","resolution":{"observed_at":"2026-08-07T12:12:17.790407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.716105Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"77027966-5e36-4a41-b319-e1875a074fd6","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.904554Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:d54aad250523ee8c75b7c4c0012ecfaf45c29c05cd7033b39a57ec3b5c79ca79","observation_id":"1c293df4-4f20-4953-b75d-8f948b50f06e","resolution":{"observed_at":"2026-08-07T12:12:26.785010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.562387Z","title":"Less is more: Accurate speech recognition & translation without web- scale data,","venue":null,"work_id":"93d54711-c3fe-4456-980c-b5156fb04197","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.996141Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:5aabd489288e3a1e0717c54fa7187eb95aac082ea1630498b6906170c5647a75","observation_id":"cfbe3c66-a058-4b60-9191-a84e9b7324c4","resolution":{"observed_at":"2026-08-07T12:12:26.633111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.443586Z","title":"Reproducing Whisper-Style Training Using an Open-Source Toolkit and Pub- licly Available Data,","venue":null,"work_id":"174592bf-5e7a-458b-a83e-0fd6e16962fe","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.091981Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:adf07c4abf8d3efb6dcbfa72f411e527ce6fde655230f1358fd32964604b43f2","observation_id":"538be67f-567f-4d89-9806-f9d4c5892108","resolution":{"observed_at":"2026-08-07T12:12:26.501683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.319533Z","title":"ESPnet: End- to-End Speech Processing Toolkit,","venue":null,"work_id":"75fbf752-1a2e-4524-97cf-aaa4d67f097f","year":2018},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.171426Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:81e7870bc2ad4c4d1c3d5cac6a4cce178aaabe291d3fdaec175945d0b3c760dc","observation_id":"cef51312-f6bb-4e3d-9d3e-b61f35ee3ab5","resolution":{"observed_at":"2026-08-07T12:12:26.377366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.123938Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":"d45cb21e-0e65-4db8-82f8-ed6905535244","year":2020},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.265022Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:e985ba5f2af6400da3dc4a3994756950b832c5941ada3d716f67e196eeaff233","observation_id":"42b5f007-b1a7-4cbb-b9b5-7db73be9266f","resolution":{"observed_at":"2026-08-07T12:12:26.201127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.871781Z","title":"Branchformer: Parallel MLP-attention architectures to capture local and global context for speech recognition and understanding,","venue":null,"work_id":"d3085f5b-8e17-4146-88dc-1f54f3dc294a","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.358460Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:d0e0573ff8dfbc77f26c51dd540f0a5a450b63cbc6302b8347226784da8c781f","observation_id":"efcccd6c-06d7-4d53-b4eb-9218918c66d4","resolution":{"observed_at":"2026-08-07T12:12:25.994805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.675673Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":"d6f96e2b-1844-43d2-b385-12a8f4f4ba65","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.435408Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:d612bf47b62e053b16f05d661b21d1ba5cd43351d72494d1138d8676f9ac04d1","observation_id":"d8abf4c3-f8bf-4c5c-b159-f1501bae89d4","resolution":{"observed_at":"2026-08-07T12:12:25.745680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.545242Z","title":"Atten- tion is all you need,","venue":null,"work_id":"9a87aef9-6257-4460-9d3b-12f00022a6c9","year":2017},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.504149Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:9c1924a9c058c1d18d352936a52ddd9b0c151be6e08c133befa743c5d7e4dcff","observation_id":"cb75094c-5bfc-457f-8ba9-344d1fe37679","resolution":{"observed_at":"2026-08-07T12:12:25.603809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.383118Z","title":"Squeezeformer: An efficient transformer for automatic speech recognition,","venue":null,"work_id":"70be834b-7165-4248-9f2e-c403b53c024f","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.599148Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:691a605a4db254d8d8c3547f0eb929e73efb03a30a0397285c58466bf9720200","observation_id":"9d6c92d4-8967-4486-bcf5-337b9e8732a6","resolution":{"observed_at":"2026-08-07T12:12:25.467750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.253080Z","title":"Fast conformer with linearly scalable attention for efficient speech recognition,","venue":null,"work_id":"e9a08cfb-7f75-43ca-81d5-2fda43737b7b","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.726297Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:777004d5c165279664afed2407b9c19bb71a65ca521793ac721fdb5821daafaf","observation_id":"fc6f5a37-a3b3-41f0-8d97-7f35e083183d","resolution":{"observed_at":"2026-08-07T12:12:25.321074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.116533Z","title":"Sum- maryMixing: A linear-complexity alternative to self-attention for speech recognition and understanding,","venue":null,"work_id":"2e56144c-684d-4c90-8faa-aada420070a4","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.814410Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:697284307e6cc5d374bf72650837a48351478c21fdb39a12dcc4a13eacdbbf95","observation_id":"86c09436-cba7-4031-b368-fd2da1233b7f","resolution":{"observed_at":"2026-08-07T12:12:25.178642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.979449Z","title":"OWSM v3.1: Bet- ter and faster open whisper-style speech models based on E- Branchformer,","venue":null,"work_id":"6ae26c38-4026-4f4b-a056-cb72da8ac532","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.852042Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:2ec0276461d0237e7ec67ea2a2ecb3d2e149491f49f39f700949b2fe5634fa8c","observation_id":"21568b9a-d2a0-425e-819e-d272968b80f9","resolution":{"observed_at":"2026-08-07T12:12:25.047851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.838437Z","title":"E-Branchformer: Branch- former with enhanced merging for speech recognition,","venue":null,"work_id":"2ed325a0-a720-478a-a6a8-12c191623b89","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.855538Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:689a6cb15bde2fd97102940baa32aa8a008c2bf9eaa47ffb74aac0f206d3461b","observation_id":"837310f8-d203-4448-84fb-80b4cf0d328f","resolution":{"observed_at":"2026-08-07T12:12:24.905555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.710657Z","title":"A Comparative Study on E-Branchformer vs Conformer in Speech Recognition, Transla- tion, and Understanding Tasks,","venue":null,"work_id":"d3de523a-8af2-45a9-83de-f216161210b6","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.888232Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:79b79bb9ecc95c30375e0e21b0353ea8b50966749ab26c3dc4d2b74325b75060","observation_id":"bfcef2ea-205f-4f2c-abe1-7026a12b9920","resolution":{"observed_at":"2026-08-07T12:12:24.764470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.604100Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recognition, translation, and language identification,","venue":null,"work_id":"5c641495-b27f-4521-9c47-d1e6db46a006","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.949572Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:494ab3001cbead3b0435ef0024b8d4cb3a70bed55dd277759487b760fa101299","observation_id":"8ca5f411-4012-44a5-9995-68ca9fbad818","resolution":{"observed_at":"2026-08-07T12:12:24.649967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.482974Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"d4fe1f1e-edbb-4765-b310-503e55d9e8ff","year":2006},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.036480Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:7c6361bdcb311b46534398363367f001b84c75d822575e74fa19bb7b20148d1a","observation_id":"56d343c9-0199-4c6e-9ab5-09ac9178e1b8","resolution":{"observed_at":"2026-08-07T12:12:24.544340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.370976Z","title":"Unsupervised data selection via discrete speech representation for ASR,","venue":null,"work_id":"c8563f86-4f45-4b25-b468-099a25ead307","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.139139Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:fd20304465e9c5e5f0ceabce91a830f2a95fe5650ec2b4af072dec418a879ae9","observation_id":"ea1b3402-bfe7-4ff4-b7a7-7812ed9f1bed","resolution":{"observed_at":"2026-08-07T12:12:24.424537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.225409Z","title":"Unsupervised data selec- tion for speech recognition with contrastive loss ratios,","venue":null,"work_id":"81f616af-cc33-460b-b034-19157d6b0459","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.209648Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:fff11e735ee59d1b8de445774fcda47c753419bea864c99ce2bd7644d3083fb9","observation_id":"d971e49d-8a2c-4745-bc46-4fcaf0b7582d","resolution":{"observed_at":"2026-08-07T12:12:24.308824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.076618Z","title":"Spgispeech: 5, 000 hours of transcribed financial audio for fully formatted end-to-end speech recognition,","venue":null,"work_id":"60f43e76-07e1-46ae-9c39-0eea54cdaba5","year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.301270Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:3b49b2d4198a3be03cf4160408c366fff94f0df4360fc779f1ea0d02f5507d12","observation_id":"272d04d1-4869-4c60-b6c8-f692c1539935","resolution":{"observed_at":"2026-08-07T12:12:24.147242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.892233Z","title":"Gigaspeech: An evolv- ing, multi-domain ASR corpus with 10, 000 hours of transcribed audio,","venue":null,"work_id":"1f9309a7-c7b0-4756-ac68-1222277c6c74","year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.428013Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:7a157dadfa574c3e9d75218d07af0e2d6d605d94641bf340a7e0b8c7094a8f0e","observation_id":"2c835fcb-4178-443b-bed0-c9e0bb01c651","resolution":{"observed_at":"2026-08-07T12:12:23.980936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T12:12:19.512688Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.512688Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:051925a6d6ef5f3458fb53f94c300af718f121ac07b2d801465c22624621a628","observation_id":"9ec2465d-b686-4696-a457-74c0a22ec0aa","resolution":{"observed_at":"2026-08-07T12:12:19.512688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.705446Z","title":"YODAS: Youtube-Oriented Dataset for Audio and Speech,","venue":null,"work_id":"18f71df7-4dfa-45ca-a93b-627a273f3c94","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.597084Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:385c3792692ef1a0a61baa8bd4afa1d452f50d19b3f6d86aa0d4ce51ecc36eb4","observation_id":"475da79a-c3f1-4fcf-b4df-06d6e81bd146","resolution":{"observed_at":"2026-08-07T12:12:23.795234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.535179Z","title":"On the effects of het- erogeneous data sources on speech-to-text foundation models,","venue":null,"work_id":"6d696cce-be99-4b8a-871b-e92b7f53a0a4","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.703596Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:52c9aa3479a564088c07291a14df2cd54983fb4b08d004dda0c59131cf237a3d","observation_id":"13297370-5350-435d-8613-107046f5c0d7","resolution":{"observed_at":"2026-08-07T12:12:23.611777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-06T00:21:09.785804Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-07T12:12:19.793022Z","title":"Speechstew: Simply mix all available speech recognition data to train one large neural network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.793022Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:66c9ed5d4b0d8b99c0b67415ccb07074b3c739806214253b53f5de4b8a4e5d76","observation_id":"77bf07e5-9d02-4ed0-a257-5038fcbd6f38","resolution":{"observed_at":"2026-08-07T12:12:19.793022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.395194Z","title":"MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research,","venue":null,"work_id":"4c286215-89a1-4c2f-af32-cdf8e0d0b8da","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.884354Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:5c7f72e644477a04cb94b40d6258400537e3751d6982955653d1776ddcdff808","observation_id":"4575edf5-26aa-40ee-8c78-c593b0634b56","resolution":{"observed_at":"2026-08-07T12:12:23.463609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.192230Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and context,","venue":null,"work_id":"a0dfa879-6b11-4b4b-84e1-ad9a7af07625","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.960379Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:2c963fca268a0c5ff094f30d20048f637479f9bd0df5001ba130180b16b0d537","observation_id":"c8bfbcdb-e401-4f64-8bbb-f01fba88ba5a","resolution":{"observed_at":"2026-08-07T12:12:23.270870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11546","last_updated":"2025-05-27T04:49:35Z","snapshot_observed_at":"2026-08-04T06:10:50.996064Z","submitted_at":"2024-06-17T13:44:20Z","title":"GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11546","snapshot_observed_at":"2026-08-07T12:12:20.068090Z","title":"Gigaspeech 2: An evolving, large-scale and multi-domain asr corpus for low- resource languages with automated crawling, transcription and refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.068090Z"},"links":{"cited_paper":"/paper/2406.11546","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:cd519b4d9f750a08fb22f3f2d604587ad8a2d122a0a1c6e3e1cfb679e924362d","observation_id":"405fdaac-7213-4d65-b898-1e5404abd152","resolution":{"observed_at":"2026-08-07T12:12:20.068090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.029733Z","title":"MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Founda- tion Model Training on EU Languages,","venue":null,"work_id":"df9d9ae2-3cca-4955-a1bb-40a412fcd5f6","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.156850Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:cdbc6e67bea6f35a3cb89ad0bf482e14d98728bd925efa304b79b550e0a9a38a","observation_id":"b61a362a-029f-4875-a106-8c302d761e8b","resolution":{"observed_at":"2026-08-07T12:12:23.100262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.868148Z","title":"CTC-Segmentation of Large Corpora for German End-to-End Speech Recognition,","venue":null,"work_id":"4255983c-a6de-456b-862e-f40c5b99ea1a","year":2020},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.255300Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:e0152c0c041eb1785a1fc8ee13933faf81c6970cb8cf7504731fa38b3f1fe9fa","observation_id":"037e1b2f-f68f-4680-9328-3b76ff9c7ab4","resolution":{"observed_at":"2026-08-07T12:12:22.956806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-07-06T05:02:39.487370Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-07T12:12:20.365163Z","title":"Bag of tricks for efficient text classification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.365163Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:1ccf34d10ec61ff63c396d1c8f55c3248dc041ad34b657f225cebda34eded43a","observation_id":"ff89a244-e405-41d6-a38f-b4a7e9909921","resolution":{"observed_at":"2026-08-07T12:12:20.365163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-07T12:12:20.479161Z","title":"Fast- text.zip: Compressing text classification models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.479161Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:9e7eaadc448e161c027d4c1e2fb00c074dfc969d51eee5dd18860ca182162bc5","observation_id":"2207002f-9773-4956-b514-6e8c6148b10c","resolution":{"observed_at":"2026-08-07T12:12:20.479161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-07T12:12:20.555853Z","title":"Ravanelli, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.555853Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:068dcb3ccac4d23306fabf2e2079c5fe2388603d77ba2bd91ac21952014c35b1","observation_id":"a1278efc-5e62-4b40-95e9-1fc712b23bd1","resolution":{"observed_at":"2026-08-07T12:12:20.555853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T12:12:20.661052Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.661052Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:0e12d09b3c00289d04d574d63bfe0eabec7bb50c9059d699bca6e82fc8ec7f49","observation_id":"39e7fa83-9333-474a-b8a6-85f1307ad3fb","resolution":{"observed_at":"2026-08-07T12:12:20.661052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.724395Z","title":"Pytorch: An imperative style, high- performance deep learning library,","venue":null,"work_id":"e4b3bf5f-f497-4b1b-a8ff-1a51ef397cfb","year":2019},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.741492Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:aefeb30c72e12d0b8037c17cc0deeade0260ea318eb4c11efdd6bdd9dc643c8e","observation_id":"2b5be670-959e-4d36-82bc-9f0fba6c716b","resolution":{"observed_at":"2026-08-07T12:12:22.792853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.574007Z","title":"FlashAttention-2: Faster Attention with Better Paral- lelism and Work Partitioning,","venue":null,"work_id":"32931a58-90ed-4685-8351-3bea04c01981","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.824229Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:1a450eec612e0734f9730ce0cd6cc875b8aaf3ea13dddc9058a7d277ceea48ca","observation_id":"8e7d6a8a-75ae-48f8-ab33-a35fe2579cab","resolution":{"observed_at":"2026-08-07T12:12:22.648375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.387762Z","title":"Decoupled weight decay regular- ization,","venue":null,"work_id":"fdfcce79-7061-4da1-a206-836f590a6756","year":2019},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.908318Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:975dc467fa184e1dfecc769aaa5809036263b18aef21d7ac9e250b0f16d9fbeb","observation_id":"59c95f76-2645-43e3-8463-5e7bbf4706eb","resolution":{"observed_at":"2026-08-07T12:12:22.469508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.225692Z","title":"CoV oST 2 and Massively Multilingual Speech Translation,","venue":null,"work_id":"a8875d03-2598-4270-baff-a74d432aeae0","year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.008812Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:e5e8884a2a8d0552f5f4ec0c3481e13b2c2a27334107213789e05ce8a732bf72","observation_id":"9ab61f24-357c-4dfc-915a-db9a72d7dfc7","resolution":{"observed_at":"2026-08-07T12:12:22.314269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.067868Z","title":"FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,","venue":null,"work_id":"70b2c522-df4f-4023-b3ad-2c9d0d07543a","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.049823Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:fac6bad51da0415e9f401aa31c8540284fdff56156b5397a3310c74f49904b39","observation_id":"820967f7-1ead-4b55-b5d4-46b2b45fe252","resolution":{"observed_at":"2026-08-07T12:12:22.131499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T12:12:21.094758Z","title":"MLS: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.094758Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:83251851946bbd38d38e5834ad453efadba9238354e18136bdab6ced8d11d9f2","observation_id":"d196b4a7-095d-443c-b774-7b1f45f97f0c","resolution":{"observed_at":"2026-08-07T12:12:21.094758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:21.901637Z","title":"Srivastav, S","venue":null,"work_id":"85bdc1e5-1649-49e9-9303-20653676d8c1","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.174309Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:b73b9a380714638faf06d2f89b613d4ff6c0ddea21eafdd7691a74a0c9b598fa","observation_id":"48a6f4de-4db2-4861-8697-d222a52175a2","resolution":{"observed_at":"2026-08-07T12:12:21.979286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:05:08.753841Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2506.00338."}