{"as_of":"2026-08-09T00:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f96ef38023de7fa809d1cb0fa3194253e7ee029aec31e242381a12572a5e960","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:56:56.636821Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:56:54.638430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:56:57.785085Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"cited_work":{"arxiv_id":"2505.20606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20606","snapshot_observed_at":"2026-08-07T13:56:57.785085Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","venue":"cs.CL","work_id":"a4142b63-2712-417d-a43c-32e34a4ea447","year":2025},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.638430Z"},"links":{"cited_paper":"/paper/2505.20606","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:7866b54c50f0ea638b85d765637f6f6bfed3eff677babacb310fa61c6fe20350","observation_id":"7e7d81fe-947a-4da8-aa87-290dbe8fef48","resolution":{"observed_at":"2026-08-07T13:56:57.859401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20606/citation-record","integrity":"/paper/2505.20606/integrity","json":"/paper/2505.20606/citation-record.json","paper":"/paper/2505.20606"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:02.110810Z","title":null,"venue":null,"work_id":"fec1a8c3-5a54-4871-968e-7fab9a1ed0d6","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.414040Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:66daec9ce12d833066e1c6c5e474a8f3fe12b7deeb6978ed2e53a35e1697200d","observation_id":"1a0279a9-3f9f-4903-99f0-5aaaacb4ecf7","resolution":{"observed_at":"2026-08-07T13:57:02.170344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:02.013030Z","title":null,"venue":null,"work_id":"10589255-90e9-44aa-8741-3e80f582e32c","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.463114Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:c404dd4c5be92da1f1ac278926dfbd81fa47f866399e3126521f864593655379","observation_id":"8d83996d-c3ef-40d0-913b-73bfcc45fe97","resolution":{"observed_at":"2026-08-07T13:57:02.067797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:01.882123Z","title":null,"venue":null,"work_id":"ebe0fec1-8061-480e-a653-a82892a9f6a0","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.530966Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:d5b27948852b44a95fa71aeceb725d7d69678c6210c0348ec1011840e10f9e8c","observation_id":"54f20529-a02e-4548-b991-f00dfb254308","resolution":{"observed_at":"2026-08-07T13:57:01.956952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:01.666091Z","title":null,"venue":null,"work_id":"084b9f43-520e-466f-b19d-b86b00e68b85","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.575189Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:408a0d75aa239c82b148cecb4bae9275e8e4818862b187e0654e92bde0b7b135","observation_id":"2d199a2d-2659-4fad-93e4-3481cd909423","resolution":{"observed_at":"2026-08-07T13:57:01.788333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"cited_work":{"arxiv_id":"2505.20606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20606","snapshot_observed_at":"2026-08-07T13:56:57.785085Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","venue":"cs.CL","work_id":"a4142b63-2712-417d-a43c-32e34a4ea447","year":2025},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.638430Z"},"links":{"cited_paper":"/paper/2505.20606","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:7866b54c50f0ea638b85d765637f6f6bfed3eff677babacb310fa61c6fe20350","observation_id":"7e7d81fe-947a-4da8-aa87-290dbe8fef48","resolution":{"observed_at":"2026-08-07T13:56:57.859401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:01.450423Z","title":null,"venue":null,"work_id":"8456f69d-efcc-47e0-b790-087f55afa530","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.689418Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:e8eff0511776ec6dfb2987fc59c5f94fbf6283a80d2258fe2587ce4a926c48ee","observation_id":"cabe68fa-e73e-4d8c-82fb-9efe9e8c9f09","resolution":{"observed_at":"2026-08-07T13:57:01.552188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:01.239290Z","title":null,"venue":null,"work_id":"5d6adc2c-b720-415f-94c3-15ca196721a3","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.757585Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:2fde7cb6a4aeb28bb501fb92fd29ef0143f35386e85bb38ab5ee954980577250","observation_id":"cbaa0116-cf29-4e2e-a768-a6f343369d9f","resolution":{"observed_at":"2026-08-07T13:57:01.345731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-07-06T04:03:56.251710Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-08-07T13:56:55.421526Z","title":"Deep speech: Scaling up end-to-end speech recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.421526Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:4e601033cf585f2017230740bb5be2244a61db22349628a892262d714b469930","observation_id":"ba028c0f-89d5-410d-a976-2b65e51a68a9","resolution":{"observed_at":"2026-08-07T13:56:55.421526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8482.6758","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:57.624165Z","title":"In this section, we focus on acoustic data augmentation techniques and investigate their ef- fects on the robustness of the pre-trained ASR models","venue":null,"work_id":"b6555e07-f2d0-4437-aefa-036cd8bfc130","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.892494Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:3f7a014e3e7af63b853bfaf5b5c3b55174014e2f033743f527f90ab92cf6d327","observation_id":"44ef5d35-cd0f-4062-afcf-66c6ec165d72","resolution":{"observed_at":"2026-08-07T13:56:57.704666Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:00.958309Z","title":"When data sources are lim- ited, acoustic augmentations can significantly outperform exist- ing data augmentation methods on unseen speech","venue":null,"work_id":"5b0193d0-882c-4449-a50e-79f36c977188","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.962234Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:b7aecb5ecad1f5f7fdc06d516819f6d2e4da1355d54702caf5b771d173ed424a","observation_id":"c603ae28-a860-428c-8cf8-641ba727deb4","resolution":{"observed_at":"2026-08-07T13:57:01.013936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T13:56:55.026428Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.026428Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:9cf4099e84fdc4963dece3170803d73d9b7e3823d71271b14a4643f2fcba06be","observation_id":"5d37df95-1f99-4f47-b8ae-994a436c9dc8","resolution":{"observed_at":"2026-08-07T13:56:55.026428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11865","last_updated":"2024-10-07T20:14:37Z","snapshot_observed_at":"2026-07-06T19:34:01.458836Z","submitted_at":"2024-10-07T20:14:37Z","title":"Automatic Screening for Children with Speech Disorder using Automatic Speech Recognition: Opportunities and Challenges","version":1},"cited_work":{"arxiv_id":"2410.11865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11865","snapshot_observed_at":"2026-08-07T13:56:57.415686Z","title":"Automatic Screening for Children with Speech Disorder using Automatic Speech Recognition: Opportunities and Challenges","venue":"eess.AS","work_id":"61e2b7d1-bd98-49ed-a874-fdf831ce3459","year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.097073Z"},"links":{"cited_paper":"/paper/2410.11865","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:c173e224ff4cc4a1ba3d9d039ca7134ade7eed71a0459d5cfa49f583c34041f1","observation_id":"82ebf554-82fe-49b7-abcc-42d6564375d7","resolution":{"observed_at":"2026-08-07T13:56:57.480429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:55.167614Z","title":"Synthasr: Unlocking synthetic data for speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.167614Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:895deea9ae60c9e80334ddb7cdf3d6aae3d8bdf418637300efbd0e8648af2316","observation_id":"333cd5cc-1b12-4dfd-84ff-a0cd5e043820","resolution":{"observed_at":"2026-08-07T13:56:55.167614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:00.808006Z","title":"On the effect of purely synthetic training data for different automatic speech recognition architectures,","venue":null,"work_id":"a512bc19-1d0b-44f1-afd7-5a750039aee1","year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.237385Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:59c55cc54dcc3dffe2d8bd3f89c40a3b1deab39fc49febdb69ca2e7680ec8df5","observation_id":"9b881408-475b-4499-9948-6255fb0937af","resolution":{"observed_at":"2026-08-07T13:57:00.873645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:55.292701Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.292701Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:ca95a524520ebf89d94b6f50084254d3b2f307a84e0fb8b15160f3143db9d395","observation_id":"73b0f32e-719a-480b-aacc-d3dc992d1dbe","resolution":{"observed_at":"2026-08-07T13:56:55.292701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:00.627047Z","title":"Specmix : A mixed sample data augmentation method for training with time-frequency do- main features,","venue":null,"work_id":"fd2b345d-0c5e-4957-8c50-f1a6e4f8f3f0","year":2021},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.339708Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:1986f6649f9eea90ecdc140c7e5ee795241afb5e0b769fdf9bb507813b801550","observation_id":"51e3dfa3-65e0-4929-b62c-45324a3383dd","resolution":{"observed_at":"2026-08-07T13:57:00.705134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:55.387341Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.387341Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:14f50086f80ff096d1884849f77c2393fe944d02913375d50c1d8aa9bbf1eb22","observation_id":"a07d7668-f1f0-4db8-a9d8-d350ef243d78","resolution":{"observed_at":"2026-08-07T13:56:55.387341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:59.289151Z","title":"Adversarial audio synthesis,","venue":null,"work_id":"4f6508ba-d1e9-4f3f-9081-2df2d8f5cbc7","year":2019},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.872116Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:273280e72437f0ac56ed8c3b44f32d2ed49f8034f2779e1fd0a1397f44bab99d","observation_id":"0a9f93f7-bbe5-4128-a8bc-b4ff75ed98a1","resolution":{"observed_at":"2026-08-07T13:56:59.383094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:55.465809Z","title":"Audio aug- mentation for speech recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.465809Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:616948c80ecf3ab94afa259997f745d30a62500cb2004bf96bff843ca0fd995e","observation_id":"8b869c13-38fb-4e27-bc6c-d5f950df8075","resolution":{"observed_at":"2026-08-07T13:56:55.465809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:55.504875Z","title":"A study on data augmentation of reverberant speech for robust speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.504875Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:6abe8e77219f7ec0b257cee0f78e6ae4363c1c033ba7ad620452fee90fc26e04","observation_id":"928197a7-e92a-4513-b6ff-6cf806406233","resolution":{"observed_at":"2026-08-07T13:56:55.504875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:00.401036Z","title":"Make more of your data: Minimal effort data augmentation for automatic speech recog- nition and translation,","venue":null,"work_id":"7bd4de2b-38e7-40be-adb5-c5a6c3cd78d4","year":2023},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.554820Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:e01b0090a2eef0e127350c1a35fa828aa2e6661b13ba67d2171d7d18b7245f08","observation_id":"5a03fc3c-d6b3-4fdc-b057-3aec630b9bf0","resolution":{"observed_at":"2026-08-07T13:57:00.491754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:00.155427Z","title":"Specaugment++: A hidden space data augmentation method for acoustic scene classifica- tion,","venue":null,"work_id":"11823f0b-47b5-4d29-a01e-d933606e4bed","year":2021},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.607168Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:5aafc26e3670a924c2a3c34e10a0e0d2840c76f343c1ee0b3ae440dadb539518","observation_id":"ab50c095-0937-42b2-a9ac-02ce27793fa1","resolution":{"observed_at":"2026-08-07T13:57:00.263687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-07T13:56:55.652123Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.652123Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:f7a7245f5995d9bd5f1344874524bd03b4f01b1106c96d9015a8947e5afb0eed","observation_id":"b49a376c-be19-40d6-b023-e51f76dd76c1","resolution":{"observed_at":"2026-08-07T13:56:55.652123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:59.937172Z","title":"Sapaugment: Learning a sample adaptive policy for data augmentation,","venue":null,"work_id":"6673f56b-744b-4547-8b90-ad1f7a5f05cc","year":2021},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.696223Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:34de007aa6ef54594391a8720bcaa3a22ed4bce7917dd1190c9ab4bcc442c346","observation_id":"7f581be0-92d3-4860-acbc-42a83b7dbe74","resolution":{"observed_at":"2026-08-07T13:57:00.052668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:59.690552Z","title":"G- augment: Searching for the meta-structure of data augmentation policies for asr,","venue":null,"work_id":"39e9618d-2fe3-4753-86af-d256755db1cb","year":2023},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.744361Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:fea5e3ae36721cf34dd0c82281b80df0f5c17305ef9decbaf2fde3579c232aec","observation_id":"ec2af8f9-279d-4b1e-8cfd-1076cc5cae48","resolution":{"observed_at":"2026-08-07T13:56:59.786856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00415","last_updated":"2024-11-30T09:48:48Z","snapshot_observed_at":"2026-07-06T19:59:24.405557Z","submitted_at":"2024-11-30T09:48:48Z","title":"Sample adaptive data augmentation with progressive scheduling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00415","snapshot_observed_at":"2026-08-07T13:56:55.784699Z","title":"Sample adaptive data augmentation with progressive scheduling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.784699Z"},"links":{"cited_paper":"/paper/2412.00415","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:8a8d5f6b840544a6febdc7a1f5dec4218bba7b1539981512c8e79a0e1740ebb9","observation_id":"c0a8367b-8cb8-4fef-a8ee-29ec8325e25a","resolution":{"observed_at":"2026-08-07T13:56:55.784699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:59.487257Z","title":"Natural tts synthesis by condi- tioning wavenet on mel spectrogram predictions,","venue":null,"work_id":"ce864844-62c2-4b5e-8c21-a81b0e91d471","year":2018},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:55.837259Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:946b3497ed0914c44a600ebde06fa5b0ef9778817fea3efea1f4e38d7256d464","observation_id":"393fcbf2-e0df-49ab-a888-33ed3cb0738f","resolution":{"observed_at":"2026-08-07T13:56:59.607480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:58.138615Z","title":"Fasa: a flexible and automatic speech aligner for extracting high-quality aligned children speech data,","venue":null,"work_id":"84d2373f-6b8f-4c6b-876c-77a507cb621b","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.395739Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:271f06b2ef0a9364d74b8f9b600e9ffca3891ed54895015e2d1275e50354eb7b","observation_id":"64c7b986-a8d9-42a5-9f62-d13e29d1863d","resolution":{"observed_at":"2026-08-07T13:56:58.265363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:59.079946Z","title":"Kokoro-82m (revision d8b4fc7),","venue":null,"work_id":"fcd94937-bb1c-49fa-8719-fcfa8d82f872","year":2025},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.013638Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:fa006cc24bd8c2b1aa0b09e095c392bfc57bfab247c785570bf61ccfa2928551","observation_id":"2cef622d-22fc-4995-9b8f-0d57e215b6bf","resolution":{"observed_at":"2026-08-07T13:56:59.197655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04047","last_updated":"2024-07-04T16:42:24Z","snapshot_observed_at":"2026-08-06T16:21:50.005991Z","submitted_at":"2024-07-04T16:42:24Z","title":"Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2407.04047","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04047","snapshot_observed_at":"2026-08-07T13:56:57.160295Z","title":"Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis","venue":"cs.CL","work_id":"adb239ed-2d26-403c-a74e-56519192f1d1","year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.065800Z"},"links":{"cited_paper":"/paper/2407.04047","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:2872eb3b8727984f56490a4ba48af5d898eddf23a8d2b0cbdc5a15f5e573bd87","observation_id":"60634783-6f84-4536-afc3-4779143341d1","resolution":{"observed_at":"2026-08-07T13:56:57.278482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:58.867643Z","title":"Investigating the use of syn- thetic speech data for the analysis of spanish-accented english pronunciation patterns in asr,","venue":null,"work_id":"c627cba3-1e6c-4b17-a519-a6884c19ce96","year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.106156Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:1073f7c59cd13282f17a93bdccfa4c79639b912414e1d35f16c3d91bef9ca9f3","observation_id":"fd4b739b-4213-4b68-a54c-ecd5b5438a87","resolution":{"observed_at":"2026-08-07T13:56:58.974493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:58.638525Z","title":"Asr data augmentation in low-resource settings using cross-lingual multi- speaker tts and cross-lingual voice conversion,","venue":null,"work_id":"35916625-7275-4b7f-8157-f20de20bf175","year":2023},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.141767Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:b61600b52bf6e102858bafc9f46efb3894f8a01ee3c13cfebf5cffe5f6e7b482","observation_id":"83eac2cc-6289-448c-bd85-1c47293234aa","resolution":{"observed_at":"2026-08-07T13:56:58.779650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08568","last_updated":"2024-06-12T18:11:24Z","snapshot_observed_at":"2026-07-06T18:29:53.755897Z","submitted_at":"2024-06-12T18:11:24Z","title":"Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08568","snapshot_observed_at":"2026-08-07T13:56:56.189341Z","title":"Training data augmentation for dysarthric automatic speech recognition by text-to-dysarthric-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.189341Z"},"links":{"cited_paper":"/paper/2406.08568","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:50ea8d9fa6addbae85d983f2d9ca62b2bea2a8b01b6230d9856f0868a4fdd615","observation_id":"6afb2ec3-2a45-4332-a146-70c8f4593511","resolution":{"observed_at":"2026-08-07T13:56:56.189341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:58.377330Z","title":"Dialog inpainting: Turning documents to dialogs,","venue":null,"work_id":"55ba48dc-3d5d-412e-a5fa-da032914798c","year":2022},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.227416Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:90acd06b30dda22c125071165e70f3a9397f25ca012a1f28a96fe1925d6227aa","observation_id":"d7b3fc1c-560d-47c7-81f5-4bb89e71b0f1","resolution":{"observed_at":"2026-08-07T13:56:58.509428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02395","last_updated":"2022-03-04T16:05:48Z","snapshot_observed_at":"2026-07-30T21:14:47.386139Z","submitted_at":"2022-03-04T16:05:48Z","title":"iSTFTNet: Fast and Lightweight Mel-Spectrogram Vocoder Incorporating Inverse Short-Time Fourier Transform","version":1},"cited_work":{"arxiv_id":"2203.02395","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02395","snapshot_observed_at":"2026-08-07T13:56:57.043273Z","title":"iSTFTNet: Fast and Lightweight Mel-Spectrogram Vocoder Incorporating Inverse Short-Time Fourier Transform","venue":"cs.SD","work_id":"3fb5131e-bb2d-41a8-a004-07594040e66f","year":2022},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.262332Z"},"links":{"cited_paper":"/paper/2203.02395","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:ad2e6545d12932b233148b1efcb32fea81db0f729de03a04fe30f5d726876b51","observation_id":"f794b98d-fc3e-42d1-ab34-7e0e353c2cee","resolution":{"observed_at":"2026-08-07T13:56:57.078014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07691","last_updated":"2023-11-20T04:23:08Z","snapshot_observed_at":"2026-07-06T15:41:59.079694Z","submitted_at":"2023-06-13T11:04:43Z","title":"StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07691","snapshot_observed_at":"2026-08-07T13:56:56.300139Z","title":"Styletts 2: Towards human-level text-to- speech through style diffusion and adversarial training with large speech language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.300139Z"},"links":{"cited_paper":"/paper/2306.07691","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:99dd8c2476a11feac61c0f88aa72b2a4d8f7703c25b661ef10a862b44704a790","observation_id":"ffe792b9-1823-40a8-b57d-84b5f44a1e5a","resolution":{"observed_at":"2026-08-07T13:56:56.300139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.4923181","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:56.798262Z","title":"librosa/librosa: 0.10.2,","venue":null,"work_id":"5448c8d5-b6b8-4e05-a5cc-6e22b3511538","year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.345884Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:ed353a39d6bc8f7c97410df546b75a1f83b135967033232168b450f2f05ae0e0","observation_id":"6135c121-0bd4-45b7-8f96-dcbbd0ae197e","resolution":{"observed_at":"2026-08-07T13:56:56.851938Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:57.961805Z","title":"My science tutor (myst) – a large corpus of children’s conversational speech,","venue":null,"work_id":"5ba4581b-1baf-49f8-8fd7-c2d094ad7479","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.485075Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:535d34e64371f68f699470dc3bd9eadc379464b898bf81cf966c83c67149362f","observation_id":"c3bb1be4-d50f-4c56-a5be-6b4952483855","resolution":{"observed_at":"2026-08-07T13:56:58.044553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:56.573567Z","title":"L2-arctic: A non- native english speech corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.573567Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:29268325a601a9a091fa58fe4f025011313711825198d372721790587b3124e7","observation_id":"a3ffe455-f07f-4c73-8f7a-8cc51438d76a","resolution":{"observed_at":"2026-08-07T13:56:56.573567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2991/sshr-17.2018.21","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:56.730194Z","title":"Phonological differences between received pronunciation and standard scottish english,","venue":null,"work_id":"53a748e9-4e94-4513-8a03-6e86beb555eb","year":2017},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.636821Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:a2646516929b5851cca3dca9b5571443e1f61954e20b8cfbd50d4e7fc0b88e44","observation_id":"a7faa8a5-cd23-4236-9c0c-87ffab7ce201","resolution":{"observed_at":"2026-08-07T13:56:56.786888Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:01.073456Z","title":"All experiments are conducted on a server with 4 A6000 GPUs","venue":null,"work_id":"8c7533fd-1ec9-4f28-8ee4-d24e04718168","year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:54.812172Z"},"links":{"citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:be013c5cb4c371d9164d544cb2245c203fbfa7c613f6ed81fcc556b010f136e4","observation_id":"ab20909a-9d09-49d6-83f1-bf6560fc70a7","resolution":{"observed_at":"2026-08-07T13:57:01.141473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13347","last_updated":"2023-09-23T11:52:36Z","snapshot_observed_at":"2026-07-06T16:22:42.704981Z","submitted_at":"2023-09-23T11:52:36Z","title":"My Science Tutor (MyST) -- A Large Corpus of Children's Conversational Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13347","snapshot_observed_at":"2026-08-07T13:56:56.534182Z","title":"Available: https://arxiv.org/abs/2309.13347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.534182Z"},"links":{"cited_paper":"/paper/2309.13347","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:b2083a7ce25bdc6b068ce1d7747a59dbad5e3563efa39c4817a45b3d5f8a7f53","observation_id":"8519f050-3ef1-441d-8650-717624f44814","resolution":{"observed_at":"2026-08-07T13:56:56.534182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17926","last_updated":"2024-06-25T20:37:16Z","snapshot_observed_at":"2026-07-06T18:37:00.469355Z","submitted_at":"2024-06-25T20:37:16Z","title":"FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data","version":1},"cited_work":{"arxiv_id":"2406.17926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17926","snapshot_observed_at":"2026-08-07T13:56:56.913537Z","title":"FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data","venue":"cs.CL","work_id":"a345af85-519f-46a9-ac60-3c0daff339f0","year":2024},"citing_paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:56.438246Z"},"links":{"cited_paper":"/paper/2406.17926","citing_paper":"/paper/2505.20606"},"observation_digest":"sha256:ab28e94b7d999d060312c44ee76a1776d0085392b3e95cbd74e6b867e2ae18e1","observation_id":"1c5729db-937e-4474-888d-42ba49be999c","resolution":{"observed_at":"2026-08-07T13:56:56.964789Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20606","last_updated":"2025-05-27T00:55:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:48:24.877942Z","submitted_at":"2025-05-27T00:55:32Z","title":"Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":6,"verified_fuzzy":16},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.20606."}