{"as_of":"2026-08-13T13:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e38661678f9f5c10f3c5d0e4e4269d645f780c89594519a1aa7075999e443ad","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:49:52.048329Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13159/citation-record","integrity":"/paper/2411.13159/integrity","json":"/paper/2411.13159/citation-record.json","paper":"/paper/2411.13159"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.593902Z","title":"Attention-based models for speech recognition,","venue":null,"work_id":"e4b46b24-df80-407b-921c-e16db7605fcd","year":2015},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.889986Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:aec54355ea1fd92aa073b0ed8c74b37a680e27489f437ff6f5e4f9eeb5d02a02","observation_id":"0e6fab46-8dbb-4c43-a896-2b8f8f623927","resolution":{"observed_at":"2026-08-12T16:49:52.598461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.581409Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"82d3a0c6-30a6-4bc5-9f77-f12b5088b00c","year":2006},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.894828Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:afad161f03372405a65b947d289147d80328760c41aabd99f14b5994f2ec009d","observation_id":"b00eac6e-65b4-4d5a-ae86-1f5e9c96da1b","resolution":{"observed_at":"2026-08-12T16:49:52.585587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.568590Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"044f6bd6-5da7-4c11-9cbd-f04af2d46dd0","year":2012},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.899025Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:3a4a69ffd5920217314a600404b6a0ca685000fb6df8d3b3175553be2e23465a","observation_id":"f6f47d35-077a-454e-b07c-b0a9e2b3e0f7","resolution":{"observed_at":"2026-08-12T16:49:52.572921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-13T04:02:54.961180Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-12T16:49:51.903271Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.903271Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:71f359badb6e858cb51de9acbb6867f095a21b7e213895a174333b57d2e58daf","observation_id":"fc370d7e-fa83-44c5-ab50-be9990152af1","resolution":{"observed_at":"2026-08-12T16:49:51.903271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T16:49:51.907801Z","title":"Neural codec language models are zero-shot text to speech synthesiz- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.907801Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:3ceb6909e03be82fa9186f3ecef997abdef3646a7afe660eeda4255135fa52ed","observation_id":"21da7e93-d7b2-4662-96c3-58113ff3e93f","resolution":{"observed_at":"2026-08-12T16:49:51.907801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.554590Z","title":"Human per- ception of audio deepfakes,","venue":null,"work_id":"9ed1ff8a-b472-49ca-accc-f9806b481156","year":2022},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.912229Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:f3df92a72c922755ff51c56521d8eae6908649fa546dda3ca6362d24d5e04fc5","observation_id":"dfdf576d-1c58-4cac-944f-fd9fb19810b4","resolution":{"observed_at":"2026-08-12T16:49:52.559569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16760","last_updated":"2025-04-10T20:30:04Z","snapshot_observed_at":"2026-07-06T17:50:09.945123Z","submitted_at":"2024-03-25T13:39:33Z","title":"As Good As A Coin Toss: Human detection of AI-generated images, videos, audio, and audiovisual stimuli","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16760","snapshot_observed_at":"2026-08-12T16:49:51.916766Z","title":"As good as a coin toss human detection of ai-generated images, videos, audio, and audiovisual stimuli,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.916766Z"},"links":{"cited_paper":"/paper/2403.16760","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:be283b4792787914a8993203e559d221b21d46434a506d4d09fa8773ec536229","observation_id":"06bcdbe3-bf3f-4a60-87f5-2cc13fed8b59","resolution":{"observed_at":"2026-08-12T16:49:51.916766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.540839Z","title":"Task arithmetic can mitigate synthetic-to-real gap in automatic speech recognition,","venue":null,"work_id":"d0bd12f4-712a-43c7-80ee-caee7d102f6f","year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.921318Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:19290d1055d1683fea5632c2a862023e08ce126d72d7a1dd3c7a2c865eaefb1f","observation_id":"6bd13e30-b48b-4b67-98e2-81ac773c8dff","resolution":{"observed_at":"2026-08-12T16:49:52.545205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.528242Z","title":"Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator,","venue":null,"work_id":"c34b5651-bf70-47ed-b879-ac8ae1037a09","year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.925431Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:eb7e9df872472e11c6975431e129cac76067209ee7e6088087fc576164120175","observation_id":"d201a81d-046d-4a36-90f6-61b94d136eff","resolution":{"observed_at":"2026-08-12T16:49:52.532429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.514623Z","title":"Using synthetic audio to improve the recognition of out-of-vocabulary words in end-to-end asr systems,","venue":null,"work_id":"3f0ab24b-c516-4b35-b584-fb8befab4332","year":2021},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.929832Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:a0ff7c35d7aacde9ebeb9a5e9f4ae42ff7edb19a47b320a04fc5c8e5330588b8","observation_id":"682d7fe9-d62b-42b1-ab1b-d155925d83c3","resolution":{"observed_at":"2026-08-12T16:49:52.519505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08588","last_updated":"2023-06-14T15:50:13Z","snapshot_observed_at":"2026-08-13T11:17:20.150253Z","submitted_at":"2023-06-14T15:50:13Z","title":"Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation","version":1},"cited_work":{"arxiv_id":"2306.08588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.08588","snapshot_observed_at":"2026-08-12T16:49:52.200228Z","title":"Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation","venue":"cs.CL","work_id":"456db870-09eb-44b4-9a50-75de97058be9","year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.933948Z"},"links":{"cited_paper":"/paper/2306.08588","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:f4dce1fa4e8c05dd4d5ab1a2ef87c39f1d5cb7cd6edcfafd9f3b68f57c791108","observation_id":"5a073a15-7086-4f8f-a40a-8c7c7ef1b06f","resolution":{"observed_at":"2026-08-12T16:49:52.205063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.501882Z","title":"SYNT++: utilizing imperfect synthetic data to improve speech recognition,","venue":null,"work_id":"db72cd44-b53e-4237-bcbb-893f689374e7","year":2022},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.938422Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:71e604114f07f9649025c698874aeee09aa32d896131f65f887af7b2da8ca871","observation_id":"2c645ce8-be4c-4f3b-87ad-373694d2c021","resolution":{"observed_at":"2026-08-12T16:49:52.505925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.488720Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"c4bab0b2-9197-481c-83e4-d0f21f9049cf","year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.943077Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:4c4ed774877657d033ceffea662ca13ce4b5d2875293e0784cd0cbd033150eba","observation_id":"afdea102-9083-4122-aa83-0c68034576b2","resolution":{"observed_at":"2026-08-12T16:49:52.493281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-12T16:49:51.947601Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.947601Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:8ea40dba628531bbaf2010bded263a43f76230f3f6a258f353cbd1383b183e19","observation_id":"da877376-ab53-4e33-b329-0132b5ff4076","resolution":{"observed_at":"2026-08-12T16:49:51.947601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.475470Z","title":"Text is all you need: Personalizing ASR models using controllable speech synthesis,","venue":null,"work_id":"bbd22842-7efc-415c-a697-ea34b60f5d84","year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.952619Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:cbe006a4ddd30bd73459d245a21ef7dab74ba09e1355358736b2da5de95804bd","observation_id":"eb95c1ce-fc56-420c-be68-f932a69f80c5","resolution":{"observed_at":"2026-08-12T16:49:52.479677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.460912Z","title":"Using personalized speech synthesis and neural language generator for rapid speaker adaptation,","venue":null,"work_id":"20e7759e-659e-4329-8a6c-5042be553741","year":2020},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.956667Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:b20f90de3990d7c60998950eefe3cbc5bcee6c5e5c2bd344f667aa2c8f194c24","observation_id":"46f256f2-7526-4c5c-bd1a-87dc94ba4b5c","resolution":{"observed_at":"2026-08-12T16:49:52.465878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.447828Z","title":"Rapid RNN-T adaptation using personalized speech synthesis and neural language generator,","venue":null,"work_id":"6269bec6-e08a-4de7-a5fb-58de3cdf17c8","year":2020},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.960442Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:cfe7fb0b5acc756c3e3ddf0223b37f7456d560abb24cb3cfca44e98a6e182db1","observation_id":"ac775e04-ab81-417a-b470-955d87b7cd9e","resolution":{"observed_at":"2026-08-12T16:49:52.452237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16726","last_updated":"2024-10-22T06:25:16Z","snapshot_observed_at":"2026-08-13T02:33:29.902675Z","submitted_at":"2024-10-22T06:25:16Z","title":"Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16726","snapshot_observed_at":"2026-08-12T16:49:51.964550Z","title":"Enhancing low-resource asr through versatile tts: Bridging the data gap,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.964550Z"},"links":{"cited_paper":"/paper/2410.16726","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:b1508d219cc2eb1b46ec580616123bd4ed4e918948a27dedb614751f724f75e4","observation_id":"f0e52a0c-586b-4529-97f5-d78145dd7ac7","resolution":{"observed_at":"2026-08-12T16:49:51.964550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.434644Z","title":"Synthesizing dysarthric speech using multi-speaker tts for dysarthric speech recognition,","venue":null,"work_id":"5ed1fa45-643b-44e8-8e18-798492552eae","year":2022},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.969332Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:0f6be9862e12097269e2b9b34c03ea511196ffeb8f4e2c1f89280f01fc7c4c9c","observation_id":"1d4ded72-29d8-4f52-824e-b533b07b0c4e","resolution":{"observed_at":"2026-08-12T16:49:52.439133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:49:51.973366Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.973366Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:5ab6ffe3cdaaa87d3ae551658cdc209eac0dc454d4d55c0f439b0f4f0f78d522","observation_id":"2efbe179-bce2-48fc-8a09-bf68c18b3620","resolution":{"observed_at":"2026-08-12T16:49:51.973366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.421747Z","title":"Glm-130b: An open bilingual pre-trained model,","venue":null,"work_id":"9f537f94-75e9-483e-97b5-188d558574ab","year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.977473Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:ccfb19abb0427f704766a0bf3cde188cdb8b2062840a5d98d997a0738251eb56","observation_id":"4ae5b9e3-8bea-46f3-91d8-a699c22c9b60","resolution":{"observed_at":"2026-08-12T16:49:52.426246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T16:49:51.981507Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.981507Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:83d5ced0a859b228e5e8b39ef3a243187aa906d1a5cdae29ed5bb44c74c2fa6e","observation_id":"3e78e59e-362e-4c20-b85e-7397e19b203d","resolution":{"observed_at":"2026-08-12T16:49:51.981507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04172","last_updated":"2023-09-29T07:32:03Z","snapshot_observed_at":"2026-08-13T10:59:32.324025Z","submitted_at":"2023-07-09T13:38:25Z","title":"Can Generative Large Language Models Perform ASR Error Correction?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04172","snapshot_observed_at":"2026-08-12T16:49:51.985501Z","title":"Can generative large language models perform asr error correction?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.985501Z"},"links":{"cited_paper":"/paper/2307.04172","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:7b94d91f9bccc49628e309fbbce6a5d39b4f1f284198753870028b6273588f63","observation_id":"9dd375f2-57a6-4b4b-ade3-3b7f75de6257","resolution":{"observed_at":"2026-08-12T16:49:51.985501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.408623Z","title":"Rewritelm: An instruction- tuned large language model for text rewriting,","venue":null,"work_id":"b21af6ef-36cf-4e2e-a7bf-dafea29fcfeb","year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.989784Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:8077e52a65d9f24aad3a99311972fb155fc627aaff8c5b59945638a24c6d5373","observation_id":"76db2d5b-ad26-4709-9692-cbbd5fd86135","resolution":{"observed_at":"2026-08-12T16:49:52.413071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.395687Z","title":"69–80, Springer Nature Switzerland, 2023","venue":null,"work_id":"93ceb11c-1a0a-402e-9493-9e87af12df2a","year":2023},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.993893Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:a2fa7f83c982cd6720ad26c03602941b14dbdce19e8de8c36fbe3385cb544a95","observation_id":"b8b9cdac-352b-4501-8bbc-460f16831a6a","resolution":{"observed_at":"2026-08-12T16:49:52.400242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.382562Z","title":"Leveraging llm for augmenting textual data in code-switching asr: Arabic as an example,","venue":null,"work_id":"5a54ed6f-afa9-433c-87df-72d21abc112a","year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:51.997839Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:dc12b729fec38bc4f65b86813163b788142044681136c4c39bf53f956d4f2da4","observation_id":"e0cb417d-c619-47b9-917b-995e9fae522c","resolution":{"observed_at":"2026-08-12T16:49:52.386859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09215","last_updated":"2024-08-17T14:47:05Z","snapshot_observed_at":"2026-08-12T23:02:11.660590Z","submitted_at":"2024-08-17T14:47:05Z","title":"Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition","version":1},"cited_work":{"arxiv_id":"2408.09215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09215","snapshot_observed_at":"2026-08-12T16:49:52.111118Z","title":"Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition","venue":"eess.AS","work_id":"91e97346-601a-41d8-9e80-fc50305e942c","year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.001865Z"},"links":{"cited_paper":"/paper/2408.09215","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:0f46f50dec920b6ece97551c62d2e7facc6027ad90e3cfd7c7f622c62fef5ef0","observation_id":"c7f0150b-edc8-4fc2-a7fc-a052aa11709b","resolution":{"observed_at":"2026-08-12T16:49:52.117561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.369121Z","title":"Corpus synthesis for zero-shot ASR domain adaptation using large language models,","venue":null,"work_id":"53f6d3e0-7c61-40bc-97fa-77397c3645e0","year":2024},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.006147Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:30a59ffde2a496a36efd096a40e56e1145fb13c5c7fc427ea61fbbe2c20d77e4","observation_id":"4649d660-aef9-4711-aa25-2f3aa81a475d","resolution":{"observed_at":"2026-08-12T16:49:52.373589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.355911Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"ad34d065-b2b9-4f33-8b4a-33060e403363","year":2015},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.010442Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:eafb2997c013e3c62fca476bcc669fe42929753e84bb472d5db57f43afefc0dc","observation_id":"656e6a83-fa4b-4ab6-9e48-0b8f59fb3cbc","resolution":{"observed_at":"2026-08-12T16:49:52.360137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.341953Z","title":"Attention is all you need,","venue":null,"work_id":"880b85e0-a794-4752-8255-03083af9a1e1","year":2017},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.014456Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:d2aa3271b81ffdec51bd303f4cfba857fd00b753b2d45c889e95e25b152c60bb","observation_id":"ed13c12b-97b8-4280-a7ad-390c02959f4d","resolution":{"observed_at":"2026-08-12T16:49:52.346265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.326942Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"a7d2bc6a-f626-45ff-942c-139cf28bd3db","year":2020},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.018523Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:b1a30668b9f9bc51954cf25f251ae07c10349da3f0766fdec39614e4ba3875d1","observation_id":"1e2e7bfd-efb1-46a9-92fe-00c16f4c5c79","resolution":{"observed_at":"2026-08-12T16:49:52.331915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.312468Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"368a011c-f999-4c17-a787-89bb639f2c1d","year":2018},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.022875Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:4fde05cf4698b6be99dffc983f884464da0f983f1963f4dc6069619b865f6240","observation_id":"72d6e128-fe9f-4661-9957-86c7f615ce2c","resolution":{"observed_at":"2026-08-12T16:49:52.316927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.298644Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"c1dc60e3-994f-46d6-93a6-70182442cfbf","year":2019},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.027062Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:8358a9b896192f003d386476d8e902b077bd5cc06a9fdfcfa4122a022c1d3573","observation_id":"ee1d0c56-a028-4941-bd31-e05e9cd300fb","resolution":{"observed_at":"2026-08-12T16:49:52.303126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.284407Z","title":"Hybrid CTC/attention architecture for end-to-end speech recognition,","venue":null,"work_id":"405e2313-badf-41a0-b8f4-e2c0ac07d950","year":2017},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.031413Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:18005f545d3f4c09aad8e329371331117c745569c57dce910a888be15143ce12","observation_id":"3faa20a1-64e9-489e-88dc-56294bd127a3","resolution":{"observed_at":"2026-08-12T16:49:52.288996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.270489Z","title":"Mosnet: Deep learning based objective assessment for voice conversion,","venue":null,"work_id":"0d72cb23-cdbb-4cf4-a45c-75c2ec919f6e","year":2019},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.035611Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:4121d8323d132cd9133db270625b9e147cc640e4dd6ce38887bd5be49bbd6754","observation_id":"3a9c15a0-d59a-4fd0-8499-40903b06ab84","resolution":{"observed_at":"2026-08-12T16:49:52.275023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:52.255558Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":"67579eed-4c82-4f5c-b0c7-0a2feaa9324d","year":2022},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.039656Z"},"links":{"citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:623894f5253bd3fd2070546c72ceb3f8f41a5d21d5c26f7a068990d40c30f8f3","observation_id":"6dd41499-236c-4ce4-8ddb-28c99ea24716","resolution":{"observed_at":"2026-08-12T16:49:52.260429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15122","last_updated":"2021-04-01T09:12:22Z","snapshot_observed_at":"2026-08-13T09:17:36.930848Z","submitted_at":"2021-03-28T12:52:03Z","title":"Quantifying Bias in Automatic Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15122","snapshot_observed_at":"2026-08-12T16:49:52.044066Z","title":"Quantifying bias in automatic speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.044066Z"},"links":{"cited_paper":"/paper/2103.15122","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:51adcb3bb6b128d407c6cdfd90b3f6864d5bbdff9ed72df7e0fed28c9c0f4eff","observation_id":"18475b0f-bbe1-4fa3-9e59-9ac00c2f9990","resolution":{"observed_at":"2026-08-12T16:49:52.044066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-12T16:49:52.048329Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:49:52.048329Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2411.13159"},"observation_digest":"sha256:7170c5ac5d4a8561c734c7ea66bc3491f1a0142fa196362868bd39fedb4c35ea","observation_id":"a6e36dc1-c0a5-4332-a579-641e05bc45fd","resolution":{"observed_at":"2026-08-12T16:49:52.048329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13159","last_updated":"2024-11-20T09:49:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T09:18:29.990964Z","submitted_at":"2024-11-20T09:49:37Z","title":"Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2411.13159."}