{"as_of":"2026-08-20T15:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d578defc4a09579067e643bb7f8a5041217ebf763036f508eafeead8863afcf","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:11:16.084748Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.05976/citation-record","integrity":"/paper/2501.05976/integrity","json":"/paper/2501.05976/citation-record.json","paper":"/paper/2501.05976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.383570Z","title":"FastSpeech: Fast, robust and controllable text-to-speech,","venue":null,"work_id":"0c991df4-ea23-4b3c-89c3-4c7936fc09ff","year":2019},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.768300Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:51de612ce5c0e86736c59fc03f00c258d93c00c93df68b010e7160b062d73310","observation_id":"9cb475c2-865e-4818-a046-f609e51c258e","resolution":{"observed_at":"2026-08-10T21:11:17.391706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.362803Z","title":"FastSpeech 2: Fast and high-quality end-to-end text-to-speech,","venue":null,"work_id":"9e9f9ced-8514-4a72-8092-f4b46b3798b9","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.775114Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:8e24ca414de7944540a8ae4da59882d10b3e60724c11cc7212650279802a5a40","observation_id":"e550103e-40f2-4192-b292-12f067f5c9d8","resolution":{"observed_at":"2026-08-10T21:11:17.369492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.339437Z","title":"ForwardTacotron,","venue":null,"work_id":"4dd523f6-4b35-431d-89c9-1118a5f9c74b","year":2020},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.780132Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:679e02bd3166cfaa93350ee22fafd698e6ed3f21b4e16a349d51276e4f94207b","observation_id":"08305571-d8c9-4e53-b61a-7d6e9a26ab0b","resolution":{"observed_at":"2026-08-10T21:11:17.347900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.321857Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction,","venue":null,"work_id":"89904bad-9d45-4783-8d83-e0a9aa43ed64","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.794750Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:6412fb8dd1c5f74acae4acb72f6a930f048e636ef20d03a29356a454c5061fe9","observation_id":"a8900656-c7ce-4026-90c5-a0b34e2b6f18","resolution":{"observed_at":"2026-08-10T21:11:17.327544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.304860Z","title":"A lightweight neural TTS system for high-quality German speech synthesis,","venue":null,"work_id":"9a4a1814-2010-4d59-b994-7fda80337a6e","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.800817Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:9f50fac556b97c4410eb3f6f7cd92527fd623ef24ce36b3b68fecf51836cc81a","observation_id":"641ca97e-adcf-4e53-817f-ed3555290aa9","resolution":{"observed_at":"2026-08-10T21:11:17.309870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.289031Z","title":"YourTTS: Towards zero-shot multi-speaker TTS and zero- shot voice conversion for everyone,","venue":null,"work_id":"d8e3532d-4f7e-4796-9952-893c42951b41","year":2022},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.808077Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:a762155b1481bef54d23f545ca65b9eeaf114b41fdfb38e9b6b5adc85ff7affb","observation_id":"eeee3112-4389-4c7b-b972-4aa78d487921","resolution":{"observed_at":"2026-08-10T21:11:17.293526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-08-16T14:41:34.277458Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-10T21:11:15.815810Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.815810Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:ec092f996861c93d4a11e01d091686a2601009db0ef641383499f8db85f2ab95","observation_id":"06087c3f-9f4c-4b7e-a902-b7952bf232b7","resolution":{"observed_at":"2026-08-10T21:11:15.815810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.264837Z","title":"Generalizable zero-shot speaker adaptive speech synthesis with disentangled representations,","venue":null,"work_id":"cb46c3c2-eb96-4989-a69d-2124615e6f0c","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.822018Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:ea98179ef38df6060c3335a487a9e52b5fa6f242159c5bab1fb135a9b9e1ef40","observation_id":"cbb4dbda-e511-49d6-b359-e49ad0e88437","resolution":{"observed_at":"2026-08-10T21:11:17.273642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.244205Z","title":"Adapter-based extension of multi-speaker text-to-speech model for new speakers,","venue":null,"work_id":"a2ccd001-4be4-4ce9-a103-b8f75a2dfe4c","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.830024Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:ef55f9d50289957424f5c3a69197ca1acdb143dbbede08d3fdcb0bc029cba9b9","observation_id":"2c6fda88-9afd-4f97-832c-2f64403ead43","resolution":{"observed_at":"2026-08-10T21:11:17.251458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.213132Z","title":"AdapterMix: Exploring the efficacy of mixture of adapters for low-resource TTS adaptation,","venue":null,"work_id":"377e34c9-878c-46fa-93f0-a4fdf2a5df10","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.836299Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:6a3aeaf212b9650a84e9c135e280e38ceaafd19eadc792dff81bd2e5cbc32acc","observation_id":"ae08aa93-9168-4028-8d23-7353cca51748","resolution":{"observed_at":"2026-08-10T21:11:17.231740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.182742Z","title":"CSTR VCTK Corpus: En- glish multi-speaker corpus for CSTR voice cloning toolkit (version 0.92), [sound]","venue":null,"work_id":"a7206e9d-1ea3-47d9-95e1-d3a330026dfb","year":2019},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.840868Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:04e89171673677ca03099e989edc37e9f6f4a95ef5b61a588ea3fe8f48e78a30","observation_id":"a6b84c5c-ae4c-435d-b419-bdfab67e7a59","resolution":{"observed_at":"2026-08-10T21:11:17.199433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.147853Z","title":"LibriTTS: A corpus derived from LibriSpeech for text-to- speech,","venue":null,"work_id":"e318f983-a71a-4606-89ef-4f9691c78234","year":2019},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.845843Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:7184bcc21dde1e5f3b19e834cfc3a3793091702c43df6ec7ccee726d7f419a01","observation_id":"66c92f42-e3b9-4283-97de-061d24cd15c6","resolution":{"observed_at":"2026-08-10T21:11:17.163258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.089648Z","title":"StrawNet: Self-training WaveNet for TTS in low-data regimes,","venue":null,"work_id":"228619cb-4021-4ed7-87d3-7e70e5f1c538","year":2020},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.858461Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:be88c4bc7cda87084e1ae9f794209c1051a719b54e582ad7e4c329cf30f01bd3","observation_id":"06850836-222e-4b27-806a-cfe1e916d67b","resolution":{"observed_at":"2026-08-10T21:11:17.103582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.067866Z","title":"Non-autoregressive TTS with explicit duration modelling for low-resource highly expressive speech,","venue":null,"work_id":"a1e3af72-bb5a-49cf-bff3-1335f1cade7e","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.879012Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:755adc39504cf517c483b55281df038512999228b497b12cf5b1a12658503e9b","observation_id":"2e54ce99-4bae-4b4e-8c5d-ab6466795802","resolution":{"observed_at":"2026-08-10T21:11:17.074177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.049436Z","title":"Low-resource expressive text-to-speech using data augmen- tation,","venue":null,"work_id":"09704e28-2ab8-42e1-9665-cc38a20d2cbc","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.884010Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:fd03561246d5b93d368d1f1aab2e291b5c75ff90da07bcf3b621f0df6ed249a3","observation_id":"76e6c3c6-f857-4c3f-b770-488cda2fb789","resolution":{"observed_at":"2026-08-10T21:11:17.054443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:17.008515Z","title":"Distribution augmentation for low-resource expressive Text-To-Speech,","venue":null,"work_id":"cd711911-256f-489d-97ae-3ae03b62eb42","year":2022},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.890734Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:dee12f0896d9fd71f51a570555e00c55cb1521fba95ba9a61281182ab24bf1e6","observation_id":"e4eb61d5-28e9-4bf7-bc46-d1dc6d3ee8c1","resolution":{"observed_at":"2026-08-10T21:11:17.015344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12531","last_updated":"2020-10-22T11:36:56Z","snapshot_observed_at":"2026-08-10T03:15:10.823179Z","submitted_at":"2020-05-26T06:14:06Z","title":"Noise Robust TTS for Low Resource Speakers using Pre-trained Model and Speech Enhancement","version":2},"cited_work":{"arxiv_id":"2005.12531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.12531","snapshot_observed_at":"2026-08-10T21:11:16.304962Z","title":"Noise Robust TTS for Low Resource Speakers using Pre-trained Model and Speech Enhancement","venue":"eess.AS","work_id":"d5da96c8-4c2d-4224-acc3-723493ce7f5c","year":2020},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.897203Z"},"links":{"cited_paper":"/paper/2005.12531","citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:681660f7bd700d70223f478fb26ce40ea11de895cfb97ae55a7da29b314decd0","observation_id":"1f71721c-185c-4a0c-bee3-fba22567de7b","resolution":{"observed_at":"2026-08-10T21:11:16.331217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.952014Z","title":"Low-resource text-to- speech using specific data and noise augmentation,","venue":null,"work_id":"d0c83223-dc4f-4e17-a305-8d96c54f5c8f","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.905785Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:28ad4abe053f580b8a75421c311bec7a0efabf2097c68d5138895cf089f7dde7","observation_id":"8ae66709-642f-4917-8a8b-3662b6ca5ed6","resolution":{"observed_at":"2026-08-10T21:11:16.975121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.933923Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":"2e5cb696-29e4-4fef-8077-b4acc8f0d9e9","year":2017},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.911134Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:0642cb7ba4168127ece4f6c62d41b5022af4741aa83acdcd300643cdc89734c6","observation_id":"fed1c44c-54f1-4c8d-a738-e3d328398778","resolution":{"observed_at":"2026-08-10T21:11:16.938325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.903654Z","title":"StyleMelGAN: An efficient high- fidelity adversarial vocoder with temporal adaptive normalization,","venue":null,"work_id":"d2c8d9fa-7522-4c23-b3b9-0b6da4123588","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.924939Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:8945a33a313b4adfdb0f5f2cec71f5a4717a7962fce1541aae380f799024a1d1","observation_id":"98d10fba-8ca0-4520-a5ff-827fe6d718f1","resolution":{"observed_at":"2026-08-10T21:11:16.919788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.844750Z","title":"The AudioLabs system for the Blizzard Challenge 2023,","venue":null,"work_id":"e0b8d1ed-fe39-4f56-bd0a-aa26e3c48a7a","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.930377Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:0ed6eb39f83493e4a72f9d93a631d6008a5e321e45aeb08088ef903b9a1eafdb","observation_id":"b1f51b94-1b72-4db4-b58a-db312c2ead35","resolution":{"observed_at":"2026-08-10T21:11:16.854750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:15.934919Z","title":"A systematic study of the class imbalance problem in convolutional neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.934919Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:4feaf513e8e5dfff05de91b1a0249bc3d4bd2de73bb72f2aaaf3e78f32cb613c","observation_id":"4b36436f-62d3-4fca-8a15-e2cd0d7816d4","resolution":{"observed_at":"2026-08-10T21:11:15.934919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.794734Z","title":"WhisperX: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":"d5897069-7a91-4a1f-bde4-2b996f83536f","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.963802Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:41c0de4f1dc627a6240e363a17e33aacf88a1f5cac8a7a9d9bec168c4739e6d8","observation_id":"1113f6ac-7ffe-4457-9518-c36216d79819","resolution":{"observed_at":"2026-08-10T21:11:16.810081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:15.971937Z","title":"The LJ speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.971937Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:30e73ec44e00cb958008f61aadb1e139f71775a1eb52f485859f6da332ac7816","observation_id":"eb146d00-dece-49c3-9e9d-fa36309227aa","resolution":{"observed_at":"2026-08-10T21:11:15.971937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.755527Z","title":"TC-STAR: Spec- ifications of language resources and evaluation for speech synthesis,","venue":null,"work_id":"2c1c47d3-c10b-49e0-bca2-4c3fd9f4c228","year":2006},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.980445Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:3b608da2edf78590e4c4fda2d12d746738a2a6f83fc2224f24ed855c0f94171a","observation_id":"b581c050-6b83-419b-9e2f-84530229a257","resolution":{"observed_at":"2026-08-10T21:11:16.762352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.718191Z","title":"Hi-Fi multi- speaker english TTS dataset,","venue":null,"work_id":"848d3f35-4b30-4fe9-93aa-027b15f803f9","year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:15.990000Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:c5d8448b759ee10a25f7761604e56947d464040c321d086ed4f511dd6def30d9","observation_id":"28755a03-429d-46ae-8667-0a7b6c718435","resolution":{"observed_at":"2026-08-10T21:11:16.723528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.684367Z","title":"P. 56, objective measurement of active speech level,","venue":null,"work_id":"c3537758-3d4c-4808-aa48-0f4f4f88c885","year":2011},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.002448Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:8bff6a3a92266413dd6f3cbd0dc2ee02104289fdb745ae6eae9ec5669869ac63","observation_id":"4b2019b4-48ca-4fd4-a872-aaf1894a8db6","resolution":{"observed_at":"2026-08-10T21:11:16.700260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.639599Z","title":"Subjective evaluation of text-to-speech models: Comparing absolute category rating and ranking by elimination tests,","venue":null,"work_id":"8fed4130-5494-4c59-9e4b-6c81a154a569","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.010546Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:b41368656bc8431f154304872949b356f62b6fae785b4f1725963e0546659592","observation_id":"e815e595-5979-4381-ab8e-86258c5d5204","resolution":{"observed_at":"2026-08-10T21:11:16.663838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.605421Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":"20477681-ced9-4a60-9065-5c175ef502b2","year":2020},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.024237Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:f909fa8fb0e409b7a60616604ea37e064cd599d7935044f1e35be5a541e9c92f","observation_id":"30159bff-5563-4abb-83d8-254187a5db4d","resolution":{"observed_at":"2026-08-10T21:11:16.615597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-18T17:51:41.801692Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-10T21:11:16.034748Z","title":"SpeechBrain: A general- purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.034748Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:9c67736bd3f8573d5c812edb9962038a3c347d0ca3190b5b78099644cbfbefeb","observation_id":"1256c617-1d5b-4bee-b111-affdc796ffa8","resolution":{"observed_at":"2026-08-10T21:11:16.034748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.585460Z","title":"Towards the next generation of web-based experiments: A case study assessing basic audio quality following the ITU-R recommendation BS.1534 (MUSHRA),","venue":null,"work_id":"443b7cca-68f5-4bf2-a1f4-0d3571724941","year":2015},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.040596Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:81dd1077da890c42ce0c2cf18de079f41baa3670eb05a7b6e821d08aac907d29","observation_id":"0af6cdfc-9bfe-4746-987b-c3153076eb06","resolution":{"observed_at":"2026-08-10T21:11:16.591609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.564195Z","title":"P. 808, Subjective evaluation of speech quality with a crowdsourcing approach,","venue":null,"work_id":"40931550-a973-4299-8ae2-4ea18f36b0f4","year":2018},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.055290Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:6cfb5ad667ce1772a25222dca64993c5e52bcb8c375879260cf7edfc82799c32","observation_id":"ace5e819-02ff-4fae-ae04-2cbb941b8a26","resolution":{"observed_at":"2026-08-10T21:11:16.570997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.504016Z","title":"Refining the evaluation of speech synthesis: A summary of the blizzard challenge 2023,","venue":null,"work_id":"3a8f67c4-87e4-46c6-83c2-902525509bd3","year":2023},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.071088Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:bd72403ec0aad3f541ad8b17d87312ec5c332b27e2bd000d2420771614e8ec3c","observation_id":"66a1c1d4-43df-4ef7-865a-2ca2977d5085","resolution":{"observed_at":"2026-08-10T21:11:16.528054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:16.412016Z","title":"IEEE recommended practice for speech quality measurements,","venue":null,"work_id":"11796ce6-1d16-4855-840c-3d86bb09a3f8","year":1969},"citing_paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:16.084748Z"},"links":{"citing_paper":"/paper/2501.05976"},"observation_digest":"sha256:42740ebd335de6cd63da13bc86c0d3560c295158e1792dbb45b1fea84636bbea","observation_id":"2edcc4ae-9673-4bbe-9100-8b42020a39c9","resolution":{"observed_at":"2026-08-10T21:11:16.445586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05976","last_updated":"2025-01-10T14:01:33Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T21:05:29.633702Z","submitted_at":"2025-01-10T14:01:33Z","title":"Low-Resource Text-to-Speech Synthesis Using Noise-Augmented Training of ForwardTacotron"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2501.05976."}