{"as_of":"2026-08-06T10:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94b72c439ac04273adb55f634ecc128d8d987234b36921db5bb83392ebf44738","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T08:18:42.002083Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:35:47.752843Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03455","snapshot_observed_at":"2026-08-03T08:35:47.752843Z","title":"Wavtts: Towards high-quality zero-shot tts via direct raw waveform modeling.arXiv preprint arXiv:2606.03455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:47.752843Z"},"links":{"cited_paper":"/paper/2606.03455","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:a88f5eb4c946b768a8e4573fe7af2c30004bb3d349a32630523cd9954158df0e","observation_id":"58bad382-20b4-4c5d-9025-9cca6096266b","resolution":{"observed_at":"2026-08-03T08:35:47.752843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.03455/citation-record","integrity":"/paper/2606.03455/integrity","json":"/paper/2606.03455/citation-record.json","paper":"/paper/2606.03455"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:fe5509ae5e0d691ef0ffdc48c6ef9f3ef36a24ff6873765cf93c8640e83c1b56","observation_id":"2ce5ec35-c2ca-49f5-a2e9-a3785716a6e5","resolution":{"observed_at":"2026-07-02T05:16:39.811706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:c0b4995b1c9c0ba75b46f2efa3b1d26e96b97dd5baaa7d2e32fdba997578fb3d","observation_id":"df0517b9-3171-4a31-ba52-fe886fb22ab1","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:9873961406729cfa6a4e3e63caf13a928505e5100aaa7cdb6cb398be2ba6973e","observation_id":"c40da833-8482-4eeb-87e7-d065caf608f1","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis.Interspeech 2021, pages 3765–3769, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:ed2ee6f12d644aeebd25ede6f8bd5e4adceaac86197203354bfd800ec65e1d2c","observation_id":"f20ae24c-d64b-47e4-828b-bd08addbe3da","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-06T08:54:58.638188Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":"2406.05370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-07-08T00:04:22.411558Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers","venue":"cs.CL","work_id":"5de8849e-7ff0-45e8-ba28-c43c1dbe805a","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:6ee5a8614f50e420489874cb1dc42d02941376d5c4f9faba3d8f8150fa4c1b17","observation_id":"16dedabf-4f7f-4a58-8162-5d6a50496af0","resolution":{"observed_at":"2026-07-02T05:16:39.798400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07963","last_updated":"2025-04-10T17:59:56Z","snapshot_observed_at":"2026-08-04T06:26:36.498042Z","submitted_at":"2025-04-10T17:59:56Z","title":"PixelFlow: Pixel-Space Generative Models with Flow","version":1},"cited_work":{"arxiv_id":"2504.07963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07963","snapshot_observed_at":"2026-07-04T20:50:11.498748Z","title":"arXiv preprint arXiv:2504.07963 (2025)","venue":null,"work_id":"1beb1a44-0887-4a87-93c8-5dca148563bd","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2504.07963","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:f74feb662d9b8d313785fe2fb8344671673d9fd66dfbc48119e6b0fef4a83172","observation_id":"6218d65a-65a5-4d6e-b949-71cc7d3294f7","resolution":{"observed_at":"2026-07-02T05:16:39.840803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-07-06T14:44:45.326057Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":"2301.10972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-07-07T18:04:00.522746Z","title":"On the importance of noise scheduling for diffu- sion models","venue":"cs.CV","work_id":"1783cbc7-505c-4ebc-82f3-86877ef131b3","year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:55b83b2ca92bafb4e14540821951269a93dd2abfb3c8b1b5daf413aaa8f7606f","observation_id":"45f9bd5b-b056-4fff-a1b4-fe1d47b823ae","resolution":{"observed_at":"2026-07-02T05:16:39.809182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a8298065c0086f344f9c4f54874738c77f61521f1b74b1282223e9c074e4997c","observation_id":"019f0ce0-9655-4450-b990-02b02b103f7d","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Large-Scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:2f455b0ba14bfc340135923741713f53a39669a219afa8cbe79e9bca7b588253","observation_id":"30a31182-3299-4d74-be02-638bed1425c0","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18822","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.577895Z","title":"arXiv preprint arXiv:2511.18822 (2025)","venue":null,"work_id":"1bcc412b-04bd-477a-87df-54e466aa8616","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:3b7ce7d0f65892931e3d1c95921f60a0888ee908cdb174c0f97de4054aea1c20","observation_id":"db452e27-0a93-4d7b-91a2-7f95867d71bd","resolution":{"observed_at":"2026-07-02T05:16:39.729433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:734e02a1f6ce2e99f917fa18d9c837310ea66ba148258ec9563ca0cb8fb30f9c","observation_id":"4da41692-3df3-48e2-8bfd-ad1512f0dbe0","resolution":{"observed_at":"2026-07-02T05:16:39.747814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Diffusion Models Beat GANs on Image Synthesis.Advances in neural information processing systems, 34:8780–8794, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0e2c7a1775fd79989f266e0384141e156a8d25e334bd90d28b4b63e1085529f3","observation_id":"900dcf1e-ac6a-4e35-a7f5-d1b23f6b59ea","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03575","last_updated":"2021-03-17T11:42:25Z","snapshot_observed_at":"2026-08-02T14:20:13.607733Z","submitted_at":"2020-06-05T17:41:05Z","title":"End-to-End Adversarial Text-to-Speech","version":3},"cited_work":{"arxiv_id":"2006.03575","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03575","snapshot_observed_at":"2026-07-02T05:16:39.836014Z","title":"End-to-end adversarial text-to-speech","venue":null,"work_id":"412cbe8a-0d86-4e02-acbb-5cca1c1ba6e2","year":2006},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2006.03575","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b4a919b4109284605276e89f2d24c5090d48715a36443fb358c4dbe38896fe54","observation_id":"df753d9d-693f-4cb8-80c7-091b7c29b7d0","resolution":{"observed_at":"2026-07-02T05:16:39.837427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:d12b15507260f32e1057d26db954eccfaf56bdbf6a1ae511bd5eb482ebe69bc2","observation_id":"84fd148e-3bfb-4b2a-b1d6-0feb44b79df1","resolution":{"observed_at":"2026-07-02T05:16:39.752712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:cf4ff5903c9dacbfcd3bd16de562058472b1b0e5544f071a22a4570d6ffb6917","observation_id":"9ce8533d-e777-4ec8-aff8-fa9b56f7776e","resolution":{"observed_at":"2026-07-02T05:16:39.729854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:faeb9779b7a4eb4f7bd858f9b3aa130a604c31fb4d537a7f66c9573252ebf7eb","observation_id":"5eeff31d-1b2d-4086-9d7f-865bcf215b6a","resolution":{"observed_at":"2026-07-02T05:16:39.732631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:009a036997ccf2aa539560e25ea5a4d5b85dba5c8dae69bede4417bcbd676c2c","observation_id":"e4f26ebf-927d-405b-8dbb-12243196a13f","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:758c97d8db0a3eec021c8d47d52f00a3f95664cac84cc06579f318a069525cca","observation_id":"cf141115-ac01-435e-baae-872024d51c15","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"E3 TTS: Easy End-to-End Diffusion-Based Text To Speech","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:4ceb9f064a74d5c3ed4b667258440771fc34a3daac1792a8990e8a9f60ea2107","observation_id":"be4c75f3-b7e2-4970-9f3d-1e313c63015b","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0f0e84241bc2f53379d4c48e3c574ef6421dfd73d859b9afdc4c1c968b72f01a","observation_id":"c853f0d5-65bb-4044-a290-c6ee6eca0a88","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.18090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.179685Z","title":"Moss-tts technical report,","venue":null,"work_id":"32ad8378-2657-4fdf-a44f-9bd70e0c2db6","year":2026},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:bba46a4e1a7839adbf9fd1362c9c3b010b8aad435c3ecded2dbffc9856f7a216","observation_id":"60db7b3b-d281-49f3-a971-56871a97da40","resolution":{"observed_at":"2026-07-02T05:16:39.777402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:84326b59da158621f85412e86ac2cccad090436748937bd60588ba67e79fc409","observation_id":"4476e729-e5e4-4ced-aa61-c1d5762c8250","resolution":{"observed_at":"2026-07-02T05:16:39.768674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Didispeech: A Large Scale Mandarin Speech Corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:c6cbd16bbe0efe4ce53a6785120f49aa374fae34a4b51601e0d2575146f175b6","observation_id":"a267b415-7ff9-4590-80c3-78217b090f24","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"VoiceFlow: Efficient Text-To-Speech with Rectified Flow Matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:96d3fb036571ceddcef1fce0f25f5fd87ee461d1c2b69ab908ae694a6c199e97","observation_id":"d1544d29-2011-4933-b183-1c149f16ce6c","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":"2406.07855","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-07-03T23:19:03.868044Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment","venue":null,"work_id":"d46897fa-6b0f-4803-b02b-59b87aee1d4b","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:f5dcec5c93b9f1a07bf5ce7823b59f4b66b0e2b7936861a9fb120150e16f3bd9","observation_id":"1eb896f0-e2f4-47a9-896e-a36b0eeb781b","resolution":{"observed_at":"2026-07-02T05:16:39.771613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset For Large-Scale Speech Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:904bb67ad1408a38127374546bb5bc665928d90b4dcbdbf541891c552f4c1548","observation_id":"399552db-214b-40ed-8347-5df86bc09bc4","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:ec0133c7598421a398c3950390fd46f1d261fabd72b2a6e9b4af512ab583c0f6","observation_id":"2d58560a-0cb9-41a2-b162-8449f87fc371","resolution":{"observed_at":"2026-07-02T05:16:39.773456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Denoising Diffusion Probabilistic Models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:4ff222f7c76ec9f8ae864b5cc0699cc3b3223ff84742358c29d2e0e3a017f235","observation_id":"e703ebeb-3f54-431f-9045-fe7dde22a6e1","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:af3fb2fd43823319ca35caf64aa916f3cd35d7032372ba1f775ca9e1b07b15f3","observation_id":"cd112712-f9d2-4ed8-acfe-95e02c0fe6cd","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Simpler Diffusion: 1.5 FID on ImageNet512 with pixel-space diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:84cd9495f2e890bbdaefb6a64d332b337b024cfc0a82de6e0b4bdcd9dc12454d","observation_id":"dcddd738-1fa2-46fe-b487-f6ee85e8a883","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b13cc7fb376019221c0a207b78ab228458e6f2374c9cdb9b6fab181f6211ea41","observation_id":"754f9d42-b7bf-4419-a134-6074274b2ad2","resolution":{"observed_at":"2026-07-02T05:16:39.774185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07506","last_updated":"2025-02-08T14:19:45Z","snapshot_observed_at":"2026-07-06T19:48:49.553384Z","submitted_at":"2024-11-12T03:03:23Z","title":"FlowTS: Time Series Generation via Rectified Flow","version":3},"cited_work":{"arxiv_id":"2411.07506","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07506","snapshot_observed_at":"2026-07-02T05:16:39.760169Z","title":"Flowts: Time series generation via rectified flow","venue":null,"work_id":"1e14e86c-c1a6-48bf-af28-b562a04ce9ef","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2411.07506","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b087ba15ba1fc6c19cc23df767e1d97b5d826228a9ab12f5c67dbab8d2a998e7","observation_id":"3c35d135-943c-4627-bae8-2c7ecbb8b3f7","resolution":{"observed_at":"2026-07-02T05:16:39.761621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:f5e7073cdfdbcc83d8becebc69f39a49938ae0f37d492c8ba3328ca73d9571de","observation_id":"78fd2b98-7bc3-4e83-8b5b-5362f05080cd","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"ProDiff: Progressive Fast Diffusion Model for High-Quality Text-to-Speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:d23c21d1e7bcead8b81962371754adaed9aa652c2084e0d430fc44e4758b2966","observation_id":"6ff2e288-0835-4dfe-8332-a924ed469f2d","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"The lj speech dataset.https://keithito.com/LJ-Speech-Dataset/, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:2bd18d558562972e14aab7369c59c71ac1bb93e76fdff7a9993f37b0bc32a661","observation_id":"adc4592b-7fb3-4b4a-8ed7-95fea4218205","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01409","last_updated":"2021-04-03T13:53:19Z","snapshot_observed_at":"2026-07-06T10:56:16.595541Z","submitted_at":"2021-04-03T13:53:19Z","title":"Diff-TTS: A Denoising Diffusion Model for Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2104.01409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.01409","snapshot_observed_at":"2026-07-03T13:28:18.721905Z","title":"Diff- tts: A denoising diffusion model for text-to-speech","venue":null,"work_id":"b784490d-242f-43ad-9192-c6711f0ac2b1","year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2104.01409","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0c9d913daf1b5698d4813fc4ef13e1de358298f386e47558c4d6c757008bf0d0","observation_id":"1548522f-cae0-4606-8915-4cccf0898484","resolution":{"observed_at":"2026-07-02T05:16:39.812312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:fa3fd7ae93b1a017f450d8dacd6884f8bb501f2ebfe23ef6f9d7539f8d42f281","observation_id":"01b87c9d-b6ed-4cd4-a947-0efb9eb284f1","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-07-06T20:42:55.911327Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0b025ba6f0b78eafe63dc68cd0bd35fa179f9e1df1134a53905c758acba7a94b","observation_id":"768e4f15-4a57-45e2-adb1-22e3139c3de8","resolution":{"observed_at":"2026-07-02T05:16:39.706809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-05T18:34:08.469382Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":"2403.03100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-07-04T11:59:50.976455Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":"4ac4c208-eb65-46ea-b155-1f2e74819809","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:fdf6a32bedccd57dfcd75c2c9c82eef37e669137c28e045a58b9c11ce392b58c","observation_id":"aa02f98f-03b1-4561-8d4f-4f7b341c4665","resolution":{"observed_at":"2026-07-02T05:16:39.706591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:e3016706a2093ef317314cfa24860927f33fc7c0d296e208153ddf84dd2daa29","observation_id":"b4eac9d8-23ab-4f62-a438-960e06501417","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:13a89429dc70c347eee93830c61a6ba4fb667a43708cb09bdae432c0b94ac765","observation_id":"ea53c29d-d671-4eec-a403-b7b6e2ef4afa","resolution":{"observed_at":"2026-07-02T05:16:39.700787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis.Advancesin neural information processing systems, 33:17022–17033, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:6ed7541f7e4e8e3e8557b340393505055d85bf0a54532c043f69e6b86425805d","observation_id":"2ee8c748-cc88-4787-a8be-21c472cebfa0","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":"2009.09761","doi":"10.48550/arxiv.2009.09761","metadata_source":"pith","pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","venue":"eess.AS","work_id":"042bbb99-f912-4aa4-aa7a-252c7b6379a8","year":2020},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a42960a53c5f1bc6940430d1aaecfe8babaeb980b8c0bd347bfc811e9aa9c4b4","observation_id":"dca840f8-4fa0-41bc-97ce-cd422fa19f48","resolution":{"observed_at":"2026-07-02T05:16:39.829738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"High-Fidelity Audio Compression with Improved RVQGAN.Advancesin Neural Information Processing Systems, 36:27980–27993, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a92573e7aacc9492579c08e7d4644abb364e5a20dba2c4135e9d4dc18108b9b6","observation_id":"e60b09b7-313d-46b8-a2ef-b546b3e1633c","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a27cd54f372baff6d0db936def8156a1ace0d3f0fefa861bd31b22243ad769b9","observation_id":"e5a1bf20-4e87-4599-a4e6-88cd7a38d279","resolution":{"observed_at":"2026-07-02T05:16:39.768082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:705f581ef2cd84bf6ca8a612893e524432447a61499eadead2f2c7d00ba657d9","observation_id":"93762c56-0f5f-4aaf-b7f8-003f12fb0d8f","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b433e984ab7142f7670625e338d190a159bfb810e148d29b3ebfb2c1dd43166f","observation_id":"0fc37142-53f8-46bb-83f4-d1143d9721ee","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:ffb11c8198eb9f706bdb4bcecf9420db05a7141fcac81bb591eded230ae8fc43","observation_id":"f58b15e8-af53-49b9-9393-c734f69dbe9a","resolution":{"observed_at":"2026-07-02T05:16:39.735273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a3d8842dd863862c6529a9d33bcc567627db08628e0de564c01af6aec14f3fb0","observation_id":"f277ce7e-50df-4401-9254-c44410190db8","resolution":{"observed_at":"2026-07-02T05:16:39.761116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16852","last_updated":"2022-07-01T18:20:39Z","snapshot_observed_at":"2026-07-06T12:55:09.694305Z","submitted_at":"2022-03-31T07:25:11Z","title":"JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to Speech","version":2},"cited_work":{"arxiv_id":"2203.16852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16852","snapshot_observed_at":"2026-07-02T05:16:39.838655Z","title":"JETS: Jointly training FastSpeech2 and HiFi-GAN for end to end text to speech.arXiv preprint arXiv:2203.16852, 2022","venue":null,"work_id":"0186dc59-da98-4fcb-9d09-47707ca45c0f","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2203.16852","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0fc79a895b3f6bb022056f061689f6e55d53353de093c99bd9b34749e1d09fb6","observation_id":"44f790ef-2204-43c1-9598-ef8a19186413","resolution":{"observed_at":"2026-07-02T05:16:39.840425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:d27947982800668a2d655df8ed73174e5fb54ee622aedf2756c2ed0a367f6a07","observation_id":"d93cfb6a-c520-4951-8abc-63c44a4623ad","resolution":{"observed_at":"2026-07-02T05:16:39.855011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:9d382ef6c738a19cb1248ae8f122121e65e24c9bfa8b480f4cd2a2a470858069","observation_id":"9d1f613a-e5f6-4e7a-93fc-7039f1464f42","resolution":{"observed_at":"2026-07-02T05:16:39.832283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:e4b0abfffc31a106870fea9ede743fda4f1901fb9ec7e875a0bd1dff26b5cd7d","observation_id":"5d82fe48-e325-4ff3-9ad9-036537040823","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19365","last_updated":"2026-04-08T04:08:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T17:59:06Z","title":"DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation","version":2},"cited_work":{"arxiv_id":"2511.19365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.19365","snapshot_observed_at":"2026-07-08T07:34:43.075395Z","title":"DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation","venue":"cs.CV","work_id":"7e4eb349-4cb7-4a73-92eb-800ed71ce9ab","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2511.19365","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:784194e25c271433a29dbc4b18a1df1b5f3ed113a91914939b7f2cd0e2fe66f8","observation_id":"7f3c258a-852a-4242-a01d-cc80ea235884","resolution":{"observed_at":"2026-07-02T05:16:39.826742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02493","last_updated":"2026-05-07T09:10:25Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T18:59:42Z","title":"PixelGen: Improving Pixel Diffusion with Perceptual Supervision","version":2},"cited_work":{"arxiv_id":"2602.02493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02493","snapshot_observed_at":"2026-07-07T15:43:53.776394Z","title":"PixelGen: Improving Pixel Diffusion with Perceptual Supervision","venue":"cs.CV","work_id":"d0f61c2d-e799-45b9-a3dc-9ed3e2fcf55f","year":2026},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2602.02493","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:4cc7f35a3fa9e5232b685f86c644fa03727a6ce161aba228b4cf9efd6c8d096f","observation_id":"ffcf786b-c72f-4b11-a3fa-2347c54ae5f0","resolution":{"observed_at":"2026-07-02T05:16:39.845806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Matcha-TTS: A Fast TTS ArchitecturewithConditionalFlowMatching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:8eab0c2127750d245a52afb66575b4e1aca8f06749c4072926b804a910c160df","observation_id":"f31c0db0-3543-4d95-a6b7-28cb58225332","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"LibriSpeech-PC: Benchmark for Evaluation of Punctuation and Capitalization Capabilities of End-to-End ASR Model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:16757170dabd5a200dc47dda7e1ad6a9184db1272136f5670adf527e13dd704c","observation_id":"8cdafe16-651d-49e0-a531-ad43a798df9f","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Improved Denoising Diffusion Probabilistic Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:6d146605e78f605653f2057ceee7c191474fd700ab718545089aebb31907f973","observation_id":"ba7daf40-9071-45a4-80c3-516cde68a34b","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:58:08.336166Z","title":"Semantic-vae: Semantic-alignment latent representation for better speech synthesis","venue":null,"work_id":"635253a6-c06b-42dd-a3dc-66a02d59a8e6","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:4ca83627a708339992a1812c9fe102617b761d4d4115c85e704a0fd1331b67d4","observation_id":"f1c769f9-a12d-437b-bae7-50e3205c6852","resolution":{"observed_at":"2026-07-02T05:16:39.837808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Parallel WaveNet: Fast High-Fidelity Speech Synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:bcdf9147205e4d08bae638d544eb54bf5ebe7be423cd81b856ff0de07dc1e33f","observation_id":"0a9c96eb-7ed9-43d8-aa76-5bd61c4eefa5","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Scalable Diffusion Models with Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:252bd36f7d1d3f1bdea4f2712b1ab9cf918b92cd7b0525e28b1dd1e91edd22e8","observation_id":"ccc58cfe-27a9-4a9c-b488-67a14d863b52","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"VOICECRAFT: Zero-Shot Speech Editing and Text-to-Speech in the Wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a3115b8eb8358ec4c0a2220122c981b97e88a63187caa6569b272f5055aa2136","observation_id":"1288d50c-9117-447c-8a9e-df7df0f944e9","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"VibeVoice: Expressive Podcast Generation with Next-Token Diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:f7b93fe3d711447be7055cee33c601c16c98409f0a91ec5a867ea602f865577e","observation_id":"0ea07226-6a13-4d74-bdd8-483523798cf9","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.07281","last_updated":"2019-02-22T00:22:40Z","snapshot_observed_at":"2026-07-06T06:51:06.006867Z","submitted_at":"2018-07-19T08:15:41Z","title":"ClariNet: Parallel Wave Generation in End-to-End Text-to-Speech","version":3},"cited_work":{"arxiv_id":"1807.07281","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.07281","snapshot_observed_at":"2026-07-02T05:16:39.831097Z","title":"ClariNet: Parallel Wave Generation in End-to-End Text-to-Speech","venue":"cs.CL","work_id":"069010b0-bccc-474a-a5e5-c36cddf9d1b3","year":2018},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/1807.07281","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:901ca406d4a76032487d9363fff96d1e72aedb8e989c98823d171e6500871a1f","observation_id":"61467cab-e5f6-43e0-8cf1-f7820e9b05e1","resolution":{"observed_at":"2026-07-02T05:16:39.832450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:017ea896fe379125db983d940f84f757abf93f460efcb9efbca6edde3aeba4d7","observation_id":"8d87da6c-ac09-46e4-84f8-6fc00f5f085e","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b52be376ab0f3601fe13ce5860278d4c67e49f23f61307510f64bb79a8888a68","observation_id":"b353a749-a4b4-4144-924d-9f88eb68b7c0","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"FastSpeech: Fast, Robust and Controllable Text to Speech.Advancesin neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:f9d157468f3fae87306030d52c204700d6fb03b0fd768f213fbf1f490ca11690","observation_id":"3be336fa-3726-4214-87ef-5c60f15dba00","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:24b237102c65d1ea5f1658135e3ad39f9f529ac4abd05e1302077177367c786e","observation_id":"588b3f10-0b4d-43f6-9633-d1741589302c","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:4454aa85c5ac90751986b2141464d2b8355de89a73e560fb9c01cc1a87d20308","observation_id":"387105e9-6335-4635-981d-487ee250f320","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:5b104c0ac114c971679a3895256157a16fa13c2d229d786e2d592e64d8b7c454","observation_id":"89d42bfb-bd2b-47e9-9828-db643118c589","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:78997c9a86cd1f4d69d39e121fea7ce4c85ce464ccbab0684d01ca795aac9cfb","observation_id":"e2124967-1ff3-4a58-99ea-ec40a2394c72","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:348b563af993f83273ae394880317c753c3bc351efc93b8e24436bd409e6ebc1","observation_id":"311e960d-e47a-4882-9ac5-9415515192ac","resolution":{"observed_at":"2026-07-02T05:16:39.843462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00385","last_updated":"2025-05-31T04:31:02Z","snapshot_observed_at":"2026-08-02T00:29:49.474061Z","submitted_at":"2025-05-31T04:31:02Z","title":"MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2506.00385","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00385","snapshot_observed_at":"2026-07-02T05:16:39.815988Z","title":"Magicodec: Simple masked gaussian- injected codec for high-fidelity reconstruction and genera- tion","venue":null,"work_id":"7df8946f-a15e-4e65-8ea9-714ad2c0b1f9","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2506.00385","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a8c7365547bb5a2d061f8182cf68d56da8d600d010833a9ead74948efad3c93c","observation_id":"ee1ef2a2-d58c-46b0-a5ef-149e2bfa0a28","resolution":{"observed_at":"2026-07-02T05:16:39.817490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-Guided Sequence Reordering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:9d8d12abd19198db11ec819116127a851e7f02540079aa7c9607494561287355","observation_id":"ff3ca7c0-f631-4154-b5a5-a89225372a12","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Generative Modeling by Estimating Gradients of the Data Distribution.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:91944c9725ca6b6d605e076d9ddaa86655a916d907b9abb61ca198347bc3755a","observation_id":"22236b6a-a76d-43f3-ad87-a72d169c297e","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:985e6370d42991a1b6fd774ef66e99f87b1476b18dfff2a98508ce0ed7aa7727","observation_id":"adbbee38-7e5a-4d54-bd29-5caa7eace8a8","resolution":{"observed_at":"2026-07-02T05:16:39.814716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"RoFormer: Enhanced transformer with Rotary Position Embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:3ca121ba15bcce8b7f833898e41c84047b5099ec8a28fc78b1bfa3e218754648","observation_id":"5d0d0f5c-d8f8-4536-b140-43772a28ffbb","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02407","last_updated":"2025-04-22T10:49:31Z","snapshot_observed_at":"2026-07-06T21:03:35.698923Z","submitted_at":"2025-04-03T08:57:15Z","title":"F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization","version":3},"cited_work":{"arxiv_id":"2504.02407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02407","snapshot_observed_at":"2026-07-04T12:19:49.614306Z","title":"F5r-tts: Improving flow matching based text-to-speech with group relative policy optimization","venue":null,"work_id":"000d83f8-4094-49b2-8d0e-83a5f07aa87e","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2504.02407","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:80a9caff0226a25f12b6bc705816933d8304a9df789f7d89bb58049aadd5e564","observation_id":"47596943-c5bb-40eb-a453-69a0a968f8d3","resolution":{"observed_at":"2026-07-02T05:16:39.779566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"STFT Spectral Loss for Training a Neural Speech Waveform Model","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:a6d1bbb6248aea0b599243902a9fe50c777671cbf4fc80d554296c20a97e020b","observation_id":"de6a525a-0689-434a-89d3-d92d240bb87a","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"NaturalSpeech: End-to-End Text-to-Speech Synthesis With Human-Level Quality.IEEE Transactionson Pattern Analysis and Machine Intelligence, 46(6):4234–4245, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:6461e86ccc548728141c12fabe84ecd0ba304d7ebc041f5256681c4189bb1978","observation_id":"5e94efc7-e50f-458e-9a74-c7d54a720bc2","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Relay Diffusion: Unifying diffusion process across resolutions for image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:8d77024d9327ff9924cc8cab714e42776b907e64d29cdff47bbf5fb7833edf26","observation_id":"e90ce36f-5056-4f40-a957-93a7fe4a7fd4","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:610f6f112f6da95e639d3709b7d3f8bcaf8da9f83f4bfa52bf26c027fa90083a","observation_id":"c90408f6-ba47-4573-8ab5-066a2e66222d","resolution":{"observed_at":"2026-07-02T05:16:39.856964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:61a242dc5a871f3580650d15085f831b99409a4eb9e08e3d98cb4102c11c2660","observation_id":"613fc9b5-8e3d-446c-9ab3-4b836eb18555","resolution":{"observed_at":"2026-07-02T05:16:39.813970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23268","last_updated":"2025-08-04T02:46:11Z","snapshot_observed_at":"2026-08-02T00:59:17.582417Z","submitted_at":"2025-07-31T06:07:20Z","title":"PixNerd: Pixel Neural Field Diffusion","version":2},"cited_work":{"arxiv_id":"2507.23268","doi":"10.48550/arxiv.2507.23268","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23268","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixnerd: Pixel neural field diffusion","venue":"ArXiv.org","work_id":"74b9a257-28df-4dea-85a1-68d091aba6b8","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2507.23268","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:6f6a72807b0bfc3b98e9222342a768744a470afdc85f975334eb640cb7457cba","observation_id":"550fec21-15f1-4126-bb4e-0a2ef6a59556","resolution":{"observed_at":"2026-07-02T05:16:39.848770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T05:16:39.780672Z","title":"M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis.arXiv preprint arXiv:2512.04720, 2025","venue":null,"work_id":"659a7817-ce61-4214-8962-a0acf44cb195","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b986cf01a479c4aedeba3642ff6d53ea97077ac13acf9f5a50652c1cf4214433","observation_id":"31ea4afe-d4b8-4ede-a07e-8bee0a173d3f","resolution":{"observed_at":"2026-07-02T05:16:39.782209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:2afba8a3cbd0aea7c228f139f145f562bc464de02a72d39faa9ad7cb66b4e57b","observation_id":"8665f702-ea46-4599-849c-b89776716389","resolution":{"observed_at":"2026-07-02T05:16:39.744079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:47d70a5c60a6aa099c97d149c81f44bd1be5cc638be9218f9bd2d3a7e6c49b51","observation_id":"2ee16ea4-22a0-4f0d-8c81-d09cd0a93592","resolution":{"observed_at":"2026-07-02T05:16:39.738763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Wave-Tacotron: Spectrogram-Free End-to-End Text-to-Speech Synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:aa449ce631f0761383831d702ddd7c6a3bba2c50c1be3acbb9296f6565ea4d4e","observation_id":"8a7b4e12-1723-4df8-8762-75ccc3d3aaf0","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"ConvNeXt V2: Co-Designing and Scaling ConvNets With Masked Autoencoders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:93f06eed2f01d1c47bd338e811e8907e04e96f5871fa50debc771a1e787e1678","observation_id":"69a98e8a-b3aa-49cf-8309-6eced1dc7dc0","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:7044cf156b8cc3eb2d26351eb95d6af87ce5ec853acd1d40f8d6eb1640a93fca","observation_id":"7a39acb0-45ea-42ea-afc2-6d1f97b3b7f3","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0136bfe124c8b1fcd371c4586ab18cc2802cf4423b33eb522a606001a8a3b117","observation_id":"7403fb74-abe3-4dee-85de-5ee6503270fd","resolution":{"observed_at":"2026-07-02T05:16:39.764041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.29339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:57:20.082708Z","title":"Longcat-audiodit: High-fidelity diffusion text-to-speech in the waveform latent space","venue":null,"work_id":"3268c6b6-1911-40ce-b434-ea86719d30a2","year":2026},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:12024d77a9e5b94effcb94a4a9fa7e0e31a65e00ee6d7f6c13d3316e64d9f1d3","observation_id":"ba13b69e-2615-4a35-acbc-eb134b1f42a9","resolution":{"observed_at":"2026-07-02T05:16:39.753373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:2aa924ae09f448e26a1fe86e88b348c89f48f26b9152ea87c4ec0e88647db489","observation_id":"5f5e3a2c-dde7-499b-9c45-54bcf64c956c","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"Parallel Wavegan: A Fast Waveform Generation Model Based on Generative Adversarial Networks with Multi-Resolution Spectrogram","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:4d3f2ad084ea0fcb6805d59b6bcb3167038b7490f38f0e8e96381a5def767b43","observation_id":"08f36623-25f8-496c-a33c-5567b5ac41d7","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T05:16:39.748419Z","title":"Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation.arXiv preprint arXiv:2512.23278, 2025","venue":null,"work_id":"8bc782ee-d76c-4af3-aa74-07977d6b9216","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:8ec7edd92da934f88d4af0f108baeebc8c6196737d15e01d94a9d6c152d59d73","observation_id":"b09f98b4-38eb-4f9f-9700-9e4c990730bf","resolution":{"observed_at":"2026-07-02T05:16:39.750020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2502.04128","doi":"10.48550/arxiv.2502.04128","metadata_source":"pith","pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":"eess.AS","work_id":"7e72b079-ae3c-4584-aead-bab435ab5950","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:98cea15be72f6f5e36ad17ea351d8b9ed2f7ae82ca4e8fc295cd950530c765a7","observation_id":"c53abe59-20e1-4186-af2d-831e5e1d587d","resolution":{"observed_at":"2026-07-02T05:16:39.803185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20645","last_updated":"2026-04-16T17:04:25Z","snapshot_observed_at":"2026-08-03T04:32:54.764263Z","submitted_at":"2025-11-25T18:59:25Z","title":"PixelDiT: Pixel Diffusion Transformers for Image Generation","version":2},"cited_work":{"arxiv_id":"2511.20645","doi":"10.48550/arxiv.2511.20645","metadata_source":"pith","pith_arxiv_id":"2511.20645","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"PixelDiT: Pixel Diffusion Transformers for Image Generation","venue":"cs.CV","work_id":"7d675dc1-dc0d-4f02-81fc-aba652d0753a","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2511.20645","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:cc5537f9c1e6321933e8e56307dbd0efc8c587c2959b9ec0b5693cfdd117909d","observation_id":"e32fd3f1-d01d-4f9e-b79a-365fa6e14786","resolution":{"observed_at":"2026-07-02T05:16:39.779918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T08:18:42.002083Z","title":"SoundStream: An End-to-End Neural Audio Codec.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30: 495–507, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:5c9f92c3224e9ef96f21ac72a92a32f0e863fbad9349c414dc61bb7df6341c20","observation_id":"1f0c0946-cdc3-45b3-9578-841c2d31ba8f","resolution":{"observed_at":"2026-06-28T08:18:42.002083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-05T08:02:17.848918Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":"1904.02882","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-07-10T15:47:23.389293Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","venue":"cs.SD","work_id":"3a241487-e181-45f0-bf68-c4a23cbb5674","year":2019},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:1af24c101c8bd1ce84ae8d50aeca5704bfc0dc1f62515de4b758e954e8592c6d","observation_id":"fcd78baa-5689-41d6-aa07-625d33992412","resolution":{"observed_at":"2026-07-02T05:16:39.759013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06329","last_updated":"2025-06-06T17:45:35Z","snapshot_observed_at":"2026-07-06T20:03:47.277630Z","submitted_at":"2024-12-09T09:28:06Z","title":"Normalizing Flows are Capable Generative Models","version":3},"cited_work":{"arxiv_id":"2412.06329","doi":"10.48550/arxiv.2412.06329","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06329","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normalizing flows are capable generative models","venue":"arXiv (Cornell University)","work_id":"8c467501-052b-4c30-8614-67496d6433ec","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2412.06329","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:b9cb30f3b118345b08b491240b0ee4a54bc0a3545772cde6837ab3163ecd5f64","observation_id":"005df705-46a5-4519-af3e-ae2234d98c48","resolution":{"observed_at":"2026-07-02T05:16:39.794214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":48,"verified_fuzzy":0},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 1 inbound Pith citation observation for arXiv:2606.03455."}