{"as_of":"2026-08-09T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44e12b8c3bfedbfb557c90dfa2569c6268f20a22de5287fbdd7ce04f69feb445","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:01:52.889397Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:18:22.911332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:47:19.713205Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2508.19098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19098","snapshot_observed_at":"2026-07-02T19:47:19.713205Z","title":"Clear: Continuous latent autoregressive modeling for high-quality and low-latency speech synthesis","venue":null,"work_id":"82623a58-4487-4554-87ac-e350a400800d","year":2025},"citing_paper":{"arxiv_id":"2604.12383","last_updated":"2026-05-25T07:44:26Z","snapshot_observed_at":"2026-08-02T09:36:59.041269Z","submitted_at":"2026-04-14T07:17:55Z","title":"On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:30:58.664375Z"},"links":{"cited_paper":"/paper/2508.19098","citing_paper":"/paper/2604.12383"},"observation_digest":"sha256:366da66eb94210de2e242c8f69d55660ff33f452ef33d35db17ada141c7b219b","observation_id":"f877a92c-605b-4346-bb9a-935b28c1d987","resolution":{"observed_at":"2026-05-11T10:25:59.528620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2508.19098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19098","snapshot_observed_at":"2026-07-02T19:47:19.713205Z","title":"Clear: Continuous latent autoregressive modeling for high-quality and low-latency speech synthesis","venue":null,"work_id":"82623a58-4487-4554-87ac-e350a400800d","year":2025},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2508.19098","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:7aca549b02516b28d011a20019f2e977d04933a37f5d81bf575c51d17df25580","observation_id":"c6001f44-543d-4894-8ba1-62ff1c34b900","resolution":{"observed_at":"2026-05-19T19:02:43.569018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2508.19098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19098","snapshot_observed_at":"2026-07-02T19:47:19.713205Z","title":"Clear: Continuous latent autoregressive modeling for high-quality and low-latency speech synthesis","venue":null,"work_id":"82623a58-4487-4554-87ac-e350a400800d","year":2025},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2508.19098","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:811c02e5f9606b0a701d64ae2a62be5868792e6f5a6be2d5622902a9ebaece19","observation_id":"6947956a-a27e-4039-9221-c3793b937b2b","resolution":{"observed_at":"2026-07-02T19:47:19.714861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19098/citation-record","integrity":"/paper/2508.19098/integrity","json":"/paper/2508.19098/citation-record.json","paper":"/paper/2508.19098"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T16:01:52.500071Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.500071Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a5f5256b5a21624b784c8f800aa872767787e04a4aa639a71ade7feea487ab8b","observation_id":"958bcb74-b0d2-4b6d-b750-76a12a654377","resolution":{"observed_at":"2026-08-05T16:01:52.500071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.879054Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing, May 2022","venue":null,"work_id":"f3685012-da9e-4213-bff6-b5419225baa0","year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.506197Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:766c13e2772f0dc5ae2a605567573e2cd0cbe59569bb8b8c29e5c5e24d95f146","observation_id":"ce96466a-3f3c-498a-b4c6-699d1b217b7a","resolution":{"observed_at":"2026-08-05T16:01:54.886110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.857648Z","title":"Rethinking lossy compression: The rate-distortion-perception tradeoff","venue":null,"work_id":"f828f8cf-af17-454e-a4fc-609ccd978a7e","year":2019},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.511486Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:504b4a9d90289307ccbd7cdea5735dc9d4cd39d1c58346f13caf27335806522d","observation_id":"ee274c21-6231-4378-b2c4-d7d16bd2c174","resolution":{"observed_at":"2026-08-05T16:01:54.863775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.837213Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"e7d6af08-a9ba-44ba-a94a-a8ec9a665e5f","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.517582Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b23066f4253730aab35b5d504ddf1235c220a36a00687ddea103069db69bc3ec","observation_id":"9568581b-d05c-427d-bcda-b47528a0d1a1","resolution":{"observed_at":"2026-08-05T16:01:54.843458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.817435Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models, April 2025","venue":null,"work_id":"d37dbf2a-f218-4c4e-90dd-59cba0445718","year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.523257Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a5b6ea05cd19c0c88ac238fcf975ac571b96324f38b534deaaf59c942cd5be98","observation_id":"90aa4c5a-2bd8-46eb-8908-16a6a917b2c7","resolution":{"observed_at":"2026-08-05T16:01:54.823149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.796897Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing","venue":null,"work_id":"521e1f7c-3954-4bdb-9fdf-aff91b440815","year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.528372Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:8a88eab47be82297c3ceeb530acac8a21d8075ab220fc44fa2a40444041b5f16","observation_id":"19a81d71-38a8-4e58-8a48-58b6b09987ee","resolution":{"observed_at":"2026-08-05T16:01:54.802618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-05T16:01:52.534536Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.534536Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:40dbf83fcac2b753fa876e901b26f58b177398995de92432a7638c3cb978dd47","observation_id":"53ce4747-da48-485a-b0f5-1a133c8439b7","resolution":{"observed_at":"2026-08-05T16:01:52.534536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-05T16:01:52.541441Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.541441Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:1249ac878bf90a9a344351a8de76718ba6a2248011e19adb34b475ea73cb4419","observation_id":"745110e8-993f-4339-8a4b-51e03547cfbb","resolution":{"observed_at":"2026-08-05T16:01:52.541441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.777425Z","title":"High Fidelity Neural Audio Compression, October 2022","venue":null,"work_id":"ffd1f1d2-df30-480f-989d-100baebe06d7","year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.547263Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a8cb44edc957d7006ee5b20e28e51f294f64b209d27f62d4d51cd7d9d80bf058","observation_id":"57fdbef0-4a32-4f96-8ff3-dfb48569668b","resolution":{"observed_at":"2026-08-05T16:01:54.782035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T16:01:52.553461Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.553461Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a18acfa17ff356259c677474350d46c733e4d9dca69f96260c22a023fa96e8c1","observation_id":"14557648-9203-4b77-94aa-6dde161d30c6","resolution":{"observed_at":"2026-08-05T16:01:52.553461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T16:01:52.558566Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.558566Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:d66caff181e371dd9e48dc0a02149449acb986f56126c792b1eb0dad8ac8023c","observation_id":"5adda8a6-57e9-4477-82d1-a3a07bf6a619","resolution":{"observed_at":"2026-08-05T16:01:52.558566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-05T16:01:52.564223Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.564223Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:bdb1cb46007555bbd2b8b01f0201b28d48d57be8b754b2346ffc1fa7e219f102","observation_id":"b85f4d6d-3bfa-4a61-a653-8b689b6c30b2","resolution":{"observed_at":"2026-08-05T16:01:52.564223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.761728Z","title":"Taming Transformers for High-Resolution Image Synthesis","venue":null,"work_id":"f5952b39-61f1-428e-87de-711a0bf6dc39","year":2021},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.570589Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:700bc3c72be94754b93589bc83de817b4f7a171ea0cfe735be4a23ad57674163","observation_id":"67b6aa19-bfba-4ecf-9d2b-7792931a7eb6","resolution":{"observed_at":"2026-08-05T16:01:54.766551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-05T16:01:52.575279Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.575279Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:8be13b86e5b9ac1214d2fee43f2599ea1437076206c6f62600bc558f4f5148e8","observation_id":"ae6eafc0-1ccf-4c0c-b577-b0739db50a6e","resolution":{"observed_at":"2026-08-05T16:01:52.575279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-07T16:14:25.577993Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-05T16:01:52.581625Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.581625Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a7d3838e88bf7ad7164ccd38b1fd18673d7c7c631c6bafec9b5ff83435a52e70","observation_id":"fb7fc861-e8fa-4c79-a6fd-53f57b73239f","resolution":{"observed_at":"2026-08-05T16:01:52.581625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:52.587056Z","title":"E3 TTS: Easy End-to-End Diffusion-Based Text To Speech","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.587056Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:5a0558ed219e3ae058bf14100e1930ee1f8f819d56c5b4f6dda08d674bcdc394","observation_id":"44e1c1ad-4a1d-4d7f-8636-d23a5b4e962c","resolution":{"observed_at":"2026-08-05T16:01:52.587056Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.744733Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":"4a1ee417-a507-447f-b785-98d47f4e76d5","year":2014},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.592009Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:5d4868b810409f6a98f8be8c9099632ff824419ff84c13c696cc4909369177ee","observation_id":"b0c4c34e-f724-4f59-97a1-ce13369336bd","resolution":{"observed_at":"2026-08-05T16:01:54.749600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-05T16:01:52.598217Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.598217Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:319f1497226caf3e5e46d9acda51df846593eb4a6a93c6bf65f606b0ac3ead9f","observation_id":"04207df1-0bfa-4b6d-9458-20207a08e057","resolution":{"observed_at":"2026-08-05T16:01:52.598217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-05T16:01:52.604143Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.604143Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:99efb5b4d7c5444f14e97b5cb27ce3bae145b864a9d0da9eb12b31d83e6ad76c","observation_id":"bb6b0037-dbd3-4354-9c35-d3fcd46dd6fd","resolution":{"observed_at":"2026-08-05T16:01:52.604143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T16:01:52.611342Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.611342Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:8fb57f130dfab6bc5f2887724b2c2468ea56765bf99473e82fc7a655ab22bc5b","observation_id":"e65ad875-0b89-4e36-a11c-da80d888d4e1","resolution":{"observed_at":"2026-08-05T16:01:52.611342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.723945Z","title":"Straightening out the straight- through estimator: Overcoming optimization challenges in vector quantized networks","venue":null,"work_id":"a780fb37-c7b8-4c17-a648-473daa598267","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.617729Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:dba0bb85f95153c23fb7c3a81b45889a1a1e5aecf7e1ba5b596308146fa0c848","observation_id":"aef40a6e-b847-4b40-8e4c-da3022bfe9f7","resolution":{"observed_at":"2026-08-05T16:01:54.730366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.705614Z","title":"Ditar: Diffusion transformer au- toregressive modeling for speech generation, 2025","venue":null,"work_id":"ba06c27b-8a7a-4873-86a8-e0a3831c3d14","year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.622999Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:de0c5c5b0118363616f98bded78b0449f19df75b08e48c22f90e316a0708e907","observation_id":"7833edb7-8922-4c02-aa15-c5cf3f7ac512","resolution":{"observed_at":"2026-08-05T16:01:54.711234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.685475Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis, April 2024","venue":null,"work_id":"f2bbcdd3-ac3b-4b93-9531-b5b285668ba4","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.628628Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:4d651a65d94f3502d13721eb2935ef896af06aceacbe12a24d847d44d6ae2725","observation_id":"2e5b129c-c9c6-4923-bcd8-3039bb2510ee","resolution":{"observed_at":"2026-08-05T16:01:54.692761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.666772Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models, April 2024","venue":null,"work_id":"9559dce8-e805-4f15-a159-a0ab250004cc","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.634749Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:e29f9fe1f1b25c659cf939cde4c23bc61c9940cf7fe7895d4b17bb2d3ab7d906","observation_id":"31454201-0a0c-44ca-837f-36efe3eea5f1","resolution":{"observed_at":"2026-08-05T16:01:54.672734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.645446Z","title":"Libriheavy: a 50,000 hours asr corpus with punctuation casing and context,","venue":null,"work_id":"eb7f7f66-7c28-43b9-ac9c-39b26f61a739","year":null},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.639373Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:3f428b0e7a3e137a60a2aa67fc8338f89647fad8bae4c972da211fbed8a66c9d","observation_id":"84602fb7-7bf0-4493-9b41-12650abc3872","resolution":{"observed_at":"2026-08-05T16:01:54.654066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.625882Z","title":"Analyzing and Improving the Training Dynamics of Diffusion Models","venue":null,"work_id":"2645efd1-0f6e-410a-954b-99a7b95c909c","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.650093Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:ae2b489707c4af3643028679b931c7606518cc7d50aa49914341e29c5020381f","observation_id":"fa7fcdce-99c5-42f5-a527-58038e72b5a1","resolution":{"observed_at":"2026-08-05T16:01:54.633340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02781","last_updated":"2024-04-03T14:52:20Z","snapshot_observed_at":"2026-08-09T09:36:21.179646Z","submitted_at":"2024-04-03T14:52:20Z","title":"CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02781","snapshot_observed_at":"2026-08-05T16:01:52.654964Z","title":"Clam-tts: Improving neural codec language model for zero-shot text-to-speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.654964Z"},"links":{"cited_paper":"/paper/2404.02781","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:ab74a419d01606d64ba3b384ba526b30f296e14c2e2d7c15a60b45f8dcd5feac","observation_id":"bc03816e-8704-4a65-a3bf-6d7772f6b3be","resolution":{"observed_at":"2026-08-05T16:01:52.654964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.600043Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","venue":null,"work_id":"51fde5ff-bf53-4e4b-b7d3-33678309ca70","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.662364Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:affebcc6fb4a3de84b437a417cda212b3448f5bd616f6609fb6365bd7587c3fd","observation_id":"37e0749a-329f-4bde-968a-37b2e22944bd","resolution":{"observed_at":"2026-08-05T16:01:54.610995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.580242Z","title":"BASE TTS: Lessons from building a billion- parameter Text-to-Speech model on 100K hours of data, February 2024","venue":null,"work_id":"57a082c8-21cf-4534-b31b-51d6cf18c9cd","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.668210Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:db360ac758571573a9f560aab9d36c4e992750509b9c8060f566311c9eb68b8d","observation_id":"5cfa107d-b223-498f-870b-eec2eb05cec5","resolution":{"observed_at":"2026-08-05T16:01:54.586357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.561076Z","title":"V oicebox: Text-guided multilin- gual universal speech generation at scale","venue":null,"work_id":"4e88771c-f8c2-443f-b914-6b0d6ec1b07e","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.673697Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:7be0bb9b5ad5efde9e8e1ef8670539191c8e8c7b82d66e2e24f9121eb97829c4","observation_id":"d5de89ad-5244-4d9f-98e4-a6e6c7f4439d","resolution":{"observed_at":"2026-08-05T16:01:54.567050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.530419Z","title":"REPA-E: Unlocking V AE for End-to-End Tuning with Latent Diffusion Transformers, April 2025","venue":null,"work_id":"ed234561-0ac6-431b-97da-29df5fb137b1","year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.678990Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a325aa4f239e647de8ff560ce4fb334341d1d81cb857e9156532cc0c64e1650b","observation_id":"eebed74a-9958-470e-95d0-23b257fd04be","resolution":{"observed_at":"2026-08-05T16:01:54.549525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:52.684377Z","title":"Neural Speech Synthesis with Transformer Network","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.684377Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:cf3adbe79ac0abbfce7db82714d52a987ae3fd1c47789fa5907d59122acde31b","observation_id":"91a25cc2-7bd8-42d5-8329-6c8aba46c0a8","resolution":{"observed_at":"2026-08-05T16:01:52.684377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-05T16:01:52.689870Z","title":"Autoregressive image generation without vector quantization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.689870Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:61a8aed0d0b6ec932231ed86833a726aad52dfa7f0231e13bf2b93b4e5e7fb2b","observation_id":"6e8c5c59-9594-4e39-b972-1cd22596e5c6","resolution":{"observed_at":"2026-08-05T16:01:52.689870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T16:01:52.695773Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.695773Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b85213d1c02343b614466748b8ac99e944c7397f382538c820ed1827f9cbc834","observation_id":"54dc638d-e939-4cb4-8af7-14894dfa04f4","resolution":{"observed_at":"2026-08-05T16:01:52.695773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-05T16:01:52.701539Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.701539Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:62915ea48f319c19dfddd73eac1ba73ded288dd1e4facc7b4836d211ad30f3d3","observation_id":"9fbfafa0-f539-453a-95f2-15b3161ffe4c","resolution":{"observed_at":"2026-08-05T16:01:52.701539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.508807Z","title":"LibriSpeech-PC: Benchmark for Evaluation of Punctuation and Capitalization Capabilities of End-to-End ASR Models","venue":null,"work_id":"f93a79dd-b607-449c-b336-c5f3a9102fd8","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.707422Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:c1e3e1971de065c05c34043780e6953f48dae53d5138515c20990a77253beafd","observation_id":"439fbd8b-bb4f-46e5-95be-fc4997f507ad","resolution":{"observed_at":"2026-08-05T16:01:54.516431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-05T16:01:52.712652Z","title":"Autoregressive speech synthesis without vector quantization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.712652Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:06e7ffb5b710834909cb78bb73186e75968c1236ca639b396ec0549f1f8e17be","observation_id":"95e71bba-b9f8-4aa8-9666-b8f109020006","resolution":{"observed_at":"2026-08-05T16:01:52.712652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.486612Z","title":"Finite Scalar Quantization: VQ-V AE Made Simple, October 2023","venue":null,"work_id":"a98416be-e3b4-4e09-b622-7641ca48b2ff","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.717776Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:0990f2bdd61c0d532c9499999851c1969d958a5a9397ca9bb098338c69f4b0e5","observation_id":"40e3b997-26db-4c2a-bd81-b5ea98b4355a","resolution":{"observed_at":"2026-08-05T16:01:54.492317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04380","last_updated":"2024-10-06T07:20:58Z","snapshot_observed_at":"2026-08-03T07:51:42.862937Z","submitted_at":"2024-10-06T07:20:58Z","title":"HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04380","snapshot_observed_at":"2026-08-05T16:01:52.722764Z","title":"Hall-e: hierarchical neural codec language model for minute-long zero-shot text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.722764Z"},"links":{"cited_paper":"/paper/2410.04380","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:996983b277adeeb35d5cd409f0010e8520a700cd965045c802337eceb422483b","observation_id":"ca2f0a00-cd01-453c-ab18-6e562a1fbf90","resolution":{"observed_at":"2026-08-05T16:01:52.722764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.464922Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"98300c29-ddef-42ba-812f-f14d6b2efeac","year":2015},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.728945Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:06654f51d01fb42037b011e595125dbebc3422861a0805c31f1210d861a76b43","observation_id":"1c9ac590-e942-4621-8e3c-34b488390f90","resolution":{"observed_at":"2026-08-05T16:01:54.470831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:52.736142Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.736142Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:27c7a700a8793c859a40c9481599ef3663fcb96ef4bf0a7ce45e6ae886016ebe","observation_id":"25b5268c-6ecf-4fe3-9b77-07cb518ff5bd","resolution":{"observed_at":"2026-08-05T16:01:52.736142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.429460Z","title":"Revisiting over-smoothness in text to speech","venue":null,"work_id":"ec7c2bdc-a3ae-43c2-b0cf-16b3943f150f","year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.743452Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:aa638395b3b839dad2678de93467d38c948eb0310173cb984d9945a0b40da392","observation_id":"5e2ca104-69e1-476a-8e25-097231b26321","resolution":{"observed_at":"2026-08-05T16:01:54.435875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-05T16:01:52.748760Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.748760Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:e9bda5871805040a6d3ce7d867da71239b73841f02f9bc0e4a82624b1c5833c5","observation_id":"7d78640a-6f08-41fe-8d3a-5d48bcd6aad6","resolution":{"observed_at":"2026-08-05T16:01:52.748760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.412245Z","title":"AutoClip: Adaptive Gradient Clipping for Source Separation Networks, July 2020","venue":null,"work_id":"5e30a8c4-2e0a-43b4-82c9-e26993447426","year":2020},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.756183Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:d075bdd7a6ff12fe3ce31199b462501b8979a13c10131e996c4d6c71474b1256","observation_id":"7183e728-81f3-4342-807a-9d614121e605","resolution":{"observed_at":"2026-08-05T16:01:54.418343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T16:01:52.761504Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.761504Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:9e2f90f3b8c987a709134807be8c9c74e75a0dbe0553278e506510d1438ec582","observation_id":"f5943c9b-07cd-4172-98a2-2b6298578e77","resolution":{"observed_at":"2026-08-05T16:01:52.761504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.385943Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers, May 2023","venue":null,"work_id":"a0cc87ce-5bc3-4477-bff7-1c78e497b25b","year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.767480Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b3156bd5dee60901e2c9dfda0a16ee1d3e6eb8efaf2c8fafd65ec1048e507517","observation_id":"3c67adb7-6ae8-4540-9c83-0d94bb0ab2bd","resolution":{"observed_at":"2026-08-05T16:01:54.396325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:52.774022Z","title":"Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.774022Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:0a8483d456590e88888a722e086048c62b0b4dcd36575d99ad93b2409e7e0cb2","observation_id":"aeb04ce9-c2aa-4a98-9784-484353023d73","resolution":{"observed_at":"2026-08-05T16:01:52.774022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.353647Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering","venue":null,"work_id":"73614e6e-5e32-4bec-b5d2-eb4d66206216","year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.778679Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:52d2baab640c2490d2a587bab7842f67d30bd77e22a7439d80965cbeef639b1d","observation_id":"f7350a1b-82de-4554-bdc7-c4b14864f0d5","resolution":{"observed_at":"2026-08-05T16:01:54.359518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.332520Z","title":"Steinmetz, Jordi Pons, Santiago Pascual, and Joan Serrà","venue":null,"work_id":"07397e39-6de1-46e4-be70-42ac353cbffe","year":2021},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.785227Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:bdf35c9bbef658ccbbcbe5d17e6205a4eaf709732f1e99ccd46e1ad56f618b11","observation_id":"8d0864e8-9d61-4847-b4ae-8007d02a4b4a","resolution":{"observed_at":"2026-08-05T16:01:54.339544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T16:01:52.792348Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.792348Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:09efddf393df586c6970e7493a12038b1fb4b11e37550e8c5d63bfb9afe00be3","observation_id":"88ac9b82-424e-4284-90e6-7e3474890267","resolution":{"observed_at":"2026-08-05T16:01:52.792348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:53.529396Z","title":"NaturalSpeech: End-to-End Text-to-Speech Synthesis With Human-Level Quality","venue":null,"work_id":"24392411-348f-4369-8a5b-11f5f8c861dc","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.797356Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:c16fbea7a90873f3ca54d0e036c398893d5e1831ea0b86f8c999a6e75cbb689b","observation_id":"7e22d374-289f-4f3a-9e3a-fd63b7c1ac92","resolution":{"observed_at":"2026-08-05T16:01:53.540373Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.302028Z","title":"Continuous Speech Synthesis using per-token Latent Diffusion, October 2024","venue":null,"work_id":"12fbddf4-d7ac-4a01-a59a-c2351b1e4df6","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.802678Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:f9196813807d8112c744662307170eef2463e90c6270dfcbf904d4f9f40ce5c7","observation_id":"1d9c93ff-5827-44e5-a4de-57432d2981a0","resolution":{"observed_at":"2026-08-05T16:01:54.309528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.278168Z","title":"Neural Discrete Representation Learning","venue":null,"work_id":"e9465140-94cd-436b-b962-9c364c31f8a6","year":2017},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.808377Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:151580952f77e9df1805c76805f7c4e1adc2ac7a70ac0118a471f067d25c37f9","observation_id":"6e0e7da8-4df0-4875-9f8c-592ba1c12b98","resolution":{"observed_at":"2026-08-05T16:01:54.284600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T16:01:52.813060Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.813060Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:643a830f74ff0156f2d540c7a3416baa733e081ea0d4cab34a93f51fb14fc13c","observation_id":"e7a870c0-8ae9-4cb2-b7d2-6361397113fe","resolution":{"observed_at":"2026-08-05T16:01:52.813060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-07T18:14:46.399260Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-05T16:01:52.818331Z","title":"Felle: Autoregressive speech synthesis with token-wise coarse-to-fine flow matching, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.818331Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:eb4a344531f47bbe2fd96524e1e23cbd8eccd646dbb6e14e9bd1d870726bddfa","observation_id":"c5b0d8c7-9cc3-4359-8b41-ce886d522b74","resolution":{"observed_at":"2026-08-05T16:01:52.818331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T16:01:52.823558Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.823558Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:ea6776a5294c8af323cff9261ee9861728cb38f8524262f033ba39602d83b296","observation_id":"61f5c358-f70e-48f2-9779-a8badee88a3c","resolution":{"observed_at":"2026-08-05T16:01:52.823558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.257518Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer, October 2024","venue":null,"work_id":"9ce64386-9123-4238-aa60-64eed12d7048","year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.829746Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b4f72b0e2e8364d6ad7ba739d128dbad2a8d048639e0cb6814a682906ad7f29b","observation_id":"1d998edd-d252-4ed5-a46d-6df9e126adaa","resolution":{"observed_at":"2026-08-05T16:01:54.263650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T16:01:52.834220Z","title":"Towards audio language modeling–an overview","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.834220Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:cfa497ef0ea74ad5ce306ac0ce3a04f2d760a198df0f6e489e338adc6429300d","observation_id":"536b2ec0-62b9-481b-b8ee-ab4ccc1042b9","resolution":{"observed_at":"2026-08-05T16:01:52.834220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03204","last_updated":"2024-05-19T21:34:28Z","snapshot_observed_at":"2026-07-06T17:55:28.812944Z","submitted_at":"2024-04-04T05:15:07Z","title":"RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03204","snapshot_observed_at":"2026-08-05T16:01:52.839342Z","title":"Rall-e: Robust codec lan- guage modeling with chain-of-thought prompting for text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.839342Z"},"links":{"cited_paper":"/paper/2404.03204","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:cafe9e01a9b0ee57dc6349add4d691fa9df720df10d332ea3724f3f11429f0f9","observation_id":"981dec4e-3a18-4f0b-a20a-d12e616454d4","resolution":{"observed_at":"2026-08-05T16:01:52.839342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04745","last_updated":"2020-06-29T07:55:12Z","snapshot_observed_at":"2026-08-06T10:39:08.684653Z","submitted_at":"2020-02-12T00:33:03Z","title":"On Layer Normalization in the Transformer Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04745","snapshot_observed_at":"2026-08-05T16:01:52.844345Z","title":"On layer normalization in the transformer architecture, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.844345Z"},"links":{"cited_paper":"/paper/2002.04745","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:af4cdd6e2640f133c788ada68904112e6aa379380276eb6eaa7ca40f3ac9ee7f","observation_id":"fa13fcd6-7014-4990-9911-08281a879493","resolution":{"observed_at":"2026-08-05T16:01:52.844345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.238456Z","title":"Reconstruction vs","venue":null,"work_id":"02085a26-5072-4e88-a151-c3998daec53f","year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.849095Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:611916716aaa80a9b608240a733109a1bd63da7a3cd9db0b387bcd77c3717a6f","observation_id":"02ee09ec-e051-4671-805d-6f91e1e6141b","resolution":{"observed_at":"2026-08-05T16:01:54.245081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T16:01:52.854277Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.854277Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:9c1c9f22a5af9ac5bdaa6f90a4277d05ad21e4e891b13216bce68fb94574cf07","observation_id":"cc1ff55e-0c36-4212-9fcd-d9cfb7916350","resolution":{"observed_at":"2026-08-05T16:01:52.854277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.212376Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think, February 2025","venue":null,"work_id":"14380d83-1a2d-4f00-ad62-697cd44bca72","year":2025},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.859410Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b09ce5f72594327b9449537f04ba78e1fd73cb0a5c8f40f7953345ce636f627b","observation_id":"ffefd789-2cff-4087-abec-ee7e034b4dd6","resolution":{"observed_at":"2026-08-05T16:01:54.219454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:52.864521Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.864521Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:2c2fa35df92c24d090008e4bbe2afffe8dbab740718b6cd9698a8bbc78209548","observation_id":"0fb202ed-c747-45d3-918b-8fe81290ee9f","resolution":{"observed_at":"2026-08-05T16:01:52.864521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.182230Z","title":"Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu","venue":null,"work_id":"a46f89d2-ba6f-428a-b18e-0d6a0de6031d","year":2019},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.871677Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:1c1bdd756d77955a8e14db9a46f1204a03f8f5173c47e81926c763f5672b04aa","observation_id":"e9ac53ff-9952-42b0-9262-3634970b2ed3","resolution":{"observed_at":"2026-08-05T16:01:54.188022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-08-08T08:22:25.110228Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-05T16:01:52.877438Z","title":"Root mean square layer normalization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.877438Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:a6cb87d2e523152f79e8eaa6ca8817f6a5dc2b37d0c7ed0e320f148deed9b308","observation_id":"449586ca-366b-4904-8afd-99a0efc17c80","resolution":{"observed_at":"2026-08-05T16:01:52.877438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-05T16:01:52.883671Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.883671Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:b572590c6a84beb69f574604c922f28a7e3bfb91a0afec01a2b8cf9775f4accd","observation_id":"d9c9843c-e0b0-4d37-9727-f0540ccd7d32","resolution":{"observed_at":"2026-08-05T16:01:52.883671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:54.160029Z","title":",𝑁𝑆𝐵,𝐶!,𝑁 + UpsamplingBlock Channel toSpace ChannelDuplicating𝐵,𝐶","venue":null,"work_id":"2e643af1-7f0c-4eaf-9fa0-098a99aafe52","year":2020},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.889397Z"},"links":{"citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:7b02a5b9241a54cf38b58f8bf8b141b59e88992f236d1cb4dfb18b069accc197","observation_id":"3c846336-a41f-4239-85a9-dc8976d02ace","resolution":{"observed_at":"2026-08-05T16:01:54.168792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08105","last_updated":"2024-01-15T01:58:51Z","snapshot_observed_at":"2026-07-06T16:18:45.451203Z","submitted_at":"2023-09-15T01:59:21Z","title":"Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08105","snapshot_observed_at":"2026-08-05T16:01:52.645000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.645000Z"},"links":{"cited_paper":"/paper/2309.08105","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:bf5b35de738b6debb23fdf32047d04dea652b3957809f9ef4e04e972e674f0f9","observation_id":"c35e1bbd-d098-48b1-b4de-3d045c067d50","resolution":{"observed_at":"2026-08-05T16:01:52.645000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 3 inbound Pith citation observations for arXiv:2508.19098."}