{"as_of":"2026-08-17T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e3784d8287b4d506c701723b3fe0be59d2b9aa4007201a815476bf87c2b7354","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:47:38.049516Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:47:34.168653Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2608.00011","snapshot_observed_at":"2026-08-04T02:47:34.168653Z","title":"V ALL-E [1] pioneered this approach by training on 60K hours of speech, achieving strong zero-shot synthesis from a 3-second prompt","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.168653Z"},"links":{"cited_paper":"/paper/2608.00011","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:3aeb4e8345e97716a19883efd26b52c54b00aa07fd5c3cdaed4e08977be638d1","observation_id":"518e8a65-a969-4a42-b294-fea1704f6e7a","resolution":{"observed_at":"2026-08-04T02:47:34.168653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2608.00011/citation-record","integrity":"/paper/2608.00011/integrity","json":"/paper/2608.00011/citation-record.json","paper":"/paper/2608.00011"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:34.082711Z","title":"Autoregressive codec language models [1, 2, 3] achieve high-quality zero-shot synthesis but require 60K–250K hours of data and generate tokens sequentially, incurring high latency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.082711Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:bb96cb9fa6734802ade3cdd26ace919cd2065b5086ea011f02bb35d51cfa595a","observation_id":"be70cc1e-e6cd-41a6-8a24-7a9dfbca4a4b","resolution":{"observed_at":"2026-08-04T02:47:34.082711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2608.00011","snapshot_observed_at":"2026-08-04T02:47:34.168653Z","title":"V ALL-E [1] pioneered this approach by training on 60K hours of speech, achieving strong zero-shot synthesis from a 3-second prompt","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.168653Z"},"links":{"cited_paper":"/paper/2608.00011","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:3aeb4e8345e97716a19883efd26b52c54b00aa07fd5c3cdaed4e08977be638d1","observation_id":"518e8a65-a969-4a42-b294-fea1704f6e7a","resolution":{"observed_at":"2026-08-04T02:47:34.168653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:34.330382Z","title":"Background Neural Audio Codecs.Neural audio codecs compress contin- uous audio waveforms into discrete token sequences through learned quantization","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.330382Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:7131fd499355648b48acbd7ae18a2c9292cf5b4cc68f96884ad632972f9a1b27","observation_id":"a1be558b-a6d2-4965-b088-020f8ef2de2f","resolution":{"observed_at":"2026-08-04T02:47:34.330382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:34.475935Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.475935Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:1d88aa84eb7eef6823812d4990e26db2089259f4acf47f2d03d58220c44cb5db","observation_id":"74d69a8f-de82-416a-b0f5-5d4524f7f3f9","resolution":{"observed_at":"2026-08-04T02:47:34.475935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:34.651465Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.651465Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:4c7968a40996c0ea1a5fe768e302acdb30896c9b4df03c5d5be5fd568222d608","observation_id":"77f71871-7bb4-43a3-b3a9-093f60121af6","resolution":{"observed_at":"2026-08-04T02:47:34.651465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:34.844134Z","title":"All research contributions, including the methodology, experimen- tal design, results, and scientific claims, are the authors’ own","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.844134Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:6f913cd424ad2e77337c2f07f383f1cf20a0d94cc83409f90b4f6b494da46bbc","observation_id":"c21ccdb6-ac3f-49c0-9972-a7fc04b454ef","resolution":{"observed_at":"2026-08-04T02:47:34.844134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T02:47:34.991882Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:34.991882Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:3c5b9655c3a674dd99d505af89cb8cae9b8b15c2d25ea9b1ce12b55e53b82585","observation_id":"beceb961-0f28-4d3f-ad6c-29600f2490ce","resolution":{"observed_at":"2026-08-04T02:47:34.991882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-16T13:44:57.962630Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-04T02:47:35.142024Z","title":"V ALL-E 2: Neural codec language models are human parity zero-shot text to speech syn- thesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:35.142024Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:72f0456e2815038a2182c15ce51e398a8e914e25949608e4006c6786d3052de2","observation_id":"3ee3d8f0-ae27-4ffb-a62f-2f41c2b2fb4c","resolution":{"observed_at":"2026-08-04T02:47:35.142024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-04T02:47:35.291836Z","title":"LLASA: Scaling train-time and inference-time compute for LLaMA-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:35.291836Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:1d7b9efbbcefb4a139260cc7a7cfa14a403b4a63ddcadecf608384e8b85ebb1e","observation_id":"eb01b07b-0bd0-496f-804b-1a1b2e42f3fb","resolution":{"observed_at":"2026-08-04T02:47:35.291836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:35.434923Z","title":"V oice- box: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:35.434923Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:372c5dc1311c8350a332cd13a322bc2a01942af09c29e91bc00c778a1a9a17fa","observation_id":"4aeebb4c-2152-4128-a65a-1a9aeef37e13","resolution":{"observed_at":"2026-08-04T02:47:35.434923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-04T02:47:35.599102Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:35.599102Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:6af75ef7f4a01df33cea85573dc265775f97c96878fcf14747989b57e5970c4b","observation_id":"599d5572-5398-415a-9896-66d7c5a80a71","resolution":{"observed_at":"2026-08-04T02:47:35.599102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:35.745081Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:35.745081Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:953c95949ab720bd1ab67e7a02cdc04dcde301732887639c79dd4d40f7905614","observation_id":"3fdb55c4-8aee-452c-98d0-69c556dc568e","resolution":{"observed_at":"2026-08-04T02:47:35.745081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:35.918355Z","title":"StyleTTS 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:35.918355Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:4a3fe81fe4f2f22a820bfb9afb8678b8928460fb23c78095101777f5285de164","observation_id":"33813783-458b-47a1-b02a-7b41d02c4a8f","resolution":{"observed_at":"2026-08-04T02:47:35.918355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:36.067536Z","title":"Simple and effective masked diffusion language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.067536Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:10ed1b07d0c8309bd64a10b4c52792e70ca2667985d8c2c3131f36f3ca0577a2","observation_id":"1fdc947d-a354-4ade-8063-f082075dfdf3","resolution":{"observed_at":"2026-08-04T02:47:36.067536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-04T02:47:36.152258Z","title":"Large language diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.152258Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:c9373d08a15b2b52df7e2a611b8387347ddfefa3bcb0920fccce19db9edd5a69","observation_id":"dcecf7e3-3f49-49a4-9347-f8da11b38c47","resolution":{"observed_at":"2026-08-04T02:47:36.152258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:36.286198Z","title":"Block diffusion: Interpolating between autoregressive and diffu- sion language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.286198Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:a9b8d8ea31a142b97532f51a8c433ccaf0bb9ecafdf173a86471761a1b2d4699","observation_id":"3e660b47-e65a-4800-a25c-6dc16e0e653a","resolution":{"observed_at":"2026-08-04T02:47:36.286198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-08-16T20:33:30.347717Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-04T02:47:36.419427Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.419427Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:847d3775ca5f20b3e5cc6dad1979c4751dcfc54da4d6fe5238889a22755f9045","observation_id":"c1dbf8d9-fd18-4917-9f24-fb8e92986e97","resolution":{"observed_at":"2026-08-04T02:47:36.419427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-04T02:47:36.533889Z","title":"Seed-TTS: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.533889Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:12722a5dd52b5f366661723ce92980803005ee3bbdada5ce168ed9a89aeb2e88","observation_id":"c258d91d-e565-4bd9-b6d9-10a4bda65405","resolution":{"observed_at":"2026-08-04T02:47:36.533889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:36.620536Z","title":"DiTAR: Diffusion transformer autoregressive modeling for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.620536Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:f8c0c3d2c74a9cfa1118afa76e7dab3a06ade2920c0ceacb95751b890dc3111c","observation_id":"9adef03b-cd60-4f95-91c2-458aa7e115f0","resolution":{"observed_at":"2026-08-04T02:47:36.620536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-04T02:47:36.673778Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.673778Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:9f6658ca49bd02777116d461e6c16ddd0c709ef71b3f55a1eb890821aa1ceebf","observation_id":"f74d0e87-b1ef-4f30-bd3f-791758b35ef9","resolution":{"observed_at":"2026-08-04T02:47:36.673778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-16T15:32:35.509283Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-04T02:47:36.770711Z","title":"SoundStorm: Efficient parallel audio gen- eration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.770711Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:b57434558359196a93504f848ef73c2faffcdce900c18707aa3bb74b340308e9","observation_id":"aca05a97-dab2-477e-bf51-19acde3e2781","resolution":{"observed_at":"2026-08-04T02:47:36.770711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-16T12:55:06.202467Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-04T02:47:36.903349Z","title":"MegaTTS 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech syn- thesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.903349Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:01884f322b63ac97f9d4bd36d4d4412d942f9bba9016bb8e15d20e24c47b1714","observation_id":"1562ad06-8805-48b2-a8ad-4d7b16698ae6","resolution":{"observed_at":"2026-08-04T02:47:36.903349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-04T02:47:37.015401Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.015401Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:46c55b414ddb42beffbe6d60150999260ff4c6b46c2e5eee836f48f8f909bc2d","observation_id":"0d4e5d1a-cca7-4f84-a52a-71383fc85b7c","resolution":{"observed_at":"2026-08-04T02:47:37.015401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-04T02:47:37.124600Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.124600Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:68691e424bb0bcad41924d15ea943326b29bdb9b20225c543ff94c88beaa3419","observation_id":"e731f3ab-d26c-4e85-bbb0-177d8a75886d","resolution":{"observed_at":"2026-08-04T02:47:37.124600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:37.218585Z","title":"RoFormer: Enhanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.218585Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:4889a54c4ed54c5d6fcd58b446043726b5b48aff6307e7ec47c81f51de8fe004","observation_id":"415c7e6d-50c9-4f9b-adaa-8187600a2456","resolution":{"observed_at":"2026-08-04T02:47:37.218585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-16T13:36:26.053658Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T02:47:37.291105Z","title":"Emilia: An extensive, multi- lingual, and diverse speech dataset for large-scale speech genera- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.291105Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:2bf9c2d9523105fb416f765eec2d77ebd0a32bc880956c4adc890a99d2818c90","observation_id":"552f8c7f-7728-4854-8caa-0392f27ae99d","resolution":{"observed_at":"2026-08-04T02:47:37.291105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:37.395690Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.395690Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:d6988e6bd0c33f0f16c028a3f95990e810bd4de0bf40f5aeb61356fcb0683c0d","observation_id":"655011b0-91a7-4bfb-a0d0-9390d8bd3fda","resolution":{"observed_at":"2026-08-04T02:47:37.395690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:37.470170Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.470170Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:46db096b7f29e78c57efc00f92460860f02f9867d75e4e2d94c568907eb747ac","observation_id":"85777bd1-ba21-46c9-a4cf-ad1ff0df5a93","resolution":{"observed_at":"2026-08-04T02:47:37.470170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:37.581829Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.581829Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:b6860c023241cf95c3003d847f4b429d02c70ce3e943fe951f5cafb03231fd92","observation_id":"8c40261d-3e0b-4992-a38f-9dd41b552a80","resolution":{"observed_at":"2026-08-04T02:47:37.581829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:47:37.653775Z","title":"CodecMOS-Accent: A MOS benchmark of resynthesized and TTS speech from neural codecs across English accents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.653775Z"},"links":{"citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:90415ad5329c8b98bad4756b691823f48ce0041e2e8ba6eb8fca13f200522606","observation_id":"193c228c-c04a-4052-9eea-674c8ac8d391","resolution":{"observed_at":"2026-08-04T02:47:37.653775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-16T15:06:17.970180Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-04T02:47:37.726590Z","title":"IndexTTS2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.726590Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:17d982b330631d319148b9f60092870727b230895d3826f80e07acce0f9c6062","observation_id":"28686fc6-7cc7-4693-887f-911c13a40eba","resolution":{"observed_at":"2026-08-04T02:47:37.726590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T02:47:37.800808Z","title":"Qwen2.5-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.800808Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:d3f6eb2508a5262a559fde531a91e9501600d928f3d3a8254faad07e1e89c176","observation_id":"973c327d-e420-4af0-a9b0-eea58a97c956","resolution":{"observed_at":"2026-08-04T02:47:37.800808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-04T02:47:37.876645Z","title":"MaskGCT: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.876645Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:4d5dab32dcfd98c7623faea60e02aaf5f85b49d072cf7f404765d4f096ef7e58","observation_id":"0ed90ffa-6d2f-40e0-b4aa-a8a78347f78c","resolution":{"observed_at":"2026-08-04T02:47:37.876645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-04T02:47:37.938205Z","title":"CosyV oice 3: Towards in-the- wild speech generation via scaling-up and post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.938205Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:881ff63d6262728e52728112d66be2cb0dec723ba7e124279f545c92783e193c","observation_id":"2c8f2a09-c0b0-41bc-9593-8ebc6ba8cb21","resolution":{"observed_at":"2026-08-04T02:47:37.938205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-04T02:47:38.049516Z","title":"Fish-Speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:38.049516Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:644e7d101075396443325bb2474e3cdc5dbe0485f9ee05a83ef7f54e5522fccf","observation_id":"6310a5c4-2395-4954-bb9d-84ea5c281897","resolution":{"observed_at":"2026-08-04T02:47:38.049516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2608.00011."}