{"as_of":"2026-08-05T04:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4a525297d72ac26bfc2a9b18b6dc438869f7ebe5b5e8a805824f54379fe0d0a","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:51:21.143066Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:01:20.902986Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T11:21:00.973354Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"cited_work":{"arxiv_id":"2509.09631","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09631","snapshot_observed_at":"2026-06-19T17:11:23.335684Z","title":"InAmericasNLP 2023, pages 206–219","venue":null,"work_id":"f3dae48a-8b12-4b55-a0de-a2840011e625","year":2023},"citing_paper":{"arxiv_id":"2604.13288","last_updated":"2026-04-14T20:32:29Z","snapshot_observed_at":"2026-08-02T20:31:56.427045Z","submitted_at":"2026-04-14T20:32:29Z","title":"Giving Voice to the Constitution: Low-Resource Text-to-Speech for Quechua and Spanish Using a Bilingual Legal Corpus","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:01:20.902986Z"},"links":{"cited_paper":"/paper/2509.09631","citing_paper":"/paper/2604.13288"},"observation_digest":"sha256:f31b9d8613fc12aad3cf09e6969806189109556519a06db8e0c509ccd7996c83","observation_id":"9de43ea6-adf9-44e7-b6ee-7786e256cf53","resolution":{"observed_at":"2026-06-19T17:11:23.335684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09631/citation-record","integrity":"/paper/2509.09631/integrity","json":"/paper/2509.09631/citation-record.json","paper":"/paper/2509.09631"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:20.978381Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:20.978381Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:b4455a9dc510878288468e7ccc04873c5485efd9180a1249d97147e6e056cb14","observation_id":"3848f684-414d-466a-bab1-e23a2de7ab1e","resolution":{"observed_at":"2026-08-04T18:51:20.978381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:20.982353Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:20.982353Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:ba6cc27364c9b169826e2e91c40fa03bc8ab9694079d4f3323bb50a2efe9ee69","observation_id":"1efd47cc-1f74-4521-8257-c45412f15fb1","resolution":{"observed_at":"2026-08-04T18:51:20.982353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:20.986264Z","title":"D.; Ho, J.; Tarlow, D.; and van den Berg, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:20.986264Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:ffbb2f50008a6483a7b8694eaf70844028db4dd59c48f4711f38a2fdec058e1a","observation_id":"87b663b2-c4bc-449a-85d1-e13f5f08a19d","resolution":{"observed_at":"2026-08-04T18:51:20.986264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:20.990362Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:20.990362Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:c0588e7c36f2f974d4cf51d79ab2fb032191444877cdcd3c756019dbac219099","observation_id":"556249ed-9558-462e-bfb8-e63b992bfbec","resolution":{"observed_at":"2026-08-04T18:51:20.990362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:20.993955Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:20.993955Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:6ab29285b8e32f7c0396c9ceb50ef5dfd7301c4942a36f12a458d0761c693b12","observation_id":"cbcd4f63-1b2f-433a-b871-a58c5241350a","resolution":{"observed_at":"2026-08-04T18:51:20.993955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-04T18:51:20.997584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:20.997584Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:70a4bb23ad731ed5ac2fb460b3d8d85b1a2291703fc2328cded3fdfdc8b36bc4","observation_id":"4dbb91b5-f808-4ded-a2db-5a1266f0324c","resolution":{"observed_at":"2026-08-04T18:51:20.997584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.001407Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.001407Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:5d19e3742c417db18f936f83c66695937a8f7bb16c62256a9dbc918b7efec5dc","observation_id":"d496196d-2ed3-4674-8f4c-32f81c7874b0","resolution":{"observed_at":"2026-08-04T18:51:21.001407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-04T18:51:21.004855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.004855Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3dfb6300c4a7396a3a07349252a12feb4ad011719a9f3a4456ee0ae465e82507","observation_id":"7a4f428d-ff2b-48bb-8435-8c428573856f","resolution":{"observed_at":"2026-08-04T18:51:21.004855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.008503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.008503Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:0dbf2e367e35f5fcbfac0156dae43800a1eb4de07e33ab69d65f743fd4c00445","observation_id":"7b02ebf4-8848-4ee3-9bf3-4a6995c627a5","resolution":{"observed_at":"2026-08-04T18:51:21.008503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-04T18:51:21.011679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.011679Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:b9b334fde3bdade7dc5a003bdfa5dae0401e32bb4468f0c8a9c9ed5feae21800","observation_id":"623cfdca-c120-4334-80d0-55ad82c8c7e1","resolution":{"observed_at":"2026-08-04T18:51:21.011679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.015168Z","title":"E.; Wang, X.; Thakker, M.; Li, C.; Tsai, C.-H.; Xiao, Z.; Yang, H.; Zhu, Z.; Tang, M.; Tan, X.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.015168Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:9e83323c224df1cada2988ba1dfa2d4feb2547060259ace7e57f95287a9d85fe","observation_id":"132ae60a-ebcb-4cad-8854-0f50b35a5bb0","resolution":{"observed_at":"2026-08-04T18:51:21.015168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11234","last_updated":"2025-03-12T16:27:37Z","snapshot_observed_at":"2026-07-06T20:37:23.683063Z","submitted_at":"2025-02-16T18:59:11Z","title":"MaskFlow: Discrete Flows For Flexible and Efficient Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11234","snapshot_observed_at":"2026-08-04T18:51:21.018667Z","title":"T.; and Ommer, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.018667Z"},"links":{"cited_paper":"/paper/2502.11234","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:61bb852dbe4019deb013f010e16dc12895081713a6f893af4edcc4c5f8c0d3d6","observation_id":"449af1f8-014c-4dcc-89ce-f91297c5e11d","resolution":{"observed_at":"2026-08-04T18:51:21.018667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.022179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.022179Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:ba98216160f312c5d13471db95c18a07c57015dadfcb09c876f9bd0be0163580","observation_id":"5f99fbfe-918f-4061-aa00-5180169529b1","resolution":{"observed_at":"2026-08-04T18:51:21.022179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.025258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.025258Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:fec3ea2123b0dfd33c3444bbb862d76dcad576dc736645c11a4b1276c58c04b3","observation_id":"0c8cd545-4b13-419b-9d61-bcbaf1d6f12d","resolution":{"observed_at":"2026-08-04T18:51:21.025258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-04T18:51:21.028424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.028424Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:d12c4f7e56982af000454fdb935ad842199b73c234b0e898e7eab36fe7686ffa","observation_id":"2e059189-d9c6-48b4-9101-5cd600e5de40","resolution":{"observed_at":"2026-08-04T18:51:21.028424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.031774Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.031774Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:1587c45b99b10061350e054db5a8433a46fff8e31958f652dfade0ce5bb42d04","observation_id":"6e54303f-7c14-4ae5-a0f2-7e51120bfc6e","resolution":{"observed_at":"2026-08-04T18:51:21.031774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.034761Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.034761Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:63f880ff883a6ac3107d0a1a54f72af507ad48e0b32231fbd94630d9c51489e4","observation_id":"4ac2d316-3d21-4e55-b251-0655cf177ba4","resolution":{"observed_at":"2026-08-04T18:51:21.034761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.037693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.037693Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:cec653cf253c2bee245bf227341099a8b38dc1fa40216fb0394db2796905d629","observation_id":"bb24f6ad-d78e-4ee0-a1c6-1c8aa3984fef","resolution":{"observed_at":"2026-08-04T18:51:21.037693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.040855Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.040855Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:09a543badb6f94fc3af6ff5f62581ffaf60d7a4c224a1202a36bd9e708ccd29f","observation_id":"b9015e4f-d0fb-44c4-b6ca-e27548d083cd","resolution":{"observed_at":"2026-08-04T18:51:21.040855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.044039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.044039Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:dc321b0e240e182886a801625f1e7d89c16ea948f878296417fda037256757fc","observation_id":"a1bb253d-0b9a-4295-aa6d-40dd3db71a9e","resolution":{"observed_at":"2026-08-04T18:51:21.044039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.047105Z","title":"J.; and Yang, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.047105Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:b308155e921dfc69df434fa88a39d402e92a23df1519d9236cb0387cff6fe69a","observation_id":"f41de938-d538-4608-ae6f-0aa729cee034","resolution":{"observed_at":"2026-08-04T18:51:21.047105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.050208Z","title":"J.; Badlani, R.; Santos, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.050208Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3abfca2d2133234c282da1ae0d3e8cd154fa4b126f6b6ab2bbe909cf825eb1e0","observation_id":"bed40b8f-cad7-4e43-820b-d5eeea232d1f","resolution":{"observed_at":"2026-08-04T18:51:21.050208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.053137Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.053137Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:d069bcbc9864c5695072d5ff11fb0bccef6750df56b6d8b65321eb568d8a007e","observation_id":"577f4734-562f-4b01-a383-c7fe9a4cbf7a","resolution":{"observed_at":"2026-08-04T18:51:21.053137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.056152Z","title":"W.; Kim, J.; Chung, S.; and Cho, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.056152Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3949eed6b1d059cee885bf0e10776ba20d072195767460c66710f51500bbb663","observation_id":"9fc02d3f-686a-4b27-a9c5-a9f6884e2bbc","resolution":{"observed_at":"2026-08-04T18:51:21.056152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.059118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.059118Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:7d099027be94aef583f08899b05c23fe72b659ae5bb1c5ffe1cc91b3c569dede","observation_id":"7882e6ab-bb84-4a83-8163-8731b69c3675","resolution":{"observed_at":"2026-08-04T18:51:21.059118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.062079Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.062079Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:254f14de1e08aef59576a5875b5473e8fc6908ebee188b18c54b181914ba691f","observation_id":"13b654f6-10a2-4eb4-88cc-554c7694482c","resolution":{"observed_at":"2026-08-04T18:51:21.062079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.064972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.064972Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:0dfbc8d3d74de240ae7e2662f60594425e61f10e4b933c5109ce7c7c4750b935","observation_id":"cb92d948-25b9-4e11-8f3b-e91a53deb75b","resolution":{"observed_at":"2026-08-04T18:51:21.064972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.069515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.069515Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:74ad99ecdd1a556dcd123b5898be7db70511024b5dc6bbb33586966f3b6b7306","observation_id":"c79a326d-f1c9-4250-8850-0a1fbfdadd98","resolution":{"observed_at":"2026-08-04T18:51:21.069515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.072604Z","title":"M.; and Wei, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.072604Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:174f3e80c4900de35acc26fa5bf133de9bf02e043a2c82f989d935bcfc7a4fbb","observation_id":"42ab2445-945a-4f17-b31f-30bdbac225d5","resolution":{"observed_at":"2026-08-04T18:51:21.072604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.075621Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.075621Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:b7b5d4b67a6effbaf21f43b9a7d48cf5088d3200aea077718cf16a3cf9874f16","observation_id":"3147c038-1c93-4d2c-bdb3-239195e5f44c","resolution":{"observed_at":"2026-08-04T18:51:21.075621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.078517Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.078517Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:56f510b9c51a0bda290c4f013113eca9c5d35915615fa9c1ed96badbbfd23016","observation_id":"c6fb6efc-16bf-4d06-95b9-c7facaf1763b","resolution":{"observed_at":"2026-08-04T18:51:21.078517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.081242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.081242Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:1ff95f0a7cbdd9d7499e81e100b255a2342299794fcf7ee79cd3a13e0fdc8055","observation_id":"1e22373e-4d3b-4e48-b683-980b8d8336b5","resolution":{"observed_at":"2026-08-04T18:51:21.081242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.084048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.084048Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:d16f69740ddc96f0e94737ad1613871a495ae6ce12eaf60920ff1fe994f5a4e2","observation_id":"d62a951f-cced-4ac7-8c52-0ac2984c7baa","resolution":{"observed_at":"2026-08-04T18:51:21.084048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.087056Z","title":"S.; Arriola, M.; Gokaslan, A.; Marroquin, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.087056Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3ee1d406a1013c2d0464eafdc7725da4573e6dd9173eefb041cb90b12f07e1c4","observation_id":"7f8362ed-5e46-45a0-a273-921059ddbeb9","resolution":{"observed_at":"2026-08-04T18:51:21.087056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.090018Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.090018Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:6a03196a2ed6dbd67c97f40a5f0d599ed182ecbd2a1486b947b4984c4afb532f","observation_id":"bd7304c7-58d2-4167-8f23-81baaed9ad42","resolution":{"observed_at":"2026-08-04T18:51:21.090018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.093224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.093224Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:5341b74b1d9d6137cc2afd39c272b044b817d2fbf76ab15328b948105aa74303","observation_id":"b329725f-c0c1-4642-a276-940a4534ec97","resolution":{"observed_at":"2026-08-04T18:51:21.093224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.096010Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.096010Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:1884c68f9af09e802c58fbc05ee3fe07b1d17dd007bb6d0939f54ed88491865b","observation_id":"bab2983b-1987-401f-af55-48830c156325","resolution":{"observed_at":"2026-08-04T18:51:21.096010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-01T17:57:51.619999Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-04T18:51:21.098815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.098815Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:ac73ea91c131008d30635b2dea6e5c3745f486281671ddfa9611c7e13c9ebf99","observation_id":"d9ad5e0b-6bdc-447e-a44f-faaf8d83c312","resolution":{"observed_at":"2026-08-04T18:51:21.098815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.102079Z","title":"P.; Kumar, A.; Ermon, S.; and Poole, B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.102079Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:fed2f6ba051364d5daa92f0394b48ae958dc2c6c6fc13d36acabebbd3b95b004","observation_id":"130e0f9e-d5a0-4973-913a-665a5a8b2513","resolution":{"observed_at":"2026-08-04T18:51:21.102079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.104955Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.104955Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:6eac650123cd61b028b54eb3a85d5a150f3062550a8c2b9e0cf7b4aa410b6a6b","observation_id":"a50c2d85-a674-41dd-b5f6-3b1beffdd045","resolution":{"observed_at":"2026-08-04T18:51:21.104955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.107937Z","title":"N.; Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.107937Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3cad01015e381067781c4c94716b82d6a9c236affc78c754475ac4752cb3fb9d","observation_id":"55059669-68d8-4bed-9ac1-a4bf5924e5f1","resolution":{"observed_at":"2026-08-04T18:51:21.107937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24291","last_updated":"2025-05-30T07:04:23Z","snapshot_observed_at":"2026-07-06T21:33:31.469620Z","submitted_at":"2025-05-30T07:04:23Z","title":"Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24291","snapshot_observed_at":"2026-08-04T18:51:21.110818Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.110818Z"},"links":{"cited_paper":"/paper/2505.24291","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3bbd8b8901b921e8965b1bbffb409f446d2463015d7c53b83226f266d1c0dcf3","observation_id":"e305150d-f29c-4ca9-b00b-0b8561adc764","resolution":{"observed_at":"2026-08-04T18:51:21.110818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-04T18:51:21.114170Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.114170Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:8af62c146f9db385392b86a2f44625eb9126a1d600b0e2536fa2aeb507886236","observation_id":"af68322a-adf3-429a-9b59-fdc25d09a134","resolution":{"observed_at":"2026-08-04T18:51:21.114170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.117594Z","title":"J.; and Liao, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.117594Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:7354b13c9a84a7b114d259e7047cccf01bd5d7a6919e0c3e77c1a0dc784cb65d","observation_id":"88eb04bc-47ea-4b84-90c4-2f1e538e8a22","resolution":{"observed_at":"2026-08-04T18:51:21.117594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.120760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.120760Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:f3a44df1270a97a65ed03fda16c019a720a2c7ddb2bb3ed92bccf9b2468b3aa8","observation_id":"f504b305-d9ae-4b7a-beea-b107ba01299e","resolution":{"observed_at":"2026-08-04T18:51:21.120760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.124066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.124066Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:f1a693aa71498d999bcb69182af6646b6c90fb381d8dd6c2b74436a7a12ea2f5","observation_id":"37eed620-c63b-4701-b804-7df70c12f746","resolution":{"observed_at":"2026-08-04T18:51:21.124066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14928","last_updated":"2025-03-19T06:28:17Z","snapshot_observed_at":"2026-07-06T20:55:09.392546Z","submitted_at":"2025-03-19T06:28:17Z","title":"Shushing! Let's Imagine an Authentic Speech from the Silent Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14928","snapshot_observed_at":"2026-08-04T18:51:21.127479Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.127479Z"},"links":{"cited_paper":"/paper/2503.14928","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:b40dce482d71fc1a176c0348145d3aa9b5514432b1098567516d6a565fb6d336","observation_id":"fc9a04e0-63b2-4603-a053-9aca3376b72b","resolution":{"observed_at":"2026-08-04T18:51:21.127479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.130764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.130764Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:e416b618477b662a1a868b3569c362fe1aa3185de2a4f9420a6e9d18c650eb38","observation_id":"1aaa4b9a-6bd8-43d2-be64-46877872e18b","resolution":{"observed_at":"2026-08-04T18:51:21.130764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.133684Z","title":"J.; Jia, Y.; Chen, Z.; and Wu, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.133684Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:154e586da80832b932092f8f3551e9d6315ff11996226168ea4153d2650e6262","observation_id":"d00bd9a2-5f9e-4a02-979e-fbeaf38fb27e","resolution":{"observed_at":"2026-08-04T18:51:21.133684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-07-06T14:59:43.014800Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-04T18:51:21.136655Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.136655Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:3c5ff257037b270c8bb8677169ae73b662e0558668ddb72c2751aa7211c558cc","observation_id":"9dc06219-a9e9-4be9-b4e1-e28e44f6aed5","resolution":{"observed_at":"2026-08-04T18:51:21.136655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.139897Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.139897Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:5c5b5fcba1b056bd902ca68ab733e4078c43be4c6f681645080ce234625738e6","observation_id":"64b4c90c-0d4e-4fe9-8b47-db9b50b22fa8","resolution":{"observed_at":"2026-08-04T18:51:21.139897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:51:21.143066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.143066Z"},"links":{"citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:847edbce316f5548496b6f8836d4f4a274dbc1312bad9754011dcff8bcd3b6a3","observation_id":"f62205af-9979-4389-8464-e43fcf10657a","resolution":{"observed_at":"2026-08-04T18:51:21.143066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","latest_version":5,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-04T18:51:12.536913Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2509.09631."}