{"as_of":"2026-08-22T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e5b6d9ab2b53fe5e594e0ce593fbc8eb7d75afdac239dc4dca9d74e2b8a4860","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:26:03.299001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:19:49.609343Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:2419711c4a3370132fbb48c314cbe979fca37e1c475dcbaa28ceb735097cda8e","observation_id":"086fc22e-91a8-4ecc-9e4f-0f74191a7385","resolution":{"observed_at":"2026-05-16T06:06:41.545772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-12T20:13:58.141022Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":217,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:58.141022Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:d9a0b3b0200a202afe387989612a8050fb140c4c4ce3fca555a26185064a3116","observation_id":"2e907032-4eca-4045-a25a-8266e682f8a0","resolution":{"observed_at":"2026-08-12T20:13:58.141022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-11T18:08:22.378032Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.378032Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:e846a7141d8ca607f44d472864e6f0a4c8cd9ead4a4d3811e5d2ec0dc0953f7c","observation_id":"7ac6d73c-4f62-49b0-a77c-5a5d04a92fbf","resolution":{"observed_at":"2026-08-11T18:08:22.378032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-11T17:27:30.880110Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08988","last_updated":"2025-04-25T01:06:20Z","snapshot_observed_at":"2026-08-14T17:39:09.485415Z","submitted_at":"2024-12-12T06:39:49Z","title":"EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T17:27:30.880110Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2412.08988"},"observation_digest":"sha256:158050055655a8679c9417a24750e74f8dd2f7bb8800318beb5b8df8b94f8fcf","observation_id":"ca3a5fb0-7de2-4f11-abd9-268cc17b4ef2","resolution":{"observed_at":"2026-08-11T17:27:30.880110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:bc601b9b5460f59b29e6aa8e80060b416d3e49055ccf8377e2dcf880d6e2ae5c","observation_id":"a67747de-bf49-4491-84c0-2700e7c1cf2e","resolution":{"observed_at":"2026-05-13T06:19:09.552268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-10T14:21:56.990616Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-19T01:21:28.929963Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.990616Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:23e5fc78a2e2ed8baff8e882903cd9c71a334a17c66dae458b5e4f1ccb1468d1","observation_id":"829c2aa3-ad90-4160-9ef9-f513bb06313b","resolution":{"observed_at":"2026-08-10T14:21:56.990616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-09T16:50:43.935681Z","title":"MaskGCT : Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-18T23:09:55.083693Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.935681Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:7374f618a4408ad75c51c47c96085d80b2aea56cea5627c8927755f18f73021e","observation_id":"637cb4a9-52c4-4d75-abe9-81f326f42521","resolution":{"observed_at":"2026-08-09T16:50:43.935681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-09T05:54:18.783977Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.783977Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:98c740953785bb1f1fd11a597dc02ae6ecf06ba80404c116652c9414c589b5df","observation_id":"f4d8a91e-e789-4371-b7d5-103e43f7811c","resolution":{"observed_at":"2026-08-09T05:54:18.783977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T04:26:03.299001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01263","last_updated":"2025-08-25T07:31:16Z","snapshot_observed_at":"2026-08-19T15:13:08.839859Z","submitted_at":"2025-05-02T13:30:19Z","title":"FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:03.299001Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.01263"},"observation_digest":"sha256:14e46b19c51ece4bf00dcc89794c1444d4961d1e41ce01289c53adb8ac3855a1","observation_id":"80fd235d-9dec-42a2-8da9-4a87396ebd46","resolution":{"observed_at":"2026-08-16T04:26:03.299001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T00:00:56.877406Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.CoRR, abs/2409.00750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.03273","last_updated":"2025-05-26T07:01:19Z","snapshot_observed_at":"2026-08-20T00:13:42.436149Z","submitted_at":"2025-05-06T08:04:37Z","title":"SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:00:56.877406Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.03273"},"observation_digest":"sha256:4a8602f196d3c7ee8086aa1c76306602f5574f8ec650420aa42f5a6c9cb31a63","observation_id":"da8156d4-ecc8-44b2-a160-ff66a880bfa4","resolution":{"observed_at":"2026-08-16T00:00:56.877406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T23:17:54.758777Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05056","last_updated":"2025-05-08T08:47:11Z","snapshot_observed_at":"2026-08-20T17:47:16.236292Z","submitted_at":"2025-05-08T08:47:11Z","title":"Teochew-Wild: The First In-the-wild Teochew Dataset with Orthographic Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:54.758777Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.05056"},"observation_digest":"sha256:7007a0d7406b6e023503d8315e513a52c38a0df52893fc186549245151025fc8","observation_id":"c26f3345-058c-47a6-927e-1fc6efdd23e9","resolution":{"observed_at":"2026-08-15T23:17:54.758777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T23:17:25.242589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.242589Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:1596c27fadc45e2387abe22710a3e83df2d832f5988e36e6413c020b90a262f6","observation_id":"4648c6c9-9105-46a3-9050-85ee6376b56d","resolution":{"observed_at":"2026-08-15T23:17:25.242589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T22:16:17.327211Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.arXiv preprint arXiv:2409.00750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-19T00:25:29.376635Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:16:17.327211Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.07916"},"observation_digest":"sha256:75349af4f06eb9e2fd7259d4a01ee52309ed2a62e2ee436594252bb4d1542bfd","observation_id":"5e71f19e-d50f-4ae4-8075-535d96840a6a","resolution":{"observed_at":"2026-08-15T22:16:17.327211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T20:14:08.477692Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13843","last_updated":"2025-05-20T02:38:29Z","snapshot_observed_at":"2026-08-19T13:56:24.573069Z","submitted_at":"2025-05-20T02:38:29Z","title":"A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:08.477692Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.13843"},"observation_digest":"sha256:82e696bf709715673f5165dcf8d3cd60112bab376e47eb5011a21ef37889ec4a","observation_id":"323ba844-defb-424d-9b4d-76a2e892d01f","resolution":{"observed_at":"2026-08-15T20:14:08.477692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:b44248f5e6dcc41d1897426ca088c631e3986aaf40b11343f0d2f0946f8bb760","observation_id":"1e70ec91-873c-42c2-894f-28e9d834de26","resolution":{"observed_at":"2026-05-16T05:27:25.504594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T14:19:51.135367Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.ArXiv, abs/2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.135367Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:97cf97acf481be00501d0bfbf6594e0a85c4b22d34fa310dc5326d9f0fd9398f","observation_id":"03333264-800a-4980-89ee-16fd2c942e25","resolution":{"observed_at":"2026-08-07T14:19:51.135367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T14:09:19.616970Z","title":"MaskGCT: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-21T19:21:12.725787Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.616970Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:9fa960639475a08f16fee1cf0602d6cda88fbedf1de7fe9569a3553cfa2c4ec7","observation_id":"9ba44ab7-e2ce-4b97-b982-f296b1bfdde9","resolution":{"observed_at":"2026-08-07T14:09:19.616970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T13:54:23.558229Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20693","last_updated":"2025-05-27T04:02:01Z","snapshot_observed_at":"2026-08-20T21:36:34.382194Z","submitted_at":"2025-05-27T04:02:01Z","title":"Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:23.558229Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.20693"},"observation_digest":"sha256:103e6f1b2efca4f2c5326239e93ee1613b30706f3476dda8db78b460409a22be","observation_id":"88db68ac-66a9-450a-8a21-beb069a6fa7f","resolution":{"observed_at":"2026-08-07T13:54:23.558229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T12:27:29.941725Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-22T08:57:34.006436Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.941725Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:241e0aa657360c6bb8243da506142d71995059b3619219a3395616f210be6f73","observation_id":"ee274426-26c7-41a7-83ea-6e304359fe61","resolution":{"observed_at":"2026-08-07T12:27:29.941725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T00:23:39.416451Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14226","last_updated":"2025-06-17T06:29:58Z","snapshot_observed_at":"2026-08-17T08:18:37.017243Z","submitted_at":"2025-06-17T06:29:58Z","title":"Investigation of Zero-shot Text-to-Speech Models for Enhancing Short-Utterance Speaker Verification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:39.416451Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2506.14226"},"observation_digest":"sha256:ac5c77cc352f9bd8ae500ccf7b6dd1ec36ed8f18b95e06cca2f8972432f5011d","observation_id":"22e0c373-417c-4506-8d24-986b3f37aa1c","resolution":{"observed_at":"2026-08-07T00:23:39.416451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T22:43:50.332197Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20945","last_updated":"2025-06-26T02:23:42Z","snapshot_observed_at":"2026-08-18T09:54:09.741126Z","submitted_at":"2025-06-26T02:23:42Z","title":"A Multi-Stage Framework for Multimodal Controllable Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:50.332197Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2506.20945"},"observation_digest":"sha256:de676412c3f2f46571a880ab3beb9f18bac4671ced79a4807a280c984041d4a0","observation_id":"663c1c04-c3e4-47e7-9303-e95d307ed5f0","resolution":{"observed_at":"2026-08-06T22:43:50.332197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T23:21:59.231724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-16T15:06:17.970180Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.231724Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:f547fb87361e1a1a23e8ffe2bb2d777443d498e5059f8f9c5d95ff63fadc8c28","observation_id":"04e4ef9c-3e63-4826-b1d8-4ba7a760e217","resolution":{"observed_at":"2026-08-06T23:21:59.231724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T21:23:51.703103Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-20T18:09:28.126757Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.703103Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:bf4aad38f054df4412f8951bc8ee0e8c8c623e5d5f8ba7eb66939c0c9f6d2058","observation_id":"824d47ee-60fe-4859-b56e-c26291a5af5e","resolution":{"observed_at":"2026-08-06T21:23:51.703103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-14T15:29:48.583976Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:fa9f40393650cb556f0a1f23f87fb9aa640b3407d3dc73736ad0a6808b63d327","observation_id":"caa92c4b-ae16-48b0-9694-c7636e770379","resolution":{"observed_at":"2026-05-19T04:32:03.632822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T16:55:50.368580Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.368580Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:e37bde89f1e39024245d947f814ba2603d46dda02a265b458f0c2dae36b75b8c","observation_id":"a32f064e-3d61-4988-8f59-e4bee014f2fa","resolution":{"observed_at":"2026-08-06T16:55:50.368580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T15:48:20.576312Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.576312Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:ee266f3869fabaf2ab470cd348b882b80d3b0472f686e8c2c8721744496f6b35","observation_id":"b3cbe4af-0b4a-4535-b907-5547b8ff3d60","resolution":{"observed_at":"2026-08-06T15:48:20.576312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:abbf0a8ec011e4af73218e802523a22c91e8ea0bbb03ad7fd08ffc9646bdbb86","observation_id":"63183282-1e75-44c9-94dd-9a9f6e44dfa2","resolution":{"observed_at":"2026-05-16T05:59:51.066886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T11:34:09.403232Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.403232Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:1341097f1751933657293a2ed649d54c1dc53fa66c95e9cf029791ae4b9a3420","observation_id":"752c8ba0-a959-4247-8d1e-c3737aee4cf3","resolution":{"observed_at":"2026-08-06T11:34:09.403232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T15:00:14.080956Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-16T00:28:53.748581Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.080956Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:0df1cf46e9129c144d9b97b5ad76c57996f6b8771d30f52caa1471b06deb6921","observation_id":"cd815554-0fb7-4877-a0b9-f2406c475e7b","resolution":{"observed_at":"2026-08-05T15:00:14.080956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T13:36:06.639779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-21T02:55:34.176877Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.639779Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:bbceb15ba5578d157401be1ac3a1ab6ecc543852edc9f0d801797ff5738c3ae6","observation_id":"46ccd477-b2ae-4e42-ac81-b7a3e019362b","resolution":{"observed_at":"2026-08-05T13:36:06.639779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T12:00:45.427743Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-15T08:18:32.827110Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.427743Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:fe7ec5b3a55cb6c854b970e0f5a2053f2eed9b79d27b72a62b5eb7d9ceef5984","observation_id":"6d8e8d91-3e33-49eb-8da4-a442370d71d5","resolution":{"observed_at":"2026-08-05T12:00:45.427743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T16:12:07.923921Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.923921Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:5c4323adbf4ea0683437bb2c29ca68b626046e763a93ee00032fedabb05c8773","observation_id":"751bb11e-20cb-4fe1-a0c7-cc73a5d917cc","resolution":{"observed_at":"2026-08-15T16:12:07.923921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-04T19:11:59.598937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09748","last_updated":"2025-09-11T12:32:08Z","snapshot_observed_at":"2026-08-16T14:03:25.998004Z","submitted_at":"2025-09-11T12:32:08Z","title":"DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T19:11:59.598937Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.09748"},"observation_digest":"sha256:d02a392a80f941e6ec6c0c6f67f86fffec0d8e22aae4f908ea121003574a3486","observation_id":"93e93911-012d-41c8-95b2-a035cc226d4f","resolution":{"observed_at":"2026-08-04T19:11:59.598937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-04T11:29:36.628124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-13T22:52:06.796347Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.628124Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:8cb131c6d677e5faf833db91044e1d635ee32f41ed3988541919926e8892142f","observation_id":"f634f89e-bfc2-4b66-8aa0-d610f9a94a59","resolution":{"observed_at":"2026-08-04T11:29:36.628124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2510.06201","last_updated":"2026-05-04T15:09:53Z","snapshot_observed_at":"2026-08-14T23:22:36.170127Z","submitted_at":"2025-10-07T17:54:12Z","title":"TokenChain: A Discrete Speech Chain via Semantic Token Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T09:14:58.542628Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2510.06201"},"observation_digest":"sha256:a2511ea3a07b84b864c6f5b67dc2093ce36cc88f2a1c86db53c4e29c068a8b17","observation_id":"45072d0a-4ed1-4e45-8486-d449f290cad2","resolution":{"observed_at":"2026-05-18T09:16:09.506545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:7182eb81fbfbbb1f999cc1aab71131b95968adc298d80e13003e9b81e20d61fa","observation_id":"8f2ccafa-0bd7-47fd-bd41-f2e79f8858f2","resolution":{"observed_at":"2026-05-16T19:24:56.159190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-15T21:37:47.228626Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:b4658cd281f1995b4d73870b854a50d1ba925375e8d0633b3d8daf882c59955a","observation_id":"be168de6-39a7-449c-9b49-70883c5b8409","resolution":{"observed_at":"2026-05-10T23:50:51.681996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:27038f5ec0347ae618e5cda65f8e9ab65ec8acc5f9000d964ccf1ae519d7f864","observation_id":"b7b74c95-bbe2-4c41-8ceb-22ebd5ff1b46","resolution":{"observed_at":"2026-05-11T08:30:57.196874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:794bb008fa7b0ce36a99a9de3461b6cca6f78c1c93f551d16ea5332954cdd72b","observation_id":"fae34acb-80fa-4cd5-a6f1-5152c13aca10","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.11552","last_updated":"2026-04-19T12:57:45Z","snapshot_observed_at":"2026-08-21T23:13:14.984700Z","submitted_at":"2026-04-13T14:40:25Z","title":"MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:57:07.894455Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.11552"},"observation_digest":"sha256:b024b83bb1ec7aed5131db3b49ccb4f18978e4ee50f2d13e183bad256b492af5","observation_id":"e4a5a0c1-14fd-4266-8ec7-75aa23856e8f","resolution":{"observed_at":"2026-05-11T11:26:01.400475Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.15923","last_updated":"2026-04-17T10:28:21Z","snapshot_observed_at":"2026-08-18T07:25:07.600162Z","submitted_at":"2026-04-17T10:28:21Z","title":"Hierarchical Codec Diffusion for Video-to-Speech Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:01.260833Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.15923"},"observation_digest":"sha256:db238e7e618541656cc470f5ef3e49c1826afc94a4e423e957ffdbab3d19607e","observation_id":"cd698a02-fa82-4e54-85bc-f48c8cc23020","resolution":{"observed_at":"2026-05-10T08:12:26.301870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.19330","last_updated":"2026-04-29T12:12:36Z","snapshot_observed_at":"2026-08-16T16:01:43.787297Z","submitted_at":"2026-04-21T10:58:48Z","title":"Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T01:01:06.094276Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.19330"},"observation_digest":"sha256:54addee59c69380d45ef5e3d1afbe9c80c2e15cd2d345bc3e4f979c6a3f62413","observation_id":"9548e9dd-0c86-4d8a-8d3e-e1dd3b2ecd07","resolution":{"observed_at":"2026-05-10T01:04:50.114051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.22209","last_updated":"2026-04-24T04:26:04Z","snapshot_observed_at":"2026-07-31T01:17:34.846334Z","submitted_at":"2026-04-24T04:26:04Z","title":"UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T09:18:04.870414Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.22209"},"observation_digest":"sha256:5fa773257a925bdcd645fc420498882ae64d5a924bffe9bef1fa3e9a42aae977","observation_id":"2587db95-d30e-4031-941a-ee853a6e8982","resolution":{"observed_at":"2026-05-11T20:21:12.858379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-08-15T16:43:29.631683Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:bd2b126eb284238bce891e4cd47e4b74b30d2e75356724f0a286a85f1650ec88","observation_id":"a8e0ff9b-a39d-4744-837e-4ce17ed55243","resolution":{"observed_at":"2026-05-13T01:07:00.271270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-08-15T17:09:11.563055Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:31eeea96ada904aebfc3797fcb668f9819c71455c3a3f813ad79a28dd1514a13","observation_id":"b8583be2-aef0-4be5-98d7-8b637f38461b","resolution":{"observed_at":"2026-05-20T14:53:23.231264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:a71caa6c6fbb01b43fcbf34e5de91e57b7d8683e71e427590594df04ec8de7e5","observation_id":"d84b2da4-4d8a-4534-98c4-d35e80872289","resolution":{"observed_at":"2026-07-01T20:26:13.128977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.02638","last_updated":"2026-05-31T06:01:15Z","snapshot_observed_at":"2026-08-12T12:48:48.891022Z","submitted_at":"2026-05-31T06:01:15Z","title":"SegTune: Structured and Fine-Grained Control for Song Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T16:46:40.934795Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.02638"},"observation_digest":"sha256:9a6619ea11787941974868ed5354afb89703675b04a31ab9aa8f41640c4801ec","observation_id":"878f64a7-6f99-48d7-b9e5-f790dcad259a","resolution":{"observed_at":"2026-07-01T21:36:14.912924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:201322d9e4032e803ea6f0f45f0d57763277001276827da32c758eea6505ea9c","observation_id":"2ee16ea4-22a0-4f0d-8c81-d09cd0a93592","resolution":{"observed_at":"2026-07-02T05:16:39.738763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-08-15T01:27:29.832711Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:4ab4acd70073c4cc433422444bbe03d65307e97f5194cb29f333a9eea4763882","observation_id":"52ae7175-3f4a-40bf-9a0c-b0535720a546","resolution":{"observed_at":"2026-07-03T03:07:35.869017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-14T13:44:57.330652Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:cced1af900da676a08f2e1499aeb49565c288addb3a9b22f5e2aac83036768bd","observation_id":"372151ba-879e-49d0-939c-093574a86af6","resolution":{"observed_at":"2026-07-03T03:37:35.149517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.09234","last_updated":"2026-06-08T09:07:23Z","snapshot_observed_at":"2026-08-13T04:37:02.284524Z","submitted_at":"2026-06-08T09:07:23Z","title":"End-to-End Training for Discrete Token LLM based TTS System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:06.893507Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.09234"},"observation_digest":"sha256:77060688d3a54072485dc289dbf44043d6ec3fb659e6b757387b6559b63fefb6","observation_id":"3adf4026-52b5-4038-87fa-1fee4aa4c4b5","resolution":{"observed_at":"2026-07-03T03:27:34.897423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-08-13T01:33:39.410657Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:1951e789671a9ef30fe45d3fa857ffa6e86ca0d34fee36387a82a1719b29c1fe","observation_id":"026bcbb9-2253-4d3a-bbbf-3a0715c81c4c","resolution":{"observed_at":"2026-07-04T07:39:38.710628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-12T18:07:30.628246Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T07:02:36.499424Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:7e6f88c11567e5482f9aba734d4203c0cd936ba47773dea37f507e68bcd5ee5c","observation_id":"d10e45ad-c73b-40fe-90c6-c06deea7f08e","resolution":{"observed_at":"2026-07-04T12:19:49.610738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-12T12:44:20.831164Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-12T18:07:30.628246Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T12:44:20.831164Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:184ad8966975b7c15ede7679a38b913ae8b72948fe8d5179a1517a01e26329b8","observation_id":"c04579a6-0ded-4ff9-907c-34885ad06637","resolution":{"observed_at":"2026-07-12T12:44:20.831164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":202,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:0a66a89e5371ba7d4b821c3b0d976af94092cf6d36317b2dd69204e36767ba35","observation_id":"044e4142-2a3a-43d1-8098-8415a551a242","resolution":{"observed_at":"2026-07-01T11:45:47.141550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-12T13:34:06.515666Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:66f846844ae7fe58cbb6246d9472624a83380c6b1814730f9b3a03f23800131f","observation_id":"418d0736-613b-4ee4-98d4-f3e77d558404","resolution":{"observed_at":"2026-07-02T05:56:39.856520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-01T11:33:11.847608Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-20T07:41:47.263723Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:11.847608Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:56f57b2d7a1dad8ddef375232af8312631bd409cd2a3997af13e0e5d202a9b2d","observation_id":"60ab2a50-c696-4b5d-905b-9e54efd22029","resolution":{"observed_at":"2026-08-01T11:33:11.847608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-04T02:47:37.876645Z","title":"MaskGCT: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.876645Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:4d5dab32dcfd98c7623faea60e02aaf5f85b49d072cf7f404765d4f096ef7e58","observation_id":"0ed90ffa-6d2f-40e0-b4aa-a8a78347f78c","resolution":{"observed_at":"2026-08-04T02:47:37.876645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-10T04:20:42.329390Z","title":"arXiv preprint arXiv:2409.00750 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07462","last_updated":"2026-08-07T17:57:45Z","snapshot_observed_at":"2026-08-19T16:31:52.529349Z","submitted_at":"2026-08-07T17:57:45Z","title":"SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-08-10T04:20:42.329390Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.07462"},"observation_digest":"sha256:83ed8c7f2966edc970d7df2e331face4d22279e85cd12c5ff264e1f42aa547a3","observation_id":"4423d7a2-cb63-4f14-a32e-0d9655df8656","resolution":{"observed_at":"2026-08-10T04:20:42.329390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-12T00:10:40.826976Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08362","last_updated":"2026-08-08T23:17:09Z","snapshot_observed_at":"2026-08-18T06:45:08.583632Z","submitted_at":"2026-08-08T23:17:09Z","title":"CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:10:40.826976Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.08362"},"observation_digest":"sha256:2a312fa476238feef24858ee326e15b448817ba575aaa8739db376345eaad4d8","observation_id":"4dc0ab8f-49f9-4847-84ec-fe1532ef48a4","resolution":{"observed_at":"2026-08-12T00:10:40.826976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T00:36:21.752186Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer.arXiv preprint arXiv:2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-21T04:55:37.948237Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.752186Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:ba76d98e4684ffcab9394b14cf8c239dc3398be399f74d9491f0992054f4682c","observation_id":"d2eecb1a-ea0b-4bf8-93c3-ff37f5c41f39","resolution":{"observed_at":"2026-08-16T00:36:21.752186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T00:37:04.990844Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.arXiv preprint arXiv:2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.990844Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:aa6b5915af7015dce49809228d5f459d365f71b7f8f22823b4871931010ed3cd","observation_id":"ae40bb28-6d73-43a9-a72c-fa9cccee1085","resolution":{"observed_at":"2026-08-16T00:37:04.990844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.00750/citation-record","integrity":"/paper/2409.00750/integrity","json":"/paper/2409.00750/citation-record.json","paper":"/paper/2409.00750"},"outbound":[],"paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 62 inbound Pith citation observations for arXiv:2409.00750."}