{"as_of":"2026-08-20T08:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5e803b3d4caa5aca4e695e3c6051166cf1cb46f1d6c8a77d8173515bf3491c8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:04.860178Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T18:15:21.439861Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-12T20:13:57.058757Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.058757Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:48073c9b9e1b728aef7d45965b3d07f905a740661b5bf127aa8cc987eb3f6cbc","observation_id":"3b44d82e-5b4b-41e4-b5dc-22689577b166","resolution":{"observed_at":"2026-08-12T20:13:57.058757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-12T14:53:11.569946Z","title":"Xtts: a mas- sively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15262","last_updated":"2025-03-31T02:52:56Z","snapshot_observed_at":"2026-08-17T06:16:48.528716Z","submitted_at":"2024-11-22T10:25:08Z","title":"MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:53:11.569946Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2411.15262"},"observation_digest":"sha256:aca3460d9ec76cfecf00d935259da9ef0ead0229715da4dec099e3b4b915b96c","observation_id":"001694fd-0561-48ab-b3b8-b86b4adfdc41","resolution":{"observed_at":"2026-08-12T14:53:11.569946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-12T05:43:00.592537Z","title":"Xtts: a mas- sively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00174","last_updated":"2024-11-29T18:53:40Z","snapshot_observed_at":"2026-08-17T06:53:11.636673Z","submitted_at":"2024-11-29T18:53:40Z","title":"SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:43:00.592537Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2412.00174"},"observation_digest":"sha256:e9c1c80b6ebdfc365b78d259c56df4e270c9d7bccdd7fde1479b5e548da89466","observation_id":"381e9395-9d0b-40f2-93d5-f6b78ea70f34","resolution":{"observed_at":"2026-08-12T05:43:00.592537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-10T23:41:01.512970Z","title":"XTTS: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20048","last_updated":"2024-12-28T06:32:49Z","snapshot_observed_at":"2026-08-18T03:01:31.588464Z","submitted_at":"2024-12-28T06:32:49Z","title":"CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:41:01.512970Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2412.20048"},"observation_digest":"sha256:473de1e1736cf5b82f6746884cc716b2c93f498b588cdc48d00b84929dbd5f8f","observation_id":"99f0a98a-20ff-4fe6-ac2b-0712939f2c70","resolution":{"observed_at":"2026-08-10T23:41:01.512970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-09T16:43:08.663955Z","title":"o lge, G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-18T03:00:24.814227Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.663955Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:983f8cdf25655161590e997806a807bc012d206112dd4fbe3d1f3b6a3096e944","observation_id":"9a4a5a56-897e-4fa7-b9fc-06b5aa821aa5","resolution":{"observed_at":"2026-08-09T16:43:08.663955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-09T05:54:18.427049Z","title":"o lge, E., G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.427049Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:533303b62f930b37951268eb92e403ddd6d4635a7c01ca19868c4eecc7ccb994","observation_id":"4addb919-8823-4a23-bd6d-f0e0d6cfc1ba","resolution":{"observed_at":"2026-08-09T05:54:18.427049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T19:07:00.496354Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-19T06:28:38.381687Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.496354Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:18efdc00acba876f06f024a6c6796823367aa9fbbe2c881d7a508f55a38f9a1c","observation_id":"4b07bdf7-89e2-4fbc-bd3f-5ea2dc2abbf2","resolution":{"observed_at":"2026-08-08T19:07:00.496354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T18:27:07.057268Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05674","last_updated":"2025-05-22T06:13:29Z","snapshot_observed_at":"2026-08-18T22:53:17.896359Z","submitted_at":"2025-02-08T19:49:09Z","title":"ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T18:27:07.057268Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.05674"},"observation_digest":"sha256:56b63b947846274ce4294c8f0f504db69e656039e654c176a780868275204bde","observation_id":"90fc0f9c-b398-4c03-9fd7-39c5f559cfe7","resolution":{"observed_at":"2026-08-08T18:27:07.057268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T12:21:44.159764Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07562","last_updated":"2025-02-11T14:00:12Z","snapshot_observed_at":"2026-08-13T23:36:56.304820Z","submitted_at":"2025-02-11T14:00:12Z","title":"LoRP-TTS: Low-Rank Personalized Text-To-Speech","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T12:21:44.159764Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.07562"},"observation_digest":"sha256:7af2ea10ac23d48e16389ccb79b1af573781e082326b4c61245b76a1eeee983b","observation_id":"f39e4809-08c4-4f34-9f4c-803701fbe69a","resolution":{"observed_at":"2026-08-08T12:21:44.159764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-15T22:16:17.232012Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-19T00:25:29.376635Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:16:17.232012Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2505.07916"},"observation_digest":"sha256:00b98cc51ffc72f1b229edca2e4d3ceb69b46a3a7528e2f1af9aebcb9c738652","observation_id":"44f878d8-1be9-4f38-b1e1-9f7b288489c2","resolution":{"observed_at":"2026-08-15T22:16:17.232012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T14:55:54.665380Z","title":"o lge, G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-16T03:06:10.451896Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:54.665380Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:f3573e01b109de15393002c2c1fbf05312d58d797106143c608092eeee21d7f2","observation_id":"fb412036-97d5-4785-9018-d1fe2474c66e","resolution":{"observed_at":"2026-08-07T14:55:54.665380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T14:25:01.090834Z","title":"o lge, G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19119","last_updated":"2025-05-25T12:22:00Z","snapshot_observed_at":"2026-08-09T08:08:38.091653Z","submitted_at":"2025-05-25T12:22:00Z","title":"CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:01.090834Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2505.19119"},"observation_digest":"sha256:5a26e3b63c1f13a3c0e10f14b7729c6634b1d8bfcdb8598e717d1ada606e8503","observation_id":"0525e029-dec9-4ae9-b6b4-495de409f2fa","resolution":{"observed_at":"2026-08-07T14:25:01.090834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T13:08:14.471696Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22581","last_updated":"2025-05-28T16:54:36Z","snapshot_observed_at":"2026-08-13T17:41:13.055021Z","submitted_at":"2025-05-28T16:54:36Z","title":"Tell me Habibi, is it Real or Fake?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:14.471696Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2505.22581"},"observation_digest":"sha256:afb305d11c2eed4afd86f5c684aa666a014fe029e2fce70d55e551d0bf04bb76","observation_id":"fac6a78c-a3f6-4d43-b8ba-3408509a47ad","resolution":{"observed_at":"2026-08-07T13:08:14.471696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T12:27:25.084551Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-15T08:11:51.259191Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.084551Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:5c2f67ac98158f78f81ddc1ffeb3e9d8223380ba80c31e4d42538113725e84dc","observation_id":"7cf99313-2e9f-452c-ad98-1832a9f59aad","resolution":{"observed_at":"2026-08-07T12:27:25.084551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T11:56:29.213609Z","title":"Xtts: a massively multilin- gual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01020","last_updated":"2025-06-01T14:04:08Z","snapshot_observed_at":"2026-08-08T01:41:10.761298Z","submitted_at":"2025-06-01T14:04:08Z","title":"DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:29.213609Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2506.01020"},"observation_digest":"sha256:e2714553fade1f1f075e76bb6f63f6045651a747313297b5bea7ea918199a4a0","observation_id":"571a9844-a593-4402-ac6d-3aebec911138","resolution":{"observed_at":"2026-08-07T11:56:29.213609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T11:16:32.422722Z","title":"Xtts: a massively multilin- gual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-14T01:43:51.204987Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.422722Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:0e9fca9098c2f47ded3f00b02488f79beb95895771b9bfd94bbb9b448fd90e7f","observation_id":"975c135b-5556-4155-bad1-0e7301bc06e9","resolution":{"observed_at":"2026-08-07T11:16:32.422722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T13:17:51.188095Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05368","last_updated":"2025-05-28T09:13:41Z","snapshot_observed_at":"2026-08-13T16:23:56.745186Z","submitted_at":"2025-05-28T09:13:41Z","title":"Speaking images. A novel framework for the automated self-description of artworks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:51.188095Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2506.05368"},"observation_digest":"sha256:855148a533a8167b202ff2df5fd2abc544c3673e381a2451a0cf07e8c065799c","observation_id":"8d9afc30-17f2-4d57-80ad-22a25d830b56","resolution":{"observed_at":"2026-08-07T13:17:51.188095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T21:23:50.893642Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-19T03:36:11.709097Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.893642Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:c96825e7ab55a4457e35d2702ce104b4b29968e43e310f4379a0b3fb1428eb9d","observation_id":"6edb5495-89ea-4980-8374-716e9984d724","resolution":{"observed_at":"2026-08-06T21:23:50.893642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T21:00:06.463235Z","title":"o lge, G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01348","last_updated":"2025-07-08T09:21:24Z","snapshot_observed_at":"2026-08-15T06:50:03.655086Z","submitted_at":"2025-07-02T04:30:23Z","title":"SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:00:06.463235Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.01348"},"observation_digest":"sha256:944c3e1b2d6cc52979979ca0146aac6ae03409e9ba5b589b4280ce6ede22b2f9","observation_id":"edd82026-6223-44f0-bb48-c9e302ec281e","resolution":{"observed_at":"2026-08-06T21:00:06.463235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T18:06:31.756606Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09282","last_updated":"2025-07-12T13:39:25Z","snapshot_observed_at":"2026-08-17T23:13:27.964874Z","submitted_at":"2025-07-12T13:39:25Z","title":"ClaritySpeech: Dementia Obfuscation in Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:06:31.756606Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.09282"},"observation_digest":"sha256:ff38ebbd18ae510c3743397413293d598de314c800f1cdb492ce3d4de6ce3d70","observation_id":"2b05cb50-b374-45c7-bd32-9380b858d038","resolution":{"observed_at":"2026-08-06T18:06:31.756606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T16:55:49.583767Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.583767Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:e48224d13c4d32323d7ef31bcfcd5f1d2465e90aec67ae11f08341480a64a480","observation_id":"799f044e-036b-4f20-a99e-2041da5c1500","resolution":{"observed_at":"2026-08-06T16:55:49.583767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-15T17:45:47.353222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20579","last_updated":"2025-07-28T07:27:42Z","snapshot_observed_at":"2026-08-17T20:14:57.584272Z","submitted_at":"2025-07-28T07:27:42Z","title":"AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:45:47.353222Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.20579"},"observation_digest":"sha256:25af51d2b9c8565b3db0b982f8562a33c52fbc758a02c8bbf136c7290454fdc3","observation_id":"3cd6b2ae-2341-4b02-845f-a85ed67504cc","resolution":{"observed_at":"2026-08-15T17:45:47.353222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-05T22:17:38.311772Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-14T20:32:13.482450Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.311772Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:58d3f0595ee8a67f560ed54cafe5620dca9eea9282f5d83b87ab1691cac2c23d","observation_id":"e7f00805-43b9-4391-b1f9-c4d742d2f610","resolution":{"observed_at":"2026-08-05T22:17:38.311772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-05T22:17:25.394751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07337","last_updated":"2025-08-10T13:29:08Z","snapshot_observed_at":"2026-08-16T17:29:26.649700Z","submitted_at":"2025-08-10T13:29:08Z","title":"KLASSify to Verify: Audio-Visual Deepfake Detection Using SSL-based Audio and Handcrafted Visual Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:25.394751Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2508.07337"},"observation_digest":"sha256:67eccb09c5901a5406ca74598a827decad8963de3b1f9a0d88a31be93125cf68","observation_id":"34c86899-5cac-4b9d-88c5-b7d52daf0ed0","resolution":{"observed_at":"2026-08-05T22:17:25.394751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-04T15:51:48.942690Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.18413","last_updated":"2026-01-26T18:23:42Z","snapshot_observed_at":"2026-08-14T17:07:35.856602Z","submitted_at":"2025-09-22T20:57:48Z","title":"VoxGuard: Evaluating User and Attribute Privacy in Speech via Membership Inference Attacks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T15:51:48.942690Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2509.18413"},"observation_digest":"sha256:d2b8855aa3771c61c9be34a827e63cc49ff415d44d64dfe761a1efa30b132102","observation_id":"669adc67-2243-4bdd-85d2-9bca6c09596b","resolution":{"observed_at":"2026-08-04T15:51:48.942690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-04T10:17:45.506100Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-18T20:16:41.467735Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.506100Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:037bc757744c475b97237c05d15dd0b3f6aa09d585f605d15e21671dfe38c98b","observation_id":"aa2e9eef-15e4-4f97-aadc-7ed3d18401ba","resolution":{"observed_at":"2026-08-04T10:17:45.506100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2510.19414","last_updated":"2026-05-11T03:38:57Z","snapshot_observed_at":"2026-08-14T02:37:32.532007Z","submitted_at":"2025-10-22T09:34:31Z","title":"EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:01:57.044869Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2510.19414"},"observation_digest":"sha256:8ef7c4be59ec1b5e4bc13f9605a845ecfa907c608db7f9bb8ca757783f9e34fe","observation_id":"fc7db468-af1d-45d7-aa7a-683ac46d9380","resolution":{"observed_at":"2026-05-18T05:02:23.378403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2604.09111","last_updated":"2026-05-02T12:23:17Z","snapshot_observed_at":"2026-08-14T01:49:56.106441Z","submitted_at":"2026-04-10T08:42:45Z","title":"PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:43.379525Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2604.09111"},"observation_digest":"sha256:956942042dd17d0ea76cd4ada06768d024b2bdc7e9a5119376842841ea53492e","observation_id":"f25c780d-31be-4780-9fc6-e4680d44d235","resolution":{"observed_at":"2026-05-11T07:00:58.518478Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:d95c2d90a484927204fab0c08743f209399b21cf78bf50c12ef587a2babf338f","observation_id":"1fe1ca6c-7490-4a4b-b22b-9ab94179b8ef","resolution":{"observed_at":"2026-05-11T08:30:57.105245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2604.13229","last_updated":"2026-04-14T18:56:13Z","snapshot_observed_at":"2026-08-02T00:07:11.058562Z","submitted_at":"2026-04-14T18:56:13Z","title":"ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T13:31:12.802897Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2604.13229"},"observation_digest":"sha256:f2c36bff5aceef99d705d6a79656c0018d411318ba1e6e9ebaa57579f4e15130","observation_id":"00793784-0913-4347-8e8e-541819072528","resolution":{"observed_at":"2026-05-10T13:35:26.593634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-14T11:48:38.526912Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T04:35:58.032597Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:f71c697ca6487210a771a736a655700b26959ffbe9422998554e71210524cd40","observation_id":"33706689-396b-4f9d-8b80-a85ebcb489c5","resolution":{"observed_at":"2026-05-11T21:41:16.067515Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-14T11:48:38.526912Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T01:43:48.555523Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:2ef1a9e3301be2fa7259e7a2c98fc1986201670c96c45a8f7560e8bc81f30793","observation_id":"965f1998-4cd8-47e4-b757-8f6294a251cf","resolution":{"observed_at":"2026-05-12T01:46:13.922407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-16T17:28:12.915614Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:fb897f43a03f1a6e32a3ef6b2222b4c8ca1924433157b789fc9ed634a3d74fc8","observation_id":"6cc82a9c-52ba-42da-a254-31a51a9486ed","resolution":{"observed_at":"2026-07-02T19:47:19.766782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-14T13:44:57.330652Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:3676d6309d5fd5e81b65b767db81aa2473122e6ae47e14cd75319518fba4c02c","observation_id":"7269ea7c-ab9d-4626-aff0-12e5934a871a","resolution":{"observed_at":"2026-07-03T03:37:35.138017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.18319","last_updated":"2026-06-22T12:15:05Z","snapshot_observed_at":"2026-08-15T09:25:41.045173Z","submitted_at":"2026-06-16T13:43:14Z","title":"ASTRA: A Scalable Next-Generation ATCO Training Simulator with Autonomous Simpilots","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T01:05:20.432379Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.18319"},"observation_digest":"sha256:9960da7a30da9039799a179a0c521a5f72043670b38771cf47d0b7462d8cd212","observation_id":"441dfd27-e0cf-4caf-9bf7-99575e308264","resolution":{"observed_at":"2026-07-03T20:58:57.489402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-08-13T01:33:39.410657Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:545438d5cec5dd7abfa4affde3bf681bf8b6bbd1d8f6d47f40f7e84d85bc1edf","observation_id":"d5ee5b57-f32b-4296-ac7b-0c1f4e02ec94","resolution":{"observed_at":"2026-07-04T07:39:38.713811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.26618","last_updated":"2026-06-25T05:27:18Z","snapshot_observed_at":"2026-08-14T10:11:42.221240Z","submitted_at":"2026-06-25T05:27:18Z","title":"Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:03.268025Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.26618"},"observation_digest":"sha256:09285094c3166a1548ed5a5ee48c2ab437754d9f58cbd42c075d48fb4b6f4bc9","observation_id":"ee8dd6a8-4006-4da5-a60b-885fb9a5e925","resolution":{"observed_at":"2026-07-04T13:19:50.257927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.28002","last_updated":"2026-06-26T11:59:05Z","snapshot_observed_at":"2026-08-18T22:14:29.996240Z","submitted_at":"2026-06-26T11:59:05Z","title":"Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T04:28:58.482098Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.28002"},"observation_digest":"sha256:efed76b44616866d968cae4bda849ad693272a01455b44a163d9d0730493535a","observation_id":"b8ea5c51-58d3-474d-b08a-9fedb9e9d281","resolution":{"observed_at":"2026-07-01T16:55:50.944908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:45fd4cdc4b24224a6cf62f8a9eef29aab8422f31960a6e1e72105e82a8bf3948","observation_id":"7458003e-2b4e-4e18-b7b1-5c7fa97dd716","resolution":{"observed_at":"2026-07-01T11:45:47.186169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.04904 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8db1b8b2f20a70db6f601d9407bf53eb1f46dc3a702e9ff97615feb54d9669cb","observation_id":"469e6569-08bc-43f5-ba0c-b09e242ddf96","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2406.04904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-08T18:15:21.439861Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model","venue":"eess.AS","work_id":"0fdda5f3-0b91-4735-8335-b150db16d2b8","year":2024},"citing_paper":{"arxiv_id":"2607.06054","last_updated":"2026-07-07T09:31:19Z","snapshot_observed_at":"2026-08-14T10:10:54.178445Z","submitted_at":"2026-07-07T09:31:19Z","title":"BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T18:09:22.207379Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.06054"},"observation_digest":"sha256:fe41d90961ea4455fe9f74bb6a693d7d289d26d20cf86f6a555f5340aeb3c744","observation_id":"e7758f09-b868-4f3e-a232-1f9dd80f55e6","resolution":{"observed_at":"2026-07-08T18:15:21.442023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-13T02:22:47.820537Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09530","last_updated":"2026-07-22T14:29:04Z","snapshot_observed_at":"2026-08-14T06:48:02.167363Z","submitted_at":"2026-07-10T15:36:30Z","title":"FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T02:22:47.820537Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.09530"},"observation_digest":"sha256:a4054c556d9a9ec404b0739e1e84862786dcdb5ce81cd1c8923a4003d3d697b9","observation_id":"8f49aece-a048-4a0f-9b5b-bca81cdea929","resolution":{"observed_at":"2026-07-13T02:22:47.820537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-02T07:39:22.737607Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09530","last_updated":"2026-07-22T14:29:04Z","snapshot_observed_at":"2026-08-14T06:48:02.167363Z","submitted_at":"2026-07-10T15:36:30Z","title":"FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T07:39:22.737607Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.09530"},"observation_digest":"sha256:9902ffb564c074c18ead271704e69fe9a8bec838f3cf97491ddad54b1c2b5b9e","observation_id":"f0814c3d-3be4-4616-810c-4572890cc750","resolution":{"observed_at":"2026-08-02T07:39:22.737607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-14T14:47:58.592181Z","title":"XTTS: A massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09891","last_updated":"2026-07-10T18:29:24Z","snapshot_observed_at":"2026-08-18T04:16:48.420297Z","submitted_at":"2026-07-10T18:29:24Z","title":"What You Train Is What You Get: Gender Bias, Training Composition, and Post-Hoc Mitigation in Audio Deepfake Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T14:47:58.592181Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.09891"},"observation_digest":"sha256:259f242d0e74df595023148484e2ada9fee20225e3a319ec2a6a891ac8c5e3a5","observation_id":"598472a0-17c8-4bad-a142-30cdc42e8ed0","resolution":{"observed_at":"2026-07-14T14:47:58.592181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-02T01:12:29.763464Z","title":"Xtts: a massively multilin- gual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14753","last_updated":"2026-07-16T09:38:45Z","snapshot_observed_at":"2026-08-14T02:41:14.466076Z","submitted_at":"2026-07-16T09:38:45Z","title":"Large Audio Language Models for Spoofing-Aware Speaker Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:12:29.763464Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.14753"},"observation_digest":"sha256:5a113fb7824dcc84d451e15f72a18faf5dadff924cbd69db823da6990327da00","observation_id":"fd0d35ac-7503-41bd-bf97-9c3a0b5ea50a","resolution":{"observed_at":"2026-08-02T01:12:29.763464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-15T15:22:08.936770Z","title":"arXiv preprint arXiv:2406.04904 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00722","last_updated":"2026-08-01T15:41:55Z","snapshot_observed_at":"2026-08-19T12:18:54.514431Z","submitted_at":"2026-08-01T15:41:55Z","title":"Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T15:22:08.936770Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.00722"},"observation_digest":"sha256:ba0712b39d746a9438876c59ca1f2c0629b01a955b6c60ecff1fc7f6a9616db3","observation_id":"a8ba440a-6caa-404a-8a3f-2ea1a06ce577","resolution":{"observed_at":"2026-08-15T15:22:08.936770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-04T20:44:55.937047Z","title":"Casanova, et al., XTTS: A massively multilingual zero-shot text-to-speech model, arXiv preprint arXiv:2406.04904 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01796","last_updated":"2026-08-03T07:04:51Z","snapshot_observed_at":"2026-08-15T08:47:48.197657Z","submitted_at":"2026-08-03T07:04:51Z","title":"Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:55.937047Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.01796"},"observation_digest":"sha256:3b9ef104a316593ad664a59018e45bb6da8c4c305fb22ff46ee9b010468d88d2","observation_id":"605b69c7-9d09-4ff3-a2c6-dcfc54792be3","resolution":{"observed_at":"2026-08-04T20:44:55.937047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T11:50:21.155761Z","title":"arXiv preprint arXiv:2406.04904 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-15T10:49:11.108765Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.155761Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:617058a84c551c88b04275554122c6e6de95b0303f9d521377b835dbe09081d5","observation_id":"93d279d8-29c1-4fd5-afc8-1017556a9f8e","resolution":{"observed_at":"2026-08-08T11:50:21.155761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-10T04:20:42.302908Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07462","last_updated":"2026-08-07T17:57:45Z","snapshot_observed_at":"2026-08-19T16:31:52.529349Z","submitted_at":"2026-08-07T17:57:45Z","title":"SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-10T04:20:42.302908Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.07462"},"observation_digest":"sha256:6b30329a7f119a35e775508316a026fa9a6cdc6cce14369e68de871aef191e99","observation_id":"e0c1e541-27dc-4abf-b71e-723a4dae2e4a","resolution":{"observed_at":"2026-08-10T04:20:42.302908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-16T00:36:21.601698Z","title":"XTTS: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-19T11:38:34.761607Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.601698Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:bc4fbde6c04c4a9a4b90043225012bf0c1a18ed0000500686abbdaa94b677504","observation_id":"168de320-8cbc-4adb-9c74-5a0875765363","resolution":{"observed_at":"2026-08-16T00:36:21.601698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-16T00:37:04.860178Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.860178Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:034d6c2ced2ee212d47880b098b6737e7658cdb2b81e9246a18114cb8034c88c","observation_id":"24f6b3a3-7e86-4b8a-bf33-72248c77c095","resolution":{"observed_at":"2026-08-16T00:37:04.860178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.04904/citation-record","integrity":"/paper/2406.04904/integrity","json":"/paper/2406.04904/citation-record.json","paper":"/paper/2406.04904"},"outbound":[],"paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2406.04904."}