{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:659770b665e819d3a15e921276b9b4c4f9631d4a1b48ad95e35ba775c14badc2","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:22:00.140173Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:50.544402Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:19:49.633371Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2601.03170","last_updated":"2026-05-17T15:46:48Z","snapshot_observed_at":"2026-08-01T18:23:10.248430Z","submitted_at":"2026-01-06T16:51:04Z","title":"TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T15:33:08.885667Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2601.03170"},"observation_digest":"sha256:f2974715b77b438b442c260fbf574998c7a1bd5a484e5df9bdcfc74ed9fa7d1f","observation_id":"cf142752-2af7-45bc-9cb5-7725da8b0756","resolution":{"observed_at":"2026-05-21T15:34:15.080474Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2601.22143","last_updated":"2026-05-11T12:30:46Z","snapshot_observed_at":"2026-07-06T22:43:35.226546Z","submitted_at":"2026-01-29T18:57:13Z","title":"JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T09:55:32.044506Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2601.22143"},"observation_digest":"sha256:e361d00d3845ac7258ee6c634c9c9c057846a89de47d2296061a1b750a1a0752","observation_id":"e574c656-9807-4a67-97f2-0ac729782f23","resolution":{"observed_at":"2026-05-16T09:57:42.883160Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-02T22:51:21.928324Z","title":"IndexTTS2: A Break- through in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15519","last_updated":"2026-06-08T11:40:00Z","snapshot_observed_at":"2026-08-04T03:59:57.330735Z","submitted_at":"2026-02-17T11:47:56Z","title":"Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:21.928324Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2602.15519"},"observation_digest":"sha256:e24d1b11baa2c3d09ff2a5deca16858d32eea0e7bd05f3ff344a31c8614986d8","observation_id":"3bf6e419-1013-4bed-8f91-02ff709e7272","resolution":{"observed_at":"2026-08-02T22:51:21.928324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:7e729b2fd7cdc58fb2a46ef399cc8e864dcf37481728550cefe7b87c190ef04f","observation_id":"878d1998-5126-475c-b0c5-ebb94ffe3517","resolution":{"observed_at":"2026-05-13T23:03:24.931802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-06T15:48:40.631159Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:42fafec3665a8951f9b95c0ef7ff75ba9d25a83adcd8032a373b9b63345e279a","observation_id":"5d1be585-afb8-4162-8a6d-24ba3001dc1f","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:5c0182d2e4b2023d592c11a054b6b5f8530d65d8008b88dd7dc8f2b121682574","observation_id":"3b01ef42-a07b-480a-a239-4229b954d18f","resolution":{"observed_at":"2026-05-13T20:58:15.994347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:e0acf6f6b233649d804fef30dbfb3879695f3b0f8c9bf9c99d042a118043a578","observation_id":"0ef942c6-ff61-45d8-b44d-fa72ec1c2ae4","resolution":{"observed_at":"2026-05-11T07:16:00.305794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.12292","last_updated":"2026-04-14T05:03:57Z","snapshot_observed_at":"2026-08-06T05:09:28.270784Z","submitted_at":"2026-04-14T05:03:57Z","title":"CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:58.010112Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.12292"},"observation_digest":"sha256:3cdf68b2668a35d3d961d112f68e07c05ded6678240d269d3a69532bb7bf0603","observation_id":"713eefad-13f9-4a93-b473-955a704b9278","resolution":{"observed_at":"2026-05-11T09:51:00.754781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.17435","last_updated":"2026-04-19T13:34:52Z","snapshot_observed_at":"2026-08-03T18:14:19.780984Z","submitted_at":"2026-04-19T13:34:52Z","title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T05:36:07.090627Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.17435"},"observation_digest":"sha256:81d7a449e0711bcb8e3dd5ba471bbdb94837167ef7f9dd1654b2a8aeb2c50420","observation_id":"03223873-a2f7-4fdd-b941-df791230ca24","resolution":{"observed_at":"2026-05-10T05:41:02.500305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.22225","last_updated":"2026-04-24T05:01:55Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T05:01:55Z","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:11.243693Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.22225"},"observation_digest":"sha256:af0c34299477a64672273f412cbaac4d3690d995f36fb446852a449b43a26ec9","observation_id":"8a395226-b98f-488a-bfcc-795612a049bd","resolution":{"observed_at":"2026-05-11T19:21:10.007737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.23742","last_updated":"2026-04-26T14:42:50Z","snapshot_observed_at":"2026-07-06T23:09:52.860780Z","submitted_at":"2026-04-26T14:42:50Z","title":"RTCFake: Speech Deepfake Detection in Real-Time Communication","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T05:29:45.895667Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.23742"},"observation_digest":"sha256:88cc50e9b0b8853c4510f1d276d8fb57de06fb227c3f0ff873ddf3f291c2144a","observation_id":"ec3507fd-42e6-4b9f-af66-555e92b2e64e","resolution":{"observed_at":"2026-05-11T21:26:17.854987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:3ee2c0c8546d5655be60c4725f3f9c692c069006e4088e7c77f83216436b6811","observation_id":"598b00b6-b804-4a36-8a51-1ca6d28b3aee","resolution":{"observed_at":"2026-05-12T09:11:27.102735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-02T15:21:28.806423Z","title":"Indextts2: A breakthrough in emotionally expressive and duration- controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.806423Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:af12f8d94ce0e9b426ea8ee1bf167cf9c0f22eca86c1501bd90b281474b491d4","observation_id":"3ba17a93-84ad-456e-98e6-97359ecd5833","resolution":{"observed_at":"2026-08-02T15:21:28.806423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:6c72036d8c30d1617e8160bacd7cb6194ba443d520079f4f37b01179c807db34","observation_id":"235e690a-a3f6-4cf0-b49c-a4865a81eac1","resolution":{"observed_at":"2026-05-11T04:50:56.070996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.11866","last_updated":"2026-05-20T03:22:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:36Z","title":"AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:06:54.972846Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.11866"},"observation_digest":"sha256:e0fee432c42489cdf1d69c458eb2cb17a22967fcd28609916dcaaf5e99fe9dc6","observation_id":"fe258340-112e-4730-990b-7bc43fc0e81f","resolution":{"observed_at":"2026-05-13T05:07:17.280453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.11866","last_updated":"2026-05-20T03:22:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:36Z","title":"AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T08:28:21.790110Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.11866"},"observation_digest":"sha256:f8e94cd7a4864597519fc84984e0d37b80e38a2a8af484db76ef762a8f60293f","observation_id":"c7b3091e-e029-4632-9041-6273c134b334","resolution":{"observed_at":"2026-05-21T08:29:52.767862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.15202","last_updated":"2026-04-01T13:38:36Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-04-01T13:38:36Z","title":"DeepSlide: From Artifacts to Presentation Delivery","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T18:03:02.253422Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.15202"},"observation_digest":"sha256:e8ad0c01c648c0683fccaccb3cc10fd00173f262ae671720d5a4381caef6f37e","observation_id":"c36b7f05-03d9-4e50-a73a-d1e5dccec9b1","resolution":{"observed_at":"2026-05-19T18:03:10.135599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.16026","last_updated":"2026-05-15T15:01:45Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:01:45Z","title":"From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T19:25:18.488377Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.16026"},"observation_digest":"sha256:04e5ee58366fea114b16c59e1d2416806a5d827685381fbba7399c88072b0627","observation_id":"cdc9418e-d138-41ec-8f3e-14063841f124","resolution":{"observed_at":"2026-05-20T19:28:55.031428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-02T22:28:42.271827Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:4b11e29464676f9fb4f1a533e8fdb7462022337b6882a56f7389bf5b4eae6e01","observation_id":"a5dc0fd2-ca5e-4249-aa34-398776f16c9a","resolution":{"observed_at":"2026-05-20T21:19:03.232955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T02:56:06.910758Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:c81ce492267f337294ef2d4105e1ae06efb72e9797be80915c5169469668b3cc","observation_id":"579f3555-339b-4a1c-9417-fdf45cda185a","resolution":{"observed_at":"2026-05-22T03:00:59.040259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-02T13:29:53.802184Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.802184Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:c4cd0e4d6f323d7157e5d2a0823733fd46f2f69c02aaa0f5b340ff99b214a645","observation_id":"8144dd9c-78d0-4466-b216-679c9b414ff1","resolution":{"observed_at":"2026-08-02T13:29:53.802184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:be1717eca6419760176c07c8da69c217541336ea018be927b0a87a1f79f2821e","observation_id":"2830a0fb-9f2d-4eea-aede-ebac1bee36ff","resolution":{"observed_at":"2026-07-01T20:26:13.082455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.00066","last_updated":"2026-05-20T07:46:16Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-20T07:46:16Z","title":"DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T17:35:06.352720Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.00066"},"observation_digest":"sha256:67d3f3950a0abee182f9697a3fb2cd78600ac2360f09f9568e410f9ad0953a6e","observation_id":"22e6c8c1-4c35-4e15-8038-3119b51f83a9","resolution":{"observed_at":"2026-07-01T15:05:48.523055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:f2a204c8d8d2ae27960e5aef52ffa989875608ea16776b36c5df39f0f6581bb2","observation_id":"6815c925-6871-483f-bd92-24d4edcbc89c","resolution":{"observed_at":"2026-07-01T20:46:13.835687Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:210216a84b82a0deeec224864a6832dd0e092187a5e8cf8e1f2e3db71b94da6a","observation_id":"16f5240f-3f96-4f1c-bfe6-8bd5849f9f77","resolution":{"observed_at":"2026-07-02T00:46:24.634388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.05896","last_updated":"2026-06-22T18:29:42Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T09:03:43Z","title":"Resonant Minds: Closed-Loop Social Avatars with Theory of Mind","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:04:39.753443Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.05896"},"observation_digest":"sha256:52a1412a97852ab816fdf4d2ba673ad60bb9b95d366e3f1db777fc202c02eb04","observation_id":"61fcceb1-562f-404d-837d-ba92ee5d31c3","resolution":{"observed_at":"2026-07-02T12:36:56.224385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.06940","last_updated":"2026-06-10T06:55:49Z","snapshot_observed_at":"2026-08-03T21:56:13.034676Z","submitted_at":"2026-06-05T06:11:38Z","title":"Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:16:07.007759Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.06940"},"observation_digest":"sha256:a96fc5f406448bab7ba842bc57e3dc674ac93fff4ea9b819f585eb0005452adc","observation_id":"0be20842-bbf1-47f6-9ecb-4f2e9eb7446c","resolution":{"observed_at":"2026-07-02T19:47:20.002939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:262dfbb6d768342bbc200d7f651d435a0408e7082d116dd9891383a3144f90cc","observation_id":"cc9f9742-5fa6-4233-a3fb-1f7dd5b91dd0","resolution":{"observed_at":"2026-07-03T03:07:35.857767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-02T19:31:55.030656Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T08:38:51.371500Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.11611"},"observation_digest":"sha256:b90ba45a0e018b57dae060eb8a2a3e88a99cf6c9b7a949b6ea55668f5f683daf","observation_id":"8581762d-eee4-4332-9ce6-51353a517a4c","resolution":{"observed_at":"2026-07-03T12:58:08.371843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:f88980ffc5cc37d21a102231cd905f45efebec5132691dcaba5892f67cab6585","observation_id":"c83c0c63-cb90-42d8-827d-dff5dd9adeb3","resolution":{"observed_at":"2026-07-03T18:08:46.958514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.20650","last_updated":"2026-06-08T06:54:55Z","snapshot_observed_at":"2026-08-02T23:08:38.292740Z","submitted_at":"2026-06-08T06:54:55Z","title":"EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.972071Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.20650"},"observation_digest":"sha256:e7cb8bdca1ed5df3c03f4be36f7a180553af7118fc5dd6a678423cc6668a02ef","observation_id":"7a8912fd-aeef-48a7-b060-41486a59264a","resolution":{"observed_at":"2026-07-03T00:47:30.572183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-07-30T09:03:07.020192Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:ddaf87fb7d8e579e639815a03c2df1d7412142debe37afe0ac9b2d87507fc893","observation_id":"3fcbdf0b-04d4-4188-a95c-e24b4faa8ff1","resolution":{"observed_at":"2026-07-04T07:39:38.701979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T07:02:36.499424Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:72046c8ecd641fd361b62f97c77078be19d324ebc82bcaf43d8593fd323b7190","observation_id":"8dde18c9-d7bb-4c47-b60f-d6c59ab96167","resolution":{"observed_at":"2026-07-04T12:19:49.634822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-12T12:44:20.831164Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T12:44:20.831164Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:5a969c3aed0e90d6a591d472e5055b301dfb76baa4e88ecaf344fcfd7367a1de","observation_id":"04d45292-d23e-45b6-b3ed-a2e00b37f448","resolution":{"observed_at":"2026-07-12T12:44:20.831164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T09:35:03.660671Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:080496d53174fd9c0fb3d1dd14fd48b00d2b550be9b86b8c3b0cdb4b1c943a60","observation_id":"997da372-83b8-4418-a395-df4cb3399f5d","resolution":{"observed_at":"2026-06-30T12:54:40.709861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-12T11:11:08.878850Z","title":"Indextts2: A breakthrough in emotionally expressive and duration- controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T11:11:08.878850Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:ddca0c03b6c679ea3767aafaafe9b9a7c15b4f183115c13786cb28e99f7223bb","observation_id":"5b46fa76-577d-4a5a-aaf2-9b813acae9fd","resolution":{"observed_at":"2026-07-12T11:11:08.878850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.31128","last_updated":"2026-06-30T04:46:45Z","snapshot_observed_at":"2026-08-06T13:27:09.813532Z","submitted_at":"2026-06-30T04:46:45Z","title":"UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T04:05:27.343684Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.31128"},"observation_digest":"sha256:d9385e6c54ecb1c778ff86752d208c753979825cde90850451338b3bae6dc009","observation_id":"cf0a7c94-810c-486b-80c0-50d42fcc5bd4","resolution":{"observed_at":"2026-07-01T11:45:46.182730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-04T02:47:37.726590Z","title":"IndexTTS2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-06T23:11:30.635520Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.726590Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:63810ccf6e97c2f87d89a9267a688fe9fb2a82aa80c23d429591301250905867","observation_id":"28686fc6-7cc7-4693-887f-911c13a40eba","resolution":{"observed_at":"2026-08-04T02:47:37.726590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-04T16:29:31.531580Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech.arXiv preprint arXiv:2506.21619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T08:12:53.297236Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:31.531580Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:53aa8b00d524d274bdb88808e0d5ea22164fe7547e5d3888269859730ad1736e","observation_id":"8a132f17-e405-42be-b8b7-27ec31c2d703","resolution":{"observed_at":"2026-08-04T16:29:31.531580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-07T00:14:50.544402Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech.arXiv preprint arXiv:2506.21619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T08:12:53.297236Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:50.544402Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f8b50158b4a66fd2ffaed91c9de47a9043e7ba2a422c6641a1adc1a44acef2f9","observation_id":"a0cdb54b-a9a6-4ab2-9ced-30c4f7c6082c","resolution":{"observed_at":"2026-08-07T00:14:50.544402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-06T04:46:39.932052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05126","last_updated":"2026-08-05T17:50:31Z","snapshot_observed_at":"2026-08-07T08:10:33.903790Z","submitted_at":"2026-08-05T17:50:31Z","title":"Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:39.932052Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.05126"},"observation_digest":"sha256:bad6107903e81ab79eb2041ff2efdd14b43451d20f7053ad12c087281159dedc","observation_id":"f2a5988c-5344-4936-b561-59216c21ed4d","resolution":{"observed_at":"2026-08-06T04:46:39.932052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21619/citation-record","integrity":"/paper/2506.21619/integrity","json":"/paper/2506.21619/citation-record.json","paper":"/paper/2506.21619"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T23:21:51.474748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.474748Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:f0e0baf1064d18ebdd8b189087cf89c7d1e44f77b326b68e14637174c2b185c2","observation_id":"ba6482a5-3d62-479f-b595-93150211c630","resolution":{"observed_at":"2026-08-06T23:21:51.474748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:09.442048Z","title":"C.; Vidler, J.; and Roedig, U","venue":null,"work_id":"118cb3f9-d6eb-4a41-8fc3-b73aa44518b6","year":2016},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.714747Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:afac6f3b5a119b13489a6dd67096235b39e2224432e740aa1abd1b037d891a5c","observation_id":"1fbb62bb-fe07-419b-8184-9c3d8349b7d2","resolution":{"observed_at":"2026-08-06T23:22:09.568747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:09.236940Z","title":null,"venue":null,"work_id":"89a61f67-fc08-4c2f-85e6-f2861b3ca4c5","year":2017},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.891560Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:d581b06e4623b38030ce7a175af78356bbf859ba4b12163069a0e53936cb3386","observation_id":"857060fd-8691-4b3e-a815-b652d61d99d7","resolution":{"observed_at":"2026-08-06T23:22:09.343035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:09.034468Z","title":"o lge, E.; G \\","venue":null,"work_id":"8fa8d246-b0d1-4c30-b88e-1cfad71b787e","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.984742Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:94b110312de57fab48301072bcf89250ebf25c724f8b51bc309a6e21d0b173f6","observation_id":"55ae0086-9ecf-43fc-b66e-0443261bdd61","resolution":{"observed_at":"2026-08-06T23:22:09.141449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.782744Z","title":"T.; Rubanova, Y.; Bettencourt, J.; and Duvenaud, D","venue":null,"work_id":"6d324970-3118-4af6-9c42-1dd8c31caf51","year":2018},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.090822Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:cf689bda9af2cddfd1efbd3c04e27dc96496c7b1e3fad6f132940eac9e62196f","observation_id":"ed11d40d-2d66-4e37-8525-c8ea8db6105e","resolution":{"observed_at":"2026-08-06T23:22:08.907713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12139","last_updated":"2024-09-24T02:00:54Z","snapshot_observed_at":"2026-08-02T15:34:06.836535Z","submitted_at":"2024-09-18T17:03:12Z","title":"Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12139","snapshot_observed_at":"2026-08-06T23:21:52.191734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.191734Z"},"links":{"cited_paper":"/paper/2409.12139","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b74b50d773cff2c2d94196713532d237233c55c35afb844fd02de9ca598110a1","observation_id":"7c44ba08-afc8-4dbf-94ea-b407c5446dd0","resolution":{"observed_at":"2026-08-06T23:21:52.191734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.571051Z","title":null,"venue":null,"work_id":"be8241c3-60bd-4a19-b683-ea5179f97abe","year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.374989Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:36755e36eb28995482c4f916841b8c27561e84e4b7c0bd9def0f8c05e635b3ac","observation_id":"1e47c365-9195-4e19-8118-c14e329e8df8","resolution":{"observed_at":"2026-08-06T23:22:08.664334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T23:21:52.491309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.491309Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:0fe878a7ccca86efe49f3a7bb653a9f9a82552456096c474cac48adbfced66cf","observation_id":"c7f49650-edd8-42f0-9b75-ed6c67c51a73","resolution":{"observed_at":"2026-08-06T23:21:52.491309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.360063Z","title":null,"venue":null,"work_id":"3271598d-805a-4551-80ad-81a28cd80dca","year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.584839Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:725e896bd40bd97acd5398a1470791e04334087634ab6897bdd1935210c8da54","observation_id":"3389ed9b-60d1-4229-a949-802ace936876","resolution":{"observed_at":"2026-08-06T23:22:08.443414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.073273Z","title":null,"venue":null,"work_id":"516019fc-c7e3-4fc7-80e7-c35ed9068944","year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.694748Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:938440c526ff5b9f27b5e271111939a74cb78b43e66349fa1bedfa81f29489d3","observation_id":"ed3fd843-b8d4-447d-8fe2-389ea4370182","resolution":{"observed_at":"2026-08-06T23:22:08.224525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-05T17:33:03.736753Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-06T23:21:52.901086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.901086Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:a467de33f4ebe23396699e2d91e822855dd34eac1df7eca321826fc30263d9dc","observation_id":"743b8f20-f8f9-484d-9729-16dcc0f97530","resolution":{"observed_at":"2026-08-06T23:21:52.901086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:07.837067Z","title":null,"venue":null,"work_id":"f99ed51f-9f05-45d2-9ecf-b4d072de23b4","year":2018},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.044748Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:53a7c4aed40c1255cee734eab811e705d5f0cdce25cabad6d97de39216505c88","observation_id":"2e9b7afa-6e45-4de3-965f-74d7e921dc57","resolution":{"observed_at":"2026-08-06T23:22:07.977427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T23:21:53.174876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.174876Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:bd75a6f8d0febc8b99f30105ce46f21053c9e0b066175d32e326b833b266ab8c","observation_id":"eef22172-612c-406c-8739-4ca04512428d","resolution":{"observed_at":"2026-08-06T23:21:53.174876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T23:21:53.286323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.286323Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:221af78d6c564f53cbf8a174f2091b98c2f9c3932802a7c0e1eeb8cf71bc4097","observation_id":"109b26b9-bb32-4ca1-a88b-3a458c154038","resolution":{"observed_at":"2026-08-06T23:21:53.286323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:07.528674Z","title":"A.; and Wang, H","venue":null,"work_id":"fda58668-b7a2-45de-a2a8-ae6f48c3dee7","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.404945Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:e0bf7097bc7bd2b703d7767f59d5ddc41793e4c68f8e061eea245c2189151bbb","observation_id":"248496b5-51e7-4c45-834d-fdca8bf8d666","resolution":{"observed_at":"2026-08-06T23:22:07.662270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:07.235039Z","title":"E.; Wang, X.; Thakker, M.; Li, C.; Tsai, C.; Xiao, Z.; Yang, H.; Zhu, Z.; Tang, M.; Tan, X.; Liu, Y.; Zhao, S.; and Kanda, N","venue":null,"work_id":"c342525b-41b9-4b4d-bd3c-d17126d41c6e","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.514918Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b6497e77fb7e10014e65f5089ef1f08bb5092b990e3624b8efce0a44956210fb","observation_id":"68dc8c7f-92f3-436d-8588-5b356d0e5ff6","resolution":{"observed_at":"2026-08-06T23:22:07.397033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:06.954753Z","title":null,"venue":null,"work_id":"aec97304-cc5c-4e94-9363-613c67bd28ec","year":2016},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.654824Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:04e01726d3a0ba0106c0b1f9930e96d51d45090f60185551d7365f730c5d69f0","observation_id":"ff85a550-8a16-46de-9218-987d9ba51989","resolution":{"observed_at":"2026-08-06T23:22:07.073937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:06.581929Z","title":null,"venue":null,"work_id":"f12d88bd-382b-4f0c-8053-c1d1b4099ab8","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.794860Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:8906c29a62f0e5df160e25776326ec2a359ac1e9720e5ffe7c7d025ba181b434","observation_id":"3ecb148e-6917-4155-b0bc-9b5bbfe8e867","resolution":{"observed_at":"2026-08-06T23:22:06.782697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:21:53.970330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.970330Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:0f457c9a1d970c6c8592f7a43e1d31b82a132496c8c768d43a5789aa12baa7d0","observation_id":"1112caf4-2c01-4233-bab7-13bf90d6c3d1","resolution":{"observed_at":"2026-08-06T23:21:53.970330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T23:21:54.069634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.069634Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:0b5af87cd4a1e6ce39092c8421b7498a76ec15d6357837ef13f54adbc7c03f64","observation_id":"f04ef65d-a581-47f3-8108-7d8574e282b2","resolution":{"observed_at":"2026-08-06T23:21:54.069634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:06.312922Z","title":null,"venue":null,"work_id":"908f647f-95d5-4cbb-b5a3-a2db403942ce","year":2021},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.324773Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:6462ba92e29f268987ceb5c86beec66e2c65639e61d5145baf14f7efd069262e","observation_id":"c8b94280-cdb3-4f31-a909-433f45771f95","resolution":{"observed_at":"2026-08-06T23:22:06.449439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:54.509932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.509932Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:6e336407676e531a8529ea8ae1b2b87e46c39272eff4fe2eb2f4f5c5e18c8dd6","observation_id":"e314fc3a-0310-4ba0-888d-305ab9815519","resolution":{"observed_at":"2026-08-06T23:21:54.509932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01205","last_updated":"2025-06-04T06:07:17Z","snapshot_observed_at":"2026-07-06T18:24:21.774341Z","submitted_at":"2024-06-03T11:15:16Z","title":"ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control","version":3},"cited_work":{"arxiv_id":"2406.01205","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01205","snapshot_observed_at":"2026-08-06T23:22:01.499143Z","title":"ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control","venue":"eess.AS","work_id":"d32d8940-77e0-4bbf-bd4b-b8544c177023","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.594770Z"},"links":{"cited_paper":"/paper/2406.01205","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:197054a285ffffa1a19294c75aa90f9fb66d2aa3f70f25db622f0979b8f8f2c8","observation_id":"15ff03d1-ba1d-4f90-b261-66173c4e3946","resolution":{"observed_at":"2026-08-06T23:22:01.640762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-05T18:34:08.469382Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T23:21:55.093152Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.093152Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:84aa00b5b9378103acf6eaff42c841d3ef84d0faffb906fdb3da39854bd11fac","observation_id":"a83a6da2-1f0f-4950-84ee-9026ec8c28eb","resolution":{"observed_at":"2026-08-06T23:21:55.093152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10550","last_updated":"2023-07-20T03:28:06Z","snapshot_observed_at":"2026-08-06T07:47:26.343695Z","submitted_at":"2023-07-20T03:28:06Z","title":"SC VALL-E: Style-Controllable Zero-Shot Text to Speech Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10550","snapshot_observed_at":"2026-08-06T23:21:55.224747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.224747Z"},"links":{"cited_paper":"/paper/2307.10550","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:601a2444a1d6ef6a4f65629ecb9582e725c03a494231c4db80de7a78be41fe8b","observation_id":"a2e58924-eafc-479b-b71f-e7919cd052b9","resolution":{"observed_at":"2026-08-06T23:21:55.224747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.995094Z","title":null,"venue":null,"work_id":"dbfd4822-fd2e-4496-9845-f40ffb640135","year":2020},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.490696Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:7b5e9f2f18ec57df6e15b0469df5b3458baf98a05104341b6c210f6778b84a8a","observation_id":"50297084-4b08-47df-8773-dffb35428c2b","resolution":{"observed_at":"2026-08-06T23:22:06.135488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.934703Z","title":null,"venue":null,"work_id":"11e37d02-fd48-4369-8641-64d7c7b9548a","year":1978},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.624763Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:cf00714617cefec2d7321cabe9dd072bc766b2094083dc5cf792545b20585900","observation_id":"eb32930b-3b78-44ad-baa0-fadb9101c5b4","resolution":{"observed_at":"2026-08-06T23:22:05.968350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:55.719910Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.719910Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:5ff6d398bc3e64987a64804f87a6888a55ae9bcf65e76312d6a31e5e623bcef2","observation_id":"0fe15248-fe58-4e00-8cc3-3c21292f24be","resolution":{"observed_at":"2026-08-06T23:21:55.719910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-07-06T18:32:06.826381Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-08-06T23:21:55.843335Z","title":"W.; Kim, J.; and Cho, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.843335Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:304aed2c5449d2465bd1d3fc24eba30385c73b47562204b95e7507a281b466d2","observation_id":"76fed29e-242d-4dfa-b6fc-41b2f8fc9140","resolution":{"observed_at":"2026-08-06T23:21:55.843335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.667419Z","title":null,"venue":null,"work_id":"252f56ea-7439-4a86-a1b6-1bd31a6282ff","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.959394Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:38d44099ec2d2cb33166806dfcfa15cda113b5a2dc1f976f54a14f6837e0e65f","observation_id":"55540a81-a7ae-44cd-91a1-fd5e4d506dc2","resolution":{"observed_at":"2026-08-06T23:22:05.796837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04644","last_updated":"2025-04-30T09:30:49Z","snapshot_observed_at":"2026-07-06T20:18:16.913397Z","submitted_at":"2025-01-08T17:52:35Z","title":"FleSpeech: Flexibly Controllable Speech Generation with Various Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04644","snapshot_observed_at":"2026-08-06T23:21:56.065145Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.065145Z"},"links":{"cited_paper":"/paper/2501.04644","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b60b001a8fb65dc80a06879cf99725ec85420f9732a2d9fa4c4ee94caaa7d63b","observation_id":"ec264d95-654f-440a-9c15-2b2f25920f8a","resolution":{"observed_at":"2026-08-06T23:21:56.065145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.447617Z","title":"A.; Han, C.; Raghavan, V.; Mischler, G.; and Mesgarani, N","venue":null,"work_id":"92b7f9d3-5fad-4b1b-a755-642714de4d8e","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.158020Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b3902057e5902fc5e73aac6651aee52baa0cdd351910a8a850d9b168954a9eff","observation_id":"2b651a00-37be-422f-bbfc-7bbf58c16c60","resolution":{"observed_at":"2026-08-06T23:22:05.560496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.033028Z","title":null,"venue":null,"work_id":"f3839c0d-20d5-4dd0-92ed-799e3672db90","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.230762Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:6b7b720023c839e002cbc4c085ff6644d52425195f2221de3b2e750951986d88","observation_id":"2bdd39a2-b877-43b9-ba76-26e40715669f","resolution":{"observed_at":"2026-08-06T23:22:05.244739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-06T16:37:49.547342Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-06T23:21:56.314992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.314992Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:cc90542fb12f49cc808bc94c9623e030a5dcc96c7d90ca352621ca16c8a617da","observation_id":"d4926be1-b5a6-4c69-9098-2f81b5e375b4","resolution":{"observed_at":"2026-08-06T23:21:56.314992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.669406Z","title":null,"venue":null,"work_id":"2f34c6e1-9235-49bc-85ce-457512b1beea","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.474829Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:2de2b3981cf48aff815ebc216fdbadd98d3357affdc18e408b3ceb576c8fb9e6","observation_id":"db8cd0e8-bcf4-4dc7-9249-62ea0776d5a3","resolution":{"observed_at":"2026-08-06T23:22:04.820065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T23:21:56.557191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.557191Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:82961d7096691db5e5fde638b0325c47fb6d241e19c51109f00c76217e453156","observation_id":"d7051c0b-f641-4363-940d-13858c01e34d","resolution":{"observed_at":"2026-08-06T23:21:56.557191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:56.630048Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.630048Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:37aa68f907ddba456f40fec733ac244523155a951d3b8d98ab96bf39f15fe1aa","observation_id":"25004936-e1d2-498e-a7ea-46875215afb1","resolution":{"observed_at":"2026-08-06T23:21:56.630048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:56.720288Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.720288Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:56afbf66fe55e4a6871ddde15a3448ca716097a2def62d2ea61417505e1d1ccb","observation_id":"42046312-291d-4ca5-8cb5-79b7fa1cdd94","resolution":{"observed_at":"2026-08-06T23:21:56.720288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.461305Z","title":null,"venue":null,"work_id":"2ed67779-7b56-4a6e-a6b4-4750f4493702","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.085294Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:89c364a6bb190c8d8af766783fccbd6ad2fec1cd2da2094a4beb9e4ef696edbb","observation_id":"ca11a80b-9add-4a97-88fa-d01d3087f14f","resolution":{"observed_at":"2026-08-06T23:22:04.538604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.303290Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":"43c0a0a1-6c2f-45fb-a115-abff33628c97","year":2021},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.212866Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:ea52022bc78ff07a01f894537b3b9e7492048ee5b574ed824579a4fa811cdf1e","observation_id":"51dd94e3-a1a6-48c6-9188-206b659b9008","resolution":{"observed_at":"2026-08-06T23:22:04.386285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:57.367656Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.367656Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:0e216e576bb16c459f45a3a739f2f731cb670eb7f0c318905d0af43418209c90","observation_id":"9ecc25f5-0aeb-4093-ba3e-7273c48a84ff","resolution":{"observed_at":"2026-08-06T23:21:57.367656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.107449Z","title":null,"venue":null,"work_id":"52c5bf7c-011d-4f54-9deb-a17f448f8bf1","year":2022},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.484383Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:20a492bb7260e48aaf4b6e97e89464c68f219504e80005e23cfec99a253c36ca","observation_id":"4753148e-6bf7-473f-8d88-4f3c673be2e8","resolution":{"observed_at":"2026-08-06T23:22:04.191326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.961161Z","title":"A.; Gonzalez, J.; and Escalera, S","venue":null,"work_id":"3c8642c4-9302-4830-a9b0-2c80eb40e15e","year":2018},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.624749Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:3f97c0d432339aa943a06b6c96cb02a58c5f1f6c64e78502f53b4e40419b033a","observation_id":"b6bf2331-1b89-4039-938e-dc3b51fde4bb","resolution":{"observed_at":"2026-08-06T23:22:04.028061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:57.740164Z","title":null,"venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.740164Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:8ff117350d6504299ba232883f438305678fe46e432a1a0dfb979470b1487a21","observation_id":"f6c00cfd-550f-4e87-9953-321632221f2c","resolution":{"observed_at":"2026-08-06T23:21:57.740164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.737813Z","title":"E.; Hinton, G","venue":null,"work_id":"32d83e08-dd49-4d85-8c52-57b533f92fc8","year":1986},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.864744Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:6d21ba50ca093757bd21253f4d854ddbbc1eff86be8b84ef5eb94de2ac56b5b5","observation_id":"d58f3e58-36fc-4fd0-8dcd-579b40551c1b","resolution":{"observed_at":"2026-08-06T23:22:03.851801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08802","last_updated":"2024-06-13T04:36:34Z","snapshot_observed_at":"2026-08-04T10:22:07.789335Z","submitted_at":"2024-06-13T04:36:34Z","title":"DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing","version":1},"cited_work":{"arxiv_id":"2406.08802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08802","snapshot_observed_at":"2026-08-06T23:22:00.975372Z","title":"DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing","venue":"eess.AS","work_id":"cce99a29-b159-41e1-a7f3-bf9d9c75dac4","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.044747Z"},"links":{"cited_paper":"/paper/2406.08802","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b1f28a6f21f6a3a412a345d3b59bb7263f59dc7339cfdd8ff2251c72d2a8445c","observation_id":"214db0ad-301f-4718-9fc1-d18dda973ad7","resolution":{"observed_at":"2026-08-06T23:22:01.078010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.528349Z","title":null,"venue":null,"work_id":"6ca8a441-2a09-4457-91d1-50458d4befde","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.179341Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:153b9e975d40672c360a850b1966851b6efff1bdf36bbdf5f58ee4251b39503d","observation_id":"e3098054-309b-4bc4-bf24-f287f3b7d03d","resolution":{"observed_at":"2026-08-06T23:22:03.634747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.227493Z","title":null,"venue":null,"work_id":"a8fedddf-b5bd-4242-ae63-db254f4e92c8","year":2019},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.359642Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:9ef801d0da3167ce21677d5052846f3d1990036416502af6f6c9b28736929b71","observation_id":"a39cf59c-84a4-4e32-b488-bc1979a61e5b","resolution":{"observed_at":"2026-08-06T23:22:03.332892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:21:58.542592Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.542592Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:831746995dc36c5d5f55c7dafbbdcd271b76637e3b03bb661b78823c70bec0b2","observation_id":"6357baba-1f9d-446b-aecb-937f7b65bf4e","resolution":{"observed_at":"2026-08-06T23:21:58.542592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.972020Z","title":null,"venue":null,"work_id":"cd822f9b-7d07-4c14-be29-8ddf21f8a913","year":2017},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.696284Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:82d38ceb00eac7e9529a89ad5f3eaa25b10daf90c0bf3cb4eaeb3e7312363a3e","observation_id":"c60b0e3d-ffb6-432d-806c-cc2f525b1e2e","resolution":{"observed_at":"2026-08-06T23:22:03.046429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.767450Z","title":"N.; Kaiser, L.; and Polosukhin, I","venue":null,"work_id":"bdd681f7-b936-4985-a9f7-bc0354c65235","year":2017},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.874889Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:9886dbd5ace78aa9dd7f1856d7b2a964520d19ed5aae4d0e7081fb9a8810fa80","observation_id":"b861883c-b8da-4abf-abeb-f1d59ec23138","resolution":{"observed_at":"2026-08-06T23:22:02.851166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T23:21:59.042807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.042807Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:57069db5f62756701967131c4962c2b270880c834b94fc9c031792b8ec4ed367","observation_id":"7cf52851-2267-4464-ac50-5ebe5ba8e95d","resolution":{"observed_at":"2026-08-06T23:21:59.042807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T23:21:59.231724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.231724Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:fed1fc61277ab26dcac237f18e9c03d15cbbb49532ccc882b36d578e32f940b5","observation_id":"04e4ef9c-3e63-4826-b1d8-4ba7a760e217","resolution":{"observed_at":"2026-08-06T23:21:59.231724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T23:21:59.316444Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.316444Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:a6d2d5169591d7c5230296f777a11d7af67f5e9dca2519dc7a5f35c0da8a993d","observation_id":"87488ee5-d784-4d51-ba47-6cc934239f83","resolution":{"observed_at":"2026-08-06T23:21:59.316444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T23:21:59.444748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.444748Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:85c581bcf430f6a2e2db52e174c23594ad648010f6a8c747d10a2fed5065b726","observation_id":"3532d1ea-3948-4fe4-a0b4-111f73970903","resolution":{"observed_at":"2026-08-06T23:21:59.444748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-07-06T20:34:29.976207Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-08-06T23:21:59.575812Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.575812Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:479d3e2c9606db7ca016cff9348d0a64775504d7837b3ca7f3eb0d13741fc2de","observation_id":"abde2652-5844-45b5-bc1b-6b14c8aafb41","resolution":{"observed_at":"2026-08-06T23:21:59.575812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.593896Z","title":null,"venue":null,"work_id":"bdee25cc-3341-45dc-b007-4a039f7afada","year":2021},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.683308Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:85d21920e59a825a6e05b6bdbdf60895d7a35ec7de9bc2171d8ce5db59a09ec9","observation_id":"4b14c852-8f34-4761-bb46-b3461b79d073","resolution":{"observed_at":"2026-08-06T23:22:02.663861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.271056Z","title":"W.; and Li, H","venue":null,"work_id":"bb952b43-6e73-43bf-8a6e-12d3c090900f","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.768998Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:786629a7629231954f3ffc871b11b2e4cb8c08b11f26d5140d78d1ffbe7f116a","observation_id":"63838768-dc09-4026-8baa-6769dd2aae4b","resolution":{"observed_at":"2026-08-06T23:22:02.432658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.031475Z","title":null,"venue":null,"work_id":"21d74c13-4278-45d2-9bb3-a42c1380f82f","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.914789Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b0fd75efa761ecd9a84272ebd767d1f281cbed9504ce84f61999a742b63e9619","observation_id":"d5da1b1c-023a-4ea3-99d9-63d9d35a2d6f","resolution":{"observed_at":"2026-08-06T23:22:02.151155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:00.026278Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T23:22:00.026278Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:4e76841ebff5845c03500a95aa7afdde5a25a33d4e7d8cc087862c96af5c182c","observation_id":"6cb74769-28fd-4cfb-baad-e0f37447b91e","resolution":{"observed_at":"2026-08-06T23:22:00.026278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:00.140173Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T23:22:00.140173Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b399acb7cd85426f53be691b50f70ea2f5f6837b3f65bad2806e7b43cf7fd609","observation_id":"4c4a7b8d-536e-41d3-aa1d-07323ea46f4d","resolution":{"observed_at":"2026-08-06T23:22:00.140173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 41 inbound Pith citation observations for arXiv:2506.21619."}