{"as_of":"2026-08-09T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd55a8054a2971fc07077a3cbf71f3a80b1e118cd154396bb17abe49de111765","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:07:00.588636Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:07:00.481427Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-08T19:07:00.481427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.481427Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:7277524b677be391bd686b035f4b1e9b826f87a6d51d8891085d9e94280a11df","observation_id":"6530d5cc-7b61-4af1-ad91-7f92bfd767cd","resolution":{"observed_at":"2026-08-08T19:07:00.481427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-07T14:53:14.979998Z","title":"Indextts: An industrial-level controllable and efﬁcient zero-shot text-to-speech syste m","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.979998Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f2f45c612718c073de85dbf5f8827af7d00236f8b6cda27d4f5980a114ae0c5d","observation_id":"cceffa41-b9b1-4038-bf68-672cd9a46730","resolution":{"observed_at":"2026-08-07T14:53:14.979998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-08T16:08:45.949013Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:a56702885b2f66e3325b421562980195e387e554730eae9068e7e0618ba935a8","observation_id":"ca5794d7-3d49-4f58-bef4-4742bc912a27","resolution":{"observed_at":"2026-05-16T05:27:25.569998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-07T14:25:01.135750Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19119","last_updated":"2025-05-25T12:22:00Z","snapshot_observed_at":"2026-08-09T08:08:38.091653Z","submitted_at":"2025-05-25T12:22:00Z","title":"CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:01.135750Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2505.19119"},"observation_digest":"sha256:54274765ba8ecb4dd26e28f5a7f84e6d03ab98c0a44bcdd9e1393cc8b418344b","observation_id":"03ab161a-d36d-4a93-9e79-0c4f7662f124","resolution":{"observed_at":"2026-08-07T14:25:01.135750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-06T23:21:52.901086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.901086Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:92fc2cfd7738744d9ba770a9d54f9a3a0a78b8bf85bb32dca58ccda765676f6f","observation_id":"743b8f20-f8f9-484d-9729-16dcc0f97530","resolution":{"observed_at":"2026-08-06T23:21:52.901086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-02T11:31:42.381498Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:9d87570cc3f7152885aa0cc0174d4f5149aad31c59fd71f2dd294316bb744367","observation_id":"6df3652a-8560-48d3-9cff-ff5f41003c0b","resolution":{"observed_at":"2026-05-19T04:32:03.696915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T18:21:55.877250Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15860","last_updated":"2026-07-30T08:18:40Z","snapshot_observed_at":"2026-08-05T18:21:54.362852Z","submitted_at":"2025-08-20T15:18:59Z","title":"Robust Residual Finite Scalar Quantization for Neural Compression","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T18:21:55.877250Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2508.15860"},"observation_digest":"sha256:02da290e41de191c40225274989f5645265d7c0a7a26138de5c1a8fc046f2cc4","observation_id":"b005b13d-8d31-46e1-aaf2-2a23300bdd76","resolution":{"observed_at":"2026-08-05T18:21:55.877250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T12:00:45.299724Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-08T14:19:05.637955Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.299724Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:a8248cd5b9befa074f5fc570f7c1339396b381602dfede6a7ce8d1acaf02d7ba","observation_id":"f6b11d61-fc62-4741-9e45-9c2fd67d14da","resolution":{"observed_at":"2026-08-05T12:00:45.299724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-04T19:11:59.502401Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09748","last_updated":"2025-09-11T12:32:08Z","snapshot_observed_at":"2026-08-08T07:23:28.359307Z","submitted_at":"2025-09-11T12:32:08Z","title":"DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T19:11:59.502401Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2509.09748"},"observation_digest":"sha256:de3040e3f84e516fe907d8e477d8b60fea9399dcc7f690ab830db796333df6d4","observation_id":"0ee0c70b-a7db-4912-9cc0-47f9039061f6","resolution":{"observed_at":"2026-08-04T19:11:59.502401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2510.19414","last_updated":"2026-05-11T03:38:57Z","snapshot_observed_at":"2026-07-06T22:33:48.680749Z","submitted_at":"2025-10-22T09:34:31Z","title":"EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:01:57.044869Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2510.19414"},"observation_digest":"sha256:e547e03418f4b4077f3a500f9e50b486face663a1e7294a95c52add7e45aaa6e","observation_id":"c0d2a60b-8c49-41a8-b9ca-d0d7f9072168","resolution":{"observed_at":"2026-05-18T05:02:23.325753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:a8b1fbf12a0e935c8131b56b4f72b99fdee20a1d5bf7f0bcd144eadee0f75bd5","observation_id":"a6cc9382-8537-4204-9c75-ad97e33a7f16","resolution":{"observed_at":"2026-05-13T23:03:24.762622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.08184","last_updated":"2026-04-09T12:38:19Z","snapshot_observed_at":"2026-08-02T08:09:42.022596Z","submitted_at":"2026-04-09T12:38:19Z","title":"AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:40:10.657590Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.08184"},"observation_digest":"sha256:e0708f3eea5766c82f08c9067b607e95efe4254c4b7d9f148aeccec9a460eea0","observation_id":"9b8586ec-f497-4039-87a1-671dcfc07bf8","resolution":{"observed_at":"2026-05-11T06:21:00.716219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.08558","last_updated":"2026-06-23T07:14:55Z","snapshot_observed_at":"2026-07-13T23:53:49.367849Z","submitted_at":"2026-03-17T07:35:28Z","title":"WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T10:29:51.313835Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.08558"},"observation_digest":"sha256:63d8bd0487d84be70c6aaeb024f70e42b28877e5df377414230d7b61053ed015","observation_id":"7f9524ac-1a88-4870-b2e1-c130847c7aeb","resolution":{"observed_at":"2026-05-15T10:29:55.951508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.09121","last_updated":"2026-04-14T06:45:50Z","snapshot_observed_at":"2026-08-02T20:05:01.635841Z","submitted_at":"2026-04-10T09:02:42Z","title":"Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T18:22:08.670559Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.09121"},"observation_digest":"sha256:00dcad52e710e628aeab30760bd45c2d9cfbe242034a2d37fb9977fe2a8e4671","observation_id":"066c6c75-1c36-4075-ab14-f14e9810b178","resolution":{"observed_at":"2026-05-11T00:41:07.162050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.11103","last_updated":"2026-04-24T05:22:49Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T07:20:20Z","title":"ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T16:03:15.572657Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.11103"},"observation_digest":"sha256:4903808fe8356663ea4ffca713402d8e6e20f9c79b001d899dc851e9f46c109c","observation_id":"32632292-6130-4474-9201-86b204be205b","resolution":{"observed_at":"2026-05-11T09:21:02.483890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.16056","last_updated":"2026-08-03T16:51:20Z","snapshot_observed_at":"2026-08-09T07:03:13.879822Z","submitted_at":"2026-04-17T13:30:59Z","title":"AST: Adaptive, Seamless, and Training-Free Precise Speech Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T07:59:34.622096Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.16056"},"observation_digest":"sha256:4812d6e957b864f6cf7c24de7bd1907a071015178737a0301e956cbce821e7b8","observation_id":"9253335f-202f-4fdd-ba32-02f22861ae7f","resolution":{"observed_at":"2026-05-10T08:02:25.232303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-04T05:29:37.697055Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system.arXiv preprint arXiv:2502.05512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.16056","last_updated":"2026-08-03T16:51:20Z","snapshot_observed_at":"2026-08-09T07:03:13.879822Z","submitted_at":"2026-04-17T13:30:59Z","title":"AST: Adaptive, Seamless, and Training-Free Precise Speech Editing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:29:37.697055Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.16056"},"observation_digest":"sha256:7afbab57ed74ef03456203cc3ad6afecbb1958a2a146fcb602ba716153a0f530","observation_id":"6ede54ab-6ac8-4d72-911d-eb83bc9a9429","resolution":{"observed_at":"2026-08-04T05:29:37.697055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T04:03:38.919545Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2604.17958"},"observation_digest":"sha256:710713b5deb2a2f803696b739ccee959776d3fc1b4b4485f2fc35c69cd4b6460","observation_id":"5c0fc56d-4fe0-47e3-a0b1-fb609c5fe0c9","resolution":{"observed_at":"2026-05-10T04:04:47.235530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2605.00156","last_updated":"2026-04-30T19:25:53Z","snapshot_observed_at":"2026-07-06T23:13:38.354733Z","submitted_at":"2026-04-30T19:25:53Z","title":"RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:59:00.255786Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2605.00156"},"observation_digest":"sha256:f2ae0d7d48eb1be71ed5e3a947290f7b14f50700a7023986ebac50c718680b5a","observation_id":"a21a2f5c-3be3-4b7a-b59b-38e9beef61e2","resolution":{"observed_at":"2026-05-11T15:26:10.281890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:b94a1e89942c7ab0f0127485b167fad4c041c3e6a7549050d026dc9b13d521e4","observation_id":"7f83fb1f-d3f9-4bf7-a807-81baadf1f855","resolution":{"observed_at":"2026-05-19T19:02:43.600587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-02T22:28:42.271827Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:2002061b4545c516794121ed3e89001a3704023096bfe1828f532c5b788ed8ee","observation_id":"3cc031fc-1a1c-4bbb-be1f-c66b39d9a931","resolution":{"observed_at":"2026-05-20T21:19:03.270673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-08-06T13:26:23.950630Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:d5b434815346def9c41c0a6033ace1e030dbbe632d762d83b52e2242135a406a","observation_id":"ac48d7d0-7235-4016-ac85-5d345ec6882a","resolution":{"observed_at":"2026-06-29T16:23:39.890163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2605.29430","last_updated":"2026-05-28T06:23:31Z","snapshot_observed_at":"2026-08-07T03:26:40.138742Z","submitted_at":"2026-05-28T06:23:31Z","title":"Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T07:30:11.718647Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2605.29430"},"observation_digest":"sha256:fd2ca4bf306ccf3aa2561d7e308392cf2153c651ec4d292a97755cc60c667192","observation_id":"c8a2368c-09d1-4a4a-85c6-16870403ee90","resolution":{"observed_at":"2026-06-29T07:33:13.683613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:a7ccbf073d3583bd7cadedf99f1f5d6b44babd965f6e3bd9cf39e98e55dd0664","observation_id":"09e111f7-6c4a-4bf2-a6a8-1ced99766cb2","resolution":{"observed_at":"2026-07-02T00:46:24.601926Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:aa5fbd5b40ebe4dee3cd57723104637b37cb901defb6e9fad31ba22ed8691064","observation_id":"8380a461-bd96-48c6-baaa-409dd38bda18","resolution":{"observed_at":"2026-07-02T11:06:53.393587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:9b227f7dab898da15cc99bd918747a0e52b1a164ae2a75550e42c503b3943d37","observation_id":"f4b6d5e9-3a04-4460-bec4-761851ae30b0","resolution":{"observed_at":"2026-07-03T18:08:46.949342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.31128","last_updated":"2026-06-30T04:46:45Z","snapshot_observed_at":"2026-08-06T13:27:09.813532Z","submitted_at":"2026-06-30T04:46:45Z","title":"UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T04:05:27.343684Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.31128"},"observation_digest":"sha256:414b289da81fba8a3d3a3c2b076f4ab00ab5b947fc7dbe20abb1d9c648b7e8f2","observation_id":"0e620d67-2f50-448b-8493-788856d9f13d","resolution":{"observed_at":"2026-07-01T11:45:46.194761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:fae3ca9fd604f9b99eddc3fbfdebfe03aee2d51ea9764d4a9502837674501eb0","observation_id":"472c3733-0573-4870-bc53-b39520c86dba","resolution":{"observed_at":"2026-07-01T11:45:47.283406Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-02T06:27:04.866415Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system.arXiv preprint arXiv:2502.05512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12706","last_updated":"2026-07-15T05:16:13Z","snapshot_observed_at":"2026-08-07T23:23:24.915742Z","submitted_at":"2026-07-14T12:28:43Z","title":"AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:27:04.866415Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2607.12706"},"observation_digest":"sha256:660396a05513978389c1d0261682b81137d65b1e67efccb411c3b129785785f3","observation_id":"82b3df18-4735-4230-91db-c7ca95c4d4ea","resolution":{"observed_at":"2026-08-02T06:27:04.866415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-01T17:45:44.391170Z","title":"arXiv preprint arXiv:2502.05512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-07T11:10:34.915152Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.391170Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:865a3fd0b0ca2bf53c2e0c4b8d385f75f2c351734e58bd6b8fa08f220470944b","observation_id":"148d8915-cd7c-42ea-b5af-27826fc4e2d2","resolution":{"observed_at":"2026-08-01T17:45:44.391170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05512/citation-record","integrity":"/paper/2502.05512/integrity","json":"/paper/2502.05512/citation-record.json","paper":"/paper/2502.05512"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-08T19:07:00.481427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.481427Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:7277524b677be391bd686b035f4b1e9b826f87a6d51d8891085d9e94280a11df","observation_id":"6530d5cc-7b61-4af1-ad91-7f92bfd767cd","resolution":{"observed_at":"2026-08-08T19:07:00.481427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.915154Z","title":"[BT], prompt text, text, [ET], [BA], prompt audio, audio, [EA]","venue":null,"work_id":"5f32ce23-37bf-4533-9687-7593a5667539","year":null},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.486856Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:92b25db66be78cda7cba5880f714a679017b4d5f0aa1e65e66c7e4c41d44ee20","observation_id":"a670a59a-cc8b-4b05-946f-0b0e678666c0","resolution":{"observed_at":"2026-08-08T19:07:00.919750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.899367Z","title":"Dataset All training data was collected from the internet, with an initial 120,000 hours of raw audio","venue":null,"work_id":"7f57ba62-5dbc-4c01-9cb2-edbe8bdf29cb","year":null},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.491564Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:237ad6fac695e3bd81b9dca8ca3079f98195f36bb451abe77b23f151be191166","observation_id":"f09f3234-2912-49b8-9f20-b1e6f601f349","resolution":{"observed_at":"2026-08-08T19:07:00.905617Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T19:07:00.496354Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.496354Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:3ef66f7644c5e36c6243315e2836608709489faf9f5a8bbdcc773aa9df317e59","observation_id":"4b07bdf7-89e2-4fbc-bd3f-5ea2dc2abbf2","resolution":{"observed_at":"2026-08-08T19:07:00.496354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-08T19:07:00.501225Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.501225Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:fab45e635d4ddef31f207178705aac33ef91366961a2681258f66b0fa38acd11","observation_id":"56fb5224-3e15-411f-9401-d2b9b29b2629","resolution":{"observed_at":"2026-08-08T19:07:00.501225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-08T19:07:00.505811Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.505811Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:dc5542711d1d2956bb130099a6870151acc0e74321725b50d9582cea1ff4e55a","observation_id":"99cdb013-4c37-4c63-aff5-ef9260ebb7f3","resolution":{"observed_at":"2026-08-08T19:07:00.505811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-08T19:07:00.510661Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.510661Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:159464fae5c28233972f4da7a17b15f8b1b1d8510f5e7d15900ea8f70ebc10bb","observation_id":"0fadcd10-c646-4158-be36-c0dddd35c6bb","resolution":{"observed_at":"2026-08-08T19:07:00.510661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-08T19:07:00.515212Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.515212Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:dae9ffd4cee775dac2c3703fe897584b16caa6f676fed9a0e2d57a79a8327eb6","observation_id":"5ad645aa-8a29-424e-865c-dd703843400a","resolution":{"observed_at":"2026-08-08T19:07:00.515212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07218","last_updated":"2024-04-10T10:05:16Z","snapshot_observed_at":"2026-08-03T16:12:09.462591Z","submitted_at":"2023-07-14T08:21:25Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07218","snapshot_observed_at":"2026-08-08T19:07:00.520391Z","title":"Mega-tts 2: Zero-shot text- to-speech with arbitrary length speech prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.520391Z"},"links":{"cited_paper":"/paper/2307.07218","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:eebf79fc40008ef1889046155dbc23f4bf9d7a04681f909cb9f73f172263e4d5","observation_id":"9ca92841-67a1-4390-9ec0-f00df24db369","resolution":{"observed_at":"2026-08-08T19:07:00.520391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.524666Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.524666Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:3826d568a469b28d5cfe0eed2c67bcc6b2e962e8664ca711ceafbc9841b016dc","observation_id":"f8bede2c-be27-4dc2-85dd-36125b0de7dd","resolution":{"observed_at":"2026-08-08T19:07:00.524666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-08T19:07:00.528669Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.528669Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:6b3a1344a63448e5d410c8cc26dcc7aa85be78b9b43fa6c64dcfc08ec3540d4f","observation_id":"89e29809-4d7c-40d5-a481-5b6ae6b1667b","resolution":{"observed_at":"2026-08-08T19:07:00.528669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-08T19:07:00.532973Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.532973Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:4f17709e69a4e38b00837818b78105ebfa8afa65a8c573211e71431cabe98c35","observation_id":"9e1ef766-eea4-4b45-86f0-abf236a47554","resolution":{"observed_at":"2026-08-08T19:07:00.532973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.537933Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.537933Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:18eae344b8e658ccf81eeb18e6b6d597554a0a6957874b78ff5e1698f2a95c6e","observation_id":"54a85830-836c-4f55-ac96-7fdf24b2aad4","resolution":{"observed_at":"2026-08-08T19:07:00.537933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-08T19:07:00.542381Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.542381Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:d38ebb6be2214164eafa8e79778591a203d99e8abdd1c99b0fea901585c85a61","observation_id":"ecf8f860-9809-4c0e-8dfd-c0805f94c1a2","resolution":{"observed_at":"2026-08-08T19:07:00.542381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.546792Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.546792Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:1a534bc0c2fade3d1ef16488ee9cf2b6e123c40c6b01c42cf1d218dc206899ea","observation_id":"98c78b57-5ca5-488d-8648-a662f0e598d4","resolution":{"observed_at":"2026-08-08T19:07:00.546792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-08T19:07:00.550792Z","title":"Fi- nite scalar quantization: Vq-vae made simple,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.550792Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:c134dc4956f332a7081fd328c32222bd8fc0273868220b1aaddc5b6d3ea6ec47","observation_id":"21ab49b3-9225-4430-bf1b-39e4d32a42d1","resolution":{"observed_at":"2026-08-08T19:07:00.550792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-08T19:07:00.555072Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.555072Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:510a8e02b73cf235c945745f3fc1b3225ee500924868ff7caf43c28c44ef5ce8","observation_id":"579bf133-2af6-4ed5-8767-e6b373bc5b1c","resolution":{"observed_at":"2026-08-08T19:07:00.555072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.559444Z","title":"Matcha-tts: A fast tts architecture with conditional flow match- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.559444Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:40ed64c496b39b1f13b864831b67605550c8f16e2b21345bd44da4f01c995832","observation_id":"8b9e2605-4eb6-4c05-9646-c89d1cd2044c","resolution":{"observed_at":"2026-08-08T19:07:00.559444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01174","last_updated":"2019-09-03T13:41:56Z","snapshot_observed_at":"2026-08-08T18:45:21.285803Z","submitted_at":"2019-09-03T13:41:56Z","title":"Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01174","snapshot_observed_at":"2026-08-08T19:07:00.563570Z","title":"Demucs: Deep extractor for music sources with extra unlabeled data remixed,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.563570Z"},"links":{"cited_paper":"/paper/1909.01174","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:1fe60aa0b157754495481552b9c645804201f4a51cee3da5b8cd7b13f29ca51a","observation_id":"906e5a61-7860-47a1-bd52-349f57a0e54e","resolution":{"observed_at":"2026-08-08T19:07:00.563570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.567811Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.567811Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:ea684b8cd95b5da29c151fa36eefcabc6ed3d185cd4fa4d1af4707298b4c8d5f","observation_id":"4b29838f-8228-4c82-b65f-c4478b6af569","resolution":{"observed_at":"2026-08-08T19:07:00.567811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.571915Z","title":"Aishell-1: An open- source mandarin speech corpus and a speech recognition base- line,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.571915Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:30382bc7b6f0d06e4b996998dd8028cb55d15aa73414c0039bafffb32f639449","observation_id":"51618b6c-1f70-47c8-9318-c6eeb7266fcc","resolution":{"observed_at":"2026-08-08T19:07:00.571915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-08T19:07:00.575954Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.575954Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:6a57539940871e73aa683615d2420cd5e3a6fbe786f1d51c7c7d3cfcbb35fd43","observation_id":"278b1ffd-223a-4ed5-b5d0-e5c554b3a460","resolution":{"observed_at":"2026-08-08T19:07:00.575954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-08T19:07:00.580468Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.580468Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:76e49674598f61df0169975ccb3467dd8c3a049b0e872cd67771b91f0134a5d0","observation_id":"97b06b7c-850a-4ebe-9f0e-e9a21b7871f5","resolution":{"observed_at":"2026-08-08T19:07:00.580468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:00.584577Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.584577Z"},"links":{"citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:01bd9182b1dc8df0094b330113381054b456a9ed0e42929e811f8d84643ceba6","observation_id":"27a95564-2160-45b0-8af3-8ffe9a76837a","resolution":{"observed_at":"2026-08-08T19:07:00.584577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-08T19:07:00.588636Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.588636Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:290128b06131daf697d010a961717f0040ace3326acdb3a5859c60964203777b","observation_id":"56c59340-6fa5-4555-87f6-1aabf4fc68a6","resolution":{"observed_at":"2026-08-08T19:07:00.588636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 30 inbound Pith citation observations for arXiv:2502.05512."}