{"as_of":"2026-08-08T03:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6bc86a9aa7749a6045eb94a121b4fbfd13bdef239d30e13c2075018a9d6420b9","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:40:31.629008Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21042/citation-record","integrity":"/paper/2607.21042/integrity","json":"/paper/2607.21042/citation-record.json","paper":"/paper/2607.21042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:27.242144Z","title":"IndexTTS2: A breakthrough in emotionally expressive and duration- controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.242144Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:756c934dd4c7b7daca2b041d93b73cca56e90905b90845b3dfcfd0fc20d936af","observation_id":"fec16d61-d81e-443d-aed7-23f47a919d30","resolution":{"observed_at":"2026-08-01T08:40:27.242144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-01T08:40:27.323776Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.323776Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:e37cb63b67640d0a7ea8f9b7685bb0753989ff8c1e20a3512975a455df0023e8","observation_id":"d6f1d8cf-1a05-46ed-b690-81d6ebccf83d","resolution":{"observed_at":"2026-08-01T08:40:27.323776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-01T08:40:27.396520Z","title":"CosyV oice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.396520Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:25428a379fa1d16204d18cf24ec06e1b9694446f5b214f584909577f56cd8925","observation_id":"b4ee5dff-afe5-4298-a849-0a991a309525","resolution":{"observed_at":"2026-08-01T08:40:27.396520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-01T08:40:27.509915Z","title":"Fish-speech: Leveraging large language models for advanced multilin- gual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.509915Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:a7fd5eec80770e90161024228d3a2c48226751dc2a968e12a075f20493094091","observation_id":"96e8430a-ea47-465d-8339-2ee17845339c","resolution":{"observed_at":"2026-08-01T08:40:27.509915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-01T08:40:27.564412Z","title":"Spark-TTS: An efficient LLM-based text- to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.564412Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:cf635b5dedd6e39864e53a61c9d18f9041217972fb72b78f3c439a3c30ff3238","observation_id":"69ce9690-b3f7-48be-9344-2ff340b19901","resolution":{"observed_at":"2026-08-01T08:40:27.564412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-01T08:40:27.601726Z","title":"Qwen3-TTS technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.601726Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:baff00544ee3334e024322a75af01c07f97d9280d67d10be94e74f8702fb7953","observation_id":"982ae0b7-0e29-4b7e-909f-bbe192749aeb","resolution":{"observed_at":"2026-08-01T08:40:27.601726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-01T08:40:27.699814Z","title":"FireRedTTS: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.699814Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:fd3824206e2aa5d753b186e9bbba84ad0176b135634c01ca7e5f672c522d909a","observation_id":"c1eae712-ec60-4c69-95c0-911f42e4aa10","resolution":{"observed_at":"2026-08-01T08:40:27.699814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.21882","last_updated":"2026-06-20T04:47:45Z","snapshot_observed_at":"2026-08-08T03:12:18.006572Z","submitted_at":"2026-06-20T04:47:45Z","title":"Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.21882","snapshot_observed_at":"2026-08-01T08:40:27.846912Z","title":"Streaming T5-based text-to-speech synthesis with limited lookahead,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.846912Z"},"links":{"cited_paper":"/paper/2606.21882","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:8f7aa02bc535e6e202a86b802d649c9fc88e4a86289758dd8a3bbf0d08ec1126","observation_id":"62330e2b-7265-45bf-b130-cffe8ce10383","resolution":{"observed_at":"2026-08-01T08:40:27.846912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.013513Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.013513Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:70c9d2b0abc3b9d20869a2a66bdfd7f0e76fa5c941f5c17559b2977a91ef5f2e","observation_id":"bf11fb27-ee48-4b88-b5fd-f345fae17195","resolution":{"observed_at":"2026-08-01T08:40:28.013513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.181140Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.181140Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:a2bd710f2f0548489e6a7b85227d074011f1aa56ad31820650a65ca45d19e192","observation_id":"66841eb7-e957-4f41-93a6-585e617657eb","resolution":{"observed_at":"2026-08-01T08:40:28.181140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.346583Z","title":"E2 TTS: Embarrassingly easy fully non-autoregressive zero-shot TTS,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.346583Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:44234d93e3cda88993bc3c9743d1b1ca8374b42f5567607fc2ca75784656e43d","observation_id":"38630a00-faf5-4be8-9e30-678341d467ab","resolution":{"observed_at":"2026-08-01T08:40:28.346583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.514609Z","title":"ZipV oice: Fast and high-quality zero-shot text-to-speech with flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.514609Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:4f68cf1cb914634caa336df313a9e9c4e20519197ddb69032d521cb07d291a6c","observation_id":"9403fed2-bd57-4861-8c89-584338ba551b","resolution":{"observed_at":"2026-08-01T08:40:28.514609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.656148Z","title":"InstantSpeech: Instant synchronous text- to-speech synthesis for LLM-driven voice chatbots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.656148Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:be65790a32ad33e7f6aefa75b05a5ea9d13c12669799adc76d9dacfb331d0b7e","observation_id":"31622478-221e-469f-b918-289070be5762","resolution":{"observed_at":"2026-08-01T08:40:28.656148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.824143Z","title":"NVIDIA TensorRT,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.824143Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:f811af86a49f85501f5a482c4951aefb4e687b8b62e6c567df2b09297c5bb2a4","observation_id":"19192bbc-4e90-4097-92f5-3afb94e74293","resolution":{"observed_at":"2026-08-01T08:40:28.824143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:28.954933Z","title":"TensorRT-LLM,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:28.954933Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:120b68773cb087774a67ca784716c6809ef5548ef33161edebde89e62dea29aa","observation_id":"86f99114-cb22-410d-baca-080180d3b210","resolution":{"observed_at":"2026-08-01T08:40:28.954933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.041783Z","title":"Efficient memory management for large language model serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.041783Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:855a40ae2997a59939c9ab5bad42c54e2e0b4eaa4ca474b28bf929cba5c88ad8","observation_id":"24e9842b-7211-4936-bba4-543e5ce34603","resolution":{"observed_at":"2026-08-01T08:40:29.041783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.152701Z","title":"SGLang: Efficient execution of structured language model programs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.152701Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:6e8fe35afe3a8d1bf585b0f45c7ca4404dbd5aa3dcd7c02f8413c4202d3a5627","observation_id":"2a0c6fb1-3d97-4155-97db-0d5d453e3ac6","resolution":{"observed_at":"2026-08-01T08:40:29.152701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.228782Z","title":"ONNX Runtime,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.228782Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:9698444aa58eaf974a9c3ecfd564b296c9eed2b0b15f2f8a87a8857399baa53e","observation_id":"98505226-bd62-453b-bae7-f3951934fe91","resolution":{"observed_at":"2026-08-01T08:40:29.228782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.342098Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.342098Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:c5bbc0de8ed3e5e8aa3e0fd24dd0ac34817590c48ab3cb1f00c5e3ab12d9c5a5","observation_id":"bf5dbdbf-4d1e-4b8f-8f10-633bd713f2d9","resolution":{"observed_at":"2026-08-01T08:40:29.342098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-01T08:40:29.429613Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.429613Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:4de1b4bdb4e1e28d1ec183523bf68ff7d71b9bb65a8cf781652b57f36d588b5b","observation_id":"21d5285d-f0ab-4207-b46e-2eeb66e0ea26","resolution":{"observed_at":"2026-08-01T08:40:29.429613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.553448Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.553448Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:c23642a36127c911aec5b79367616ecb9cf838d2aa3d81ce4d848a682af50f9e","observation_id":"12e67d0c-c9a7-4959-8eae-1defe7b0c0eb","resolution":{"observed_at":"2026-08-01T08:40:29.553448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.648884Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.648884Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:4f591c8bc2a4d14040820a8c0e990fe6428d190438d524a041837af43702e25c","observation_id":"178b5e08-1039-4ddc-adf0-a0e355e094af","resolution":{"observed_at":"2026-08-01T08:40:29.648884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-01T08:40:29.739573Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.739573Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:dc8761992cde010875176053eb5083e08aaa5359292cdc854da61795bf60eb67","observation_id":"f122820f-8cdf-4ba4-877c-474326dcfa7b","resolution":{"observed_at":"2026-08-01T08:40:29.739573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-01T08:40:29.851867Z","title":"BigVGAN: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.851867Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:d499a9d5faeadd0e7bed84bc466e1fd82a830fa243a95a5e3475e5312d282295","observation_id":"e5d0f3a8-6f14-4794-95e9-61cf4c3f3ecd","resolution":{"observed_at":"2026-08-01T08:40:29.851867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:29.993395Z","title":"W2v-BERT: Combining contrastive learning and masked lan- guage modeling for self-supervised speech pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.993395Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:037ecf24bd03360983ccac1903194299fc5da6fa90f8bd33e74689ee4f6de0eb","observation_id":"5644a396-7193-45a7-9609-94d1141bbfeb","resolution":{"observed_at":"2026-08-01T08:40:29.993395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:30.127935Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:30.127935Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:3606b40b2db5810f8b21ad1c3b934fec3258768ce9ea2bb9bb2d6f40fd152e4d","observation_id":"b32c882a-d706-4c04-87e0-27129d8f2570","resolution":{"observed_at":"2026-08-01T08:40:30.127935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:30.329231Z","title":"CAM++: A fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:30.329231Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:72768e338a00ca7c3520a7d4bacdd0525a17edd1e5bfad7421bb3431792dd30b","observation_id":"e823c9e9-3761-41c9-8ae0-0e6045ecd682","resolution":{"observed_at":"2026-08-01T08:40:30.329231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-01T08:40:30.520790Z","title":"Seed-TTS: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:30.520790Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:a08b8d7e14f39b732ebb1ce2eeb3d5dfa893101162397bed1c216a47e07382e2","observation_id":"adba63e7-9b82-4b95-9037-b5d133917ecd","resolution":{"observed_at":"2026-08-01T08:40:30.520790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:30.659984Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:30.659984Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:3b59a6136e39bf159e35b2d5c455bc6d89d5488268364454c3ae79f0b538008a","observation_id":"93436678-4bc4-41f6-9dae-44af003e61e7","resolution":{"observed_at":"2026-08-01T08:40:30.659984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:30.811354Z","title":"DiDiSpeech: A large scale mandarin speech corpus,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:30.811354Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:58d064af04e708f8895d18ca6874560e2e14075c864a3a822d601aebd073a9fd","observation_id":"8f384ed3-a057-4f77-a7bd-93e8e741b587","resolution":{"observed_at":"2026-08-01T08:40:30.811354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:30.981779Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:30.981779Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:2fc04ce186411c5114ffb2ae2e308f6bbc37305d2d30f395a1acb74f3d37e495","observation_id":"d4c71c9f-d584-46f2-b0b7-c67e4afd8fab","resolution":{"observed_at":"2026-08-01T08:40:30.981779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:31.162278Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:31.162278Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:6245d3b0fdc78aa6b4ea223ba12ed63cb8e6396d58dc433e3a5fbf553ec66607","observation_id":"67d7bdf6-6f35-4641-a6fc-4d39b8665843","resolution":{"observed_at":"2026-08-01T08:40:31.162278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:31.274726Z","title":"ECAPA-TDNN: emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:31.274726Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:76c0b40ababe0c539070744a0f85079599d6015b89cc26486461371fe841316f","observation_id":"a80f1a77-2a32-4105-a6a5-d30f411bdd55","resolution":{"observed_at":"2026-08-01T08:40:31.274726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:31.417593Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:31.417593Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:027747cad652b97d3d638075c031376ea7bcc7bac64fea2eb2e6aa70013a0eea","observation_id":"c09dd944-95cd-4d36-9d19-c2fe9cdbafea","resolution":{"observed_at":"2026-08-01T08:40:31.417593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:40:31.629008Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS chal- lenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:31.629008Z"},"links":{"citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:1fb1ff5ac3ba6edb95ec11316413b31ad34eeaaf5ae9b12ca74c73b1c99c21a1","observation_id":"f26d5304-4e82-4d12-b4ec-f0eca8ea1b43","resolution":{"observed_at":"2026-08-01T08:40:31.629008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.21042."}