{"as_of":"2026-08-22T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01fd46fb6a9140be62bace2c5480dcebcb66aae5ac083a09cc33c2862a4ca952","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:05:11.377969Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:38.706029Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-11T18:08:21.514869Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.514869Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:ef4a0a06c1d7cf14ade93dd63a492b2016876f453cbff5d8df8c45dd1a2be71c","observation_id":"14708426-a94d-4b89-b445-2ee36eab8058","resolution":{"observed_at":"2026-08-11T18:08:21.514869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-09T10:37:03.657296Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthe- sis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-22T18:11:38.407455Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.657296Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:6548f8cc57e031b320dde50568a566345f7e899e397362ce8dec98a4a7f336ef","observation_id":"9c711ee6-7141-46e4-a003-909bbdfd5f41","resolution":{"observed_at":"2026-08-09T10:37:03.657296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-08T19:07:00.501225Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-19T06:28:38.381687Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.501225Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:966f53de0265e3a1bc162e2863e50c700e8d467d811a5d7f929d03e94de39ff0","observation_id":"56fb5224-3e15-411f-9401-d2b9b29b2629","resolution":{"observed_at":"2026-08-08T19:07:00.501225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-08T15:07:36.486045Z","title":"Fish-speech: Leverag- ing large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06560","last_updated":"2025-06-02T08:49:20Z","snapshot_observed_at":"2026-08-17T22:13:53.225881Z","submitted_at":"2025-02-10T15:25:11Z","title":"Position: It's Time to Act on the Risk of Efficient Personalized Text Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:07:36.486045Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2502.06560"},"observation_digest":"sha256:796478d7f2aca17bcdf3cbb3314df64b6d055967a7049a8230ae6a1e98ddd1cc","observation_id":"6cfcd3fe-219d-4502-a5fa-f0bcea9aa9f3","resolution":{"observed_at":"2026-08-08T15:07:36.486045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-16T06:05:11.377969Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19146","last_updated":"2025-04-27T07:58:56Z","snapshot_observed_at":"2026-08-19T01:11:40.782554Z","submitted_at":"2025-04-27T07:58:56Z","title":"Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T06:05:11.377969Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2504.19146"},"observation_digest":"sha256:ec05f7488040acfce4b8560a0d302741a40227403bfeacb803130e46319c98df","observation_id":"861424a8-255a-49e2-a223-0064ca68b613","resolution":{"observed_at":"2026-08-16T06:05:11.377969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-16T05:22:08.759883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20835","last_updated":"2025-04-29T14:59:42Z","snapshot_observed_at":"2026-08-17T14:11:29.849237Z","submitted_at":"2025-04-29T14:59:42Z","title":"Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:22:08.759883Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2504.20835"},"observation_digest":"sha256:7c358028e6a17b424c89d5764abc30987ed0da45d0521c5ace5cf3f05c39c7e1","observation_id":"9c0d5022-b7ef-4d7b-bd24-85b85705c8cd","resolution":{"observed_at":"2026-08-16T05:22:08.759883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-16T00:52:07.877528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02625","last_updated":"2025-05-05T12:53:09Z","snapshot_observed_at":"2026-08-19T05:24:27.742624Z","submitted_at":"2025-05-05T12:53:09Z","title":"LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:52:07.877528Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.02625"},"observation_digest":"sha256:9844d6eaf908752d36f7dd95f5663b14cec9624dfcf2e4d0f916dcb789519b88","observation_id":"e6851a7f-c87b-480b-ab04-3ceaf0e81ce5","resolution":{"observed_at":"2026-08-16T00:52:07.877528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-15T23:17:25.165930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.165930Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:60029425cfd2ecc52f9ca5947d931819b65b4b31ee384447911e0be586d3d6de","observation_id":"e8ed7c07-7ba5-4896-856a-ab21e0eb11b6","resolution":{"observed_at":"2026-08-15T23:17:25.165930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T15:23:15.813372Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-17T22:01:00.660478Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.813372Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:a5e98cf2c8b0dab8c70cdb9c99fcd6a3d533177b0b3bf4df0bba9f39d8c5db1d","observation_id":"d8383ff8-ddd2-4fd7-8b0c-546f08809e16","resolution":{"observed_at":"2026-08-07T15:23:15.813372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T14:53:16.316201Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-16T18:13:29.906602Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.316201Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:c7ea6f82a80196e865f6c7729b1b1e57898cfaf34bef95b53146c398aea89648","observation_id":"1bafbe8f-77ba-41e9-bc48-584777613c6e","resolution":{"observed_at":"2026-08-07T14:53:16.316201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T14:00:28.199944Z","title":"Fish-Speech: Leveraging large language models for advanced multilingual Text-to-Speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20506","last_updated":"2025-05-26T20:15:15Z","snapshot_observed_at":"2026-08-18T22:09:48.312154Z","submitted_at":"2025-05-26T20:15:15Z","title":"ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:28.199944Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.20506"},"observation_digest":"sha256:d051f89cab228d7db967180eb344b31f5e37919afdae8547a1212a53a3922a84","observation_id":"f620d47a-d187-42f4-93e0-6e13081bcf3c","resolution":{"observed_at":"2026-08-07T14:00:28.199944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T05:33:51.609621Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-15T01:04:55.797272Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.609621Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:e9bf60868263e3654ffb12f0a55edf573399ef67fcec7d532e6b1621c6817488","observation_id":"47f8a2ca-2413-402c-a719-cf2fe2236001","resolution":{"observed_at":"2026-08-07T05:33:51.609621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T21:23:51.398868Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-20T18:09:28.126757Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.398868Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:2125fdd2d05eea8a3329233490bd55840596c618bc63128cfdaa82b032f34f97","observation_id":"be5a0f09-b588-4d3b-be6d-6f1fa0693359","resolution":{"observed_at":"2026-08-06T21:23:51.398868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T14:50:04.197119Z","title":"ArXiv abs/2411.01156 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-17T15:47:47.299538Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.197119Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:31474b96a13a9e52c528083320a54d65991d8b888cb34d70481e815b31178421","observation_id":"f5804bb3-fddd-4e20-a57e-7810b4c9c2af","resolution":{"observed_at":"2026-08-06T14:50:04.197119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T13:47:51.601861Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20220","last_updated":"2025-07-27T10:59:29Z","snapshot_observed_at":"2026-08-17T02:24:32.617101Z","submitted_at":"2025-07-27T10:59:29Z","title":"Motion-example-controlled Co-speech Gesture Generation Leveraging Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:47:51.601861Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.20220"},"observation_digest":"sha256:f3f740a3ee51b4d0e185d6ff24088a20c74304cf35a346de4c61d2861cc9e954","observation_id":"f21bb22d-6379-4d43-9121-f091d7b085d5","resolution":{"observed_at":"2026-08-06T13:47:51.601861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T12:49:19.352331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-10T15:09:41.229385Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:19.352331Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:3760679387883f81dbc54fb34e97e1eb7e59a5f8e8030454fe0fd07f4f449337","observation_id":"80da568d-b212-4b0d-b9dc-962443201971","resolution":{"observed_at":"2026-08-06T12:49:19.352331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-15T16:47:30.226454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20513","last_updated":"2025-08-28T07:53:07Z","snapshot_observed_at":"2026-08-18T10:20:50.871889Z","submitted_at":"2025-08-28T07:53:07Z","title":"MoTAS: MoE-Guided Feature Selection from TTS-Augmented Speech for Enhanced Multimodal Alzheimer's Early Screening","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:47:30.226454Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2508.20513"},"observation_digest":"sha256:b4da5d90fab83c63f83982da521f7e53ca039ee352e1367251d65c7415e2078b","observation_id":"cada4e6f-d952-465e-8a7c-276f224b2f62","resolution":{"observed_at":"2026-08-15T16:47:30.226454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-05T14:36:37.614517Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21153","last_updated":"2025-08-28T18:38:42Z","snapshot_observed_at":"2026-08-14T21:56:16.990746Z","submitted_at":"2025-08-28T18:38:42Z","title":"WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:36:37.614517Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2508.21153"},"observation_digest":"sha256:a86fd800a0551a75cb490f45300c1b1cd129fa5b90a6bccaa697e45b3337185a","observation_id":"5d7c9d51-f42b-4e92-8c76-cb2f56566c67","resolution":{"observed_at":"2026-08-05T14:36:37.614517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-05T06:01:28.489246Z","title":"Fish-speech: Leveraging large language models for advanced multilin- gual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04667","last_updated":"2025-09-04T21:30:25Z","snapshot_observed_at":"2026-08-22T02:13:25.701128Z","submitted_at":"2025-09-04T21:30:25Z","title":"DarkStream: real-time speech anonymization with low latency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T06:01:28.489246Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2509.04667"},"observation_digest":"sha256:52ebed45141a6d1017578c398714d82eb1820fe3f564995145eb1d8000ebc208","observation_id":"2b11f19d-93af-49a8-a8ea-d4fcb7aed126","resolution":{"observed_at":"2026-08-05T06:01:28.489246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-05T00:05:47.747134Z","title":"Fish- speech: Leveraging large language models for advanced multilingual text-to-speech synthesis.arXiv preprint arXiv:2411.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-20T05:56:51.995983Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.747134Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:7673eb9fac5198a814902053ecde404ea95f8cd72ef1d302ff97a67d4ea82cac","observation_id":"38140346-be0d-4da8-8620-30bce8c6ea37","resolution":{"observed_at":"2026-08-05T00:05:47.747134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-04T19:38:35.620052Z","title":"Liao et al.,Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09155","last_updated":"2025-09-11T05:29:07Z","snapshot_observed_at":"2026-08-19T05:27:02.581452Z","submitted_at":"2025-09-11T05:29:07Z","title":"HISPASpoof: A New Dataset For Spanish Speech Forensics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:38:35.620052Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2509.09155"},"observation_digest":"sha256:b206ae6b89f87b8deebcce82fcfc3c0943e9600900ba4a5a383aefdedc9c3682","observation_id":"9d3cb53e-2dbb-4ef6-8259-6ad3e65b75d7","resolution":{"observed_at":"2026-08-04T19:38:35.620052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:6b0b67672493cbbaa0312f22b9a5c8c7bb94fd0e2ff2af2527f530ccef588d97","observation_id":"a836ee88-0739-48bc-ad6b-83f6c2c22224","resolution":{"observed_at":"2026-05-17T01:03:15.256180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2510.19414","last_updated":"2026-05-11T03:38:57Z","snapshot_observed_at":"2026-08-14T02:37:32.532007Z","submitted_at":"2025-10-22T09:34:31Z","title":"EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:01:57.044869Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2510.19414"},"observation_digest":"sha256:ef46bc2d0f7aa600d822f36c1d6d6f6a1a43157798e20e52a26acb44eb2ac44c","observation_id":"aa1182b9-20f7-4b6a-a44f-c777dfcd9268","resolution":{"observed_at":"2026-05-18T05:02:23.354924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:5c274d799f6712f951ab5f48951c69dbfaf95c7bbbb7fcc12a4f02303b5d5f33","observation_id":"d7f06d45-5136-43bd-a656-a0dbfa48de7d","resolution":{"observed_at":"2026-05-16T19:24:56.131581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-03T00:11:14.061855Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text- to-speech synthesis.arXiv preprint arXiv:2411.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-19T16:13:28.473895Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:14.061855Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:6ae165c58593d759df882a87da0d4955d62c659ec4dacacaf59367a7c5d28cc2","observation_id":"8f943109-eb0b-4c6d-ab35-2049e1e068d4","resolution":{"observed_at":"2026-08-03T00:11:14.061855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2603.02364","last_updated":"2026-06-27T13:26:12Z","snapshot_observed_at":"2026-08-14T13:26:51.994220Z","submitted_at":"2026-03-02T20:11:06Z","title":"When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T16:29:10.899659Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2603.02364"},"observation_digest":"sha256:60f298deae83572bb5ed1af73e0e9c2db19305656e41ac6bb2b155094d422f34","observation_id":"a0fb93cd-1be2-4fb5-b53c-ca71ed9541f1","resolution":{"observed_at":"2026-05-15T16:30:09.642109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-02T19:24:56.576910Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.02364","last_updated":"2026-06-27T13:26:12Z","snapshot_observed_at":"2026-08-14T13:26:51.994220Z","submitted_at":"2026-03-02T20:11:06Z","title":"When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T19:24:56.576910Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2603.02364"},"observation_digest":"sha256:f98cd042f33df256ddc4fc0320b07cf75b33dbe7c52f9fb4b6b8a1e8dd6d2c0e","observation_id":"074b5629-107c-4113-aa8c-b87eb816ccde","resolution":{"observed_at":"2026-08-02T19:24:56.576910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-02T18:56:10.569061Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04219","last_updated":"2026-06-19T02:55:38Z","snapshot_observed_at":"2026-08-15T03:34:42.755545Z","submitted_at":"2026-03-04T16:04:02Z","title":"ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:56:10.569061Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2603.04219"},"observation_digest":"sha256:91dda3959e300210a67d8c571fb794cb2ba9043b106a4c301238217273c990c1","observation_id":"ca7150ad-4923-4f01-b7b0-f6e190f72502","resolution":{"observed_at":"2026-08-02T18:56:10.569061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:c01abc4d0d86130aca6681506e2a55d4971d6d42f192021f3b3105c32faf68a2","observation_id":"bf9ea63e-d386-4fff-98af-102418eae34c","resolution":{"observed_at":"2026-05-13T23:03:24.897141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2604.02374","last_updated":"2026-04-27T15:09:03Z","snapshot_observed_at":"2026-08-12T19:02:16.732591Z","submitted_at":"2026-03-31T20:35:26Z","title":"Evaluating Generalization and Robustness in Russian Anti-Spoofing: The RuASD Initiative","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T02:27:05.776290Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.02374"},"observation_digest":"sha256:8750f58d790c38badeda20fd2c583510c3d7c1a9fa3cd24c5c765400d01e1812","observation_id":"9bf6fc20-e0d0-4bbf-980b-5129030961ee","resolution":{"observed_at":"2026-05-11T22:46:12.407558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:5d10c58a119a079938d051416fe99f16f108116a640be81620a4775821ae0141","observation_id":"47cbbba5-e1a2-460e-b72a-137d87a9c5b3","resolution":{"observed_at":"2026-05-11T08:30:57.134673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Fish-speech: Leveraging large language models for advanced multi- lingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:cc359a971434381a8c03ff00d2ae182dd1309a3c136409b59c2d95239bbbe294","observation_id":"f348cb99-400d-4a35-b18c-dc165d39c950","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2604.16211","last_updated":"2026-04-21T13:32:36Z","snapshot_observed_at":"2026-08-15T12:03:55.265841Z","submitted_at":"2026-04-17T16:20:55Z","title":"NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T07:37:44.393592Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.16211"},"observation_digest":"sha256:41e57348032ee9d3c3811bb55055bdeb0fe9b331606b21f96637631d14cbc8e1","observation_id":"e0349b6f-db83-4856-a82b-da36a5808452","resolution":{"observed_at":"2026-05-10T07:47:12.969453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2604.23742","last_updated":"2026-04-26T14:42:50Z","snapshot_observed_at":"2026-08-11T08:18:04.066021Z","submitted_at":"2026-04-26T14:42:50Z","title":"RTCFake: Speech Deepfake Detection in Real-Time Communication","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T05:29:45.895667Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.23742"},"observation_digest":"sha256:9ae45f6b1d89a112e5c854a31e5ef4c4267c661b9a077da8084f7691b180dd4d","observation_id":"bd7d2443-a996-4c83-a19f-54f5998998e0","resolution":{"observed_at":"2026-05-11T21:26:17.877875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2604.24794","last_updated":"2026-04-25T23:17:26Z","snapshot_observed_at":"2026-08-11T08:43:29.054192Z","submitted_at":"2026-04-25T23:17:26Z","title":"V.O.I.C.E (Voice, Ownership, Identity, Control, Expression): Risk Taxonomy of Synthetic Voice Generation From Empirical Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T07:46:23.931059Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.24794"},"observation_digest":"sha256:adf34c3ee01ef42aa29623a08cd85ab5de3a5992fbe5f596504c0a7f1fec7f0c","observation_id":"e93d7b81-8cf5-4449-ade3-78e53c56bfe5","resolution":{"observed_at":"2026-05-11T20:51:14.532711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-08-16T06:10:46.050322Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:a8d5fd9a40679dd11ac3bb6f44edaa9c1811f649f988a09362e28d344712c24a","observation_id":"c12b94b0-311e-4bcf-8a7e-1a18febcd28d","resolution":{"observed_at":"2026-05-11T17:06:04.299894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2605.12310","last_updated":"2026-05-12T15:57:12Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:57:12Z","title":"Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T04:09:48.737629Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2605.12310"},"observation_digest":"sha256:41e4458e6eb56d96bc388392e4d146e57638a492abfe57897fc7849b24f164de","observation_id":"8f7d2581-11fe-4319-930e-df8a9269f01e","resolution":{"observed_at":"2026-05-13T04:12:13.862135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:2ed4be8b85d72f76bcd4edc4008718bb74f567b99e34be0a2af0aeb2bb6a3fab","observation_id":"45966ad9-4f26-4fb6-92e8-e5cb3328bc24","resolution":{"observed_at":"2026-07-01T20:26:13.104624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2605.31173","last_updated":"2026-05-29T11:38:38Z","snapshot_observed_at":"2026-08-13T01:34:29.229799Z","submitted_at":"2026-05-29T11:38:38Z","title":"MindVoice: Reconstructing Intelligible Speech from Non-invasive Neural Signals with Pretrained Priors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T21:08:39.636966Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2605.31173"},"observation_digest":"sha256:693f1a7e28a8f2eaa4bc252008b4b890048114dac6b21bb95f68188980aa341c","observation_id":"5772ce05-c8ce-4ede-9068-4f767d606373","resolution":{"observed_at":"2026-07-01T20:26:12.746809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-14T13:44:57.330652Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:f56fd307fe7aea996a340feec15dc48f8d41b48f671ad04df1d0251af2962abb","observation_id":"456d7a1a-912c-428f-a5a1-474ab12e7993","resolution":{"observed_at":"2026-07-03T03:27:36.141295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-08-13T01:33:39.410657Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:ee0e6a9fdba2bf43d9237a7e0c5bbb2ed376c6aca7d0731a23087ee04bb01d8a","observation_id":"8e9be2d8-7655-49ef-870b-50849499dc90","resolution":{"observed_at":"2026-07-04T07:39:38.707667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2411.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-04T07:39:38.706029Z","title":"Fish-speech: Lever- aging large language models for advanced multilingual text-to- speech synthesis","venue":null,"work_id":"10ece45c-e63a-4ab2-b106-971d79be6fba","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:b2c9c242c7ad12312a94614c547f19687b62a18c100d719233ae742b683d8609","observation_id":"cf62a5da-8fb4-4b81-92b8-9318cda5d810","resolution":{"observed_at":"2026-07-01T11:45:47.130806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-11T17:26:24.553591Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis.arXiv preprint arXiv:2411.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04553","last_updated":"2026-07-05T23:58:29Z","snapshot_observed_at":"2026-08-06T08:46:28.466406Z","submitted_at":"2026-07-05T23:58:29Z","title":"Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T17:26:24.553591Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2607.04553"},"observation_digest":"sha256:7451e96f4b024ae4989e6f985d5f30bcb45560d03e5c60c1fcf226f900314795","observation_id":"0efa5e6a-eb1c-4f4e-9f7b-b7be0635e344","resolution":{"observed_at":"2026-07-11T17:26:24.553591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-01T08:40:27.509915Z","title":"Fish-speech: Leveraging large language models for advanced multilin- gual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-18T22:47:56.636159Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.509915Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:cf417b882c4e691e71a989ed5a876127f19a2a11ad34e6c274bd73536d6b5d59","observation_id":"96e8430a-ea47-465d-8339-2ee17845339c","resolution":{"observed_at":"2026-08-01T08:40:27.509915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-04T02:47:38.049516Z","title":"Fish-Speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:38.049516Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:644e7d101075396443325bb2474e3cdc5dbe0485f9ee05a83ef7f54e5522fccf","observation_id":"6310a5c4-2395-4954-bb9d-84ea5c281897","resolution":{"observed_at":"2026-08-04T02:47:38.049516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-04T16:29:20.277818Z","title":"Fish-Speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:20.277818Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:6052a9b0326c764fae4e887b2d1aed3f3e1a8af541a494e7423b1ac20c4dd1b3","observation_id":"5fda3f1f-e7e8-4272-9da1-7fd420f65fcc","resolution":{"observed_at":"2026-08-04T16:29:20.277818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T00:14:43.018619Z","title":"Fish-Speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.018619Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2c0f50d2480c07a3ea986c561369aadfc724029fbbbc4c064cfd75d8828ff2e9","observation_id":"ee3559cc-902c-4a5e-8aa7-a43b9f23cc53","resolution":{"observed_at":"2026-08-07T00:14:43.018619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-10T04:20:41.875811Z","title":"arXiv preprint arXiv:2411.01156 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07462","last_updated":"2026-08-07T17:57:45Z","snapshot_observed_at":"2026-08-19T16:31:52.529349Z","submitted_at":"2026-08-07T17:57:45Z","title":"SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T04:20:41.875811Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2608.07462"},"observation_digest":"sha256:422dff8bc6b2ba6232a5a2e5ce25959262d7520e1886101882e0076b54ffd2f2","observation_id":"58f07b94-66e8-42f0-970a-a83355966612","resolution":{"observed_at":"2026-08-10T04:20:41.875811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.01156/citation-record","integrity":"/paper/2411.01156/integrity","json":"/paper/2411.01156/citation-record.json","paper":"/paper/2411.01156"},"outbound":[],"paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2411.01156."}