{"as_of":"2026-08-08T21:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6791f24e7cd0183c579dc3042a4f0198377eebad1c630fc1a91bc465854714bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:07:00.510661Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:29:41.338585Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:3137d0d514650e3382f1c3b756d9b47733c8f023926c6598d94ce0c7df8f9de5","observation_id":"d20dfc8c-8fda-41d8-81f3-2483d87ab40e","resolution":{"observed_at":"2026-05-16T06:06:41.552278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:9545b188d40c48387f11f4f0a0d19f4d1b20c02ae6a781ec8379e8ccad2c0642","observation_id":"e3754d63-1370-4fd4-8898-c1ddcb4dc393","resolution":{"observed_at":"2026-05-13T06:19:09.576355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-08T19:07:00.510661Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.510661Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:159464fae5c28233972f4da7a17b15f8b1b1d8510f5e7d15900ea8f70ebc10bb","observation_id":"0fadcd10-c646-4158-be36-c0dddd35c6bb","resolution":{"observed_at":"2026-08-08T19:07:00.510661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-08T13:26:19.124096Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-08T13:20:08.544123Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.124096Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:a9c08c29edf08efd9d2d54d9927c4c6f66bbfa7c3d12d6da3b9b0e2a9330758e","observation_id":"ab9f82f4-1ab7-4ad4-82d3-3aab0706d44f","resolution":{"observed_at":"2026-08-08T13:26:19.124096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T15:23:15.859744Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.859744Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:dc836aa493366b035824060a6cae59411d5354eda16b3c9832f05dab79c178b2","observation_id":"6ba236b4-77cf-483f-80a7-d4709efe4c0d","resolution":{"observed_at":"2026-08-07T15:23:15.859744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-08T16:08:45.949013Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:483b180e135ed7e77cbc87ceda3dae8f53907245760c3a908c904105be6e838e","observation_id":"c380d880-2de5-43e2-b763-1b8e6964a994","resolution":{"observed_at":"2026-05-16T05:27:25.554102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T14:19:56.932091Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.ArXiv, abs/2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.932091Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:76fe5cb9a44bbaf712aee45d73747edaa5f3a64973de98dc55ed6f36459dfc9c","observation_id":"235bff6a-1867-49b6-87de-bd2096abb91f","resolution":{"observed_at":"2026-08-07T14:19:56.932091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T14:15:55.201763Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.201763Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:655c616f5eeda352e40d235d52a3f72850283c0ebb09e9962847e912b893ffa7","observation_id":"594d5d61-61ff-4221-becd-05815f436794","resolution":{"observed_at":"2026-08-07T14:15:55.201763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T13:21:54.561667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-08T12:11:39.471812Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.561667Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:6d1d2619fe93db550764f482b6a03f0cb8a4b227ffecc470c7634fee95317b1d","observation_id":"7425d4dc-2ea1-4ce5-9d9b-c5eae321ef72","resolution":{"observed_at":"2026-08-07T13:21:54.561667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T00:45:13.608161Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13053","last_updated":"2025-08-07T03:12:26Z","snapshot_observed_at":"2026-08-08T05:07:44.858553Z","submitted_at":"2025-06-16T02:48:17Z","title":"ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:13.608161Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2506.13053"},"observation_digest":"sha256:36c6d6f1d2afc4604561390217c650e0076286c198395e56a85cb4dc5eb6db08","observation_id":"47614f9a-f3b0-4357-b723-32f725028c9f","resolution":{"observed_at":"2026-08-07T00:45:13.608161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T23:21:54.069634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.069634Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:5092944c05a2414e4b89df79fc8f5e2fd15245c3fafa40832146bf2aeae8ff21","observation_id":"f04ef65d-a581-47f3-8108-7d8574e282b2","resolution":{"observed_at":"2026-08-06T23:21:54.069634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T00:46:39.196042Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2506.23552"},"observation_digest":"sha256:8ef25bfc89eaa2df1bb7f3e3f8f78e334f3e57ecd196d9c58a77923aa06a9491","observation_id":"a4cb8f56-6738-412c-b666-4824b108b49c","resolution":{"observed_at":"2026-05-22T00:50:50.989669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T19:14:11.205847Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06116","last_updated":"2025-07-08T16:00:13Z","snapshot_observed_at":"2026-08-06T19:08:17.275644Z","submitted_at":"2025-07-08T16:00:13Z","title":"Speech Quality Assessment Model Based on Mixture of Experts: System-Level Performance Enhancement and Utterance-Level Challenge Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:11.205847Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2507.06116"},"observation_digest":"sha256:fe6729557f8ec4719321a56f6cb301f6a0e445343ce695d6737b5acb708b66c7","observation_id":"30f9b39f-def3-4812-afda-b754c9957879","resolution":{"observed_at":"2026-08-06T19:14:11.205847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-02T11:31:42.381498Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T04:29:41.285194Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2507.09318"},"observation_digest":"sha256:2585b8ab08e5b120d3d568b981fde1870b5210b1e28aadcce710bb5695cb5539","observation_id":"d117a21e-b6f3-46f3-b34f-e7ac10819055","resolution":{"observed_at":"2026-05-19T04:32:03.685695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T16:33:52.374067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13155","last_updated":"2025-07-17T14:17:40Z","snapshot_observed_at":"2026-08-07T19:53:51.352286Z","submitted_at":"2025-07-17T14:17:40Z","title":"NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:52.374067Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2507.13155"},"observation_digest":"sha256:90a2e16a6d731b876f8a729535c465c9b282cfe237fa0184849a70d42091df4c","observation_id":"5f720103-5c55-497f-8569-2b43f5e60094","resolution":{"observed_at":"2026-08-06T16:33:52.374067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T12:49:17.719579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-07T23:23:35.413701Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:17.719579Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:9d0063ee74bceae5f021a815a3d14f72456320f07ccfffaedf65540194a6fb34","observation_id":"bd611872-f44b-4e2d-aa23-8a946cd85e5e","resolution":{"observed_at":"2026-08-06T12:49:17.719579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T00:51:30.398007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.398007Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:ae4246bafcf5c746b921a720eae6b69a58d53f8a862d1567d29bee856138990f","observation_id":"c671d657-7cf7-46fc-a3ff-b7c02cdf8e9e","resolution":{"observed_at":"2026-08-06T00:51:30.398007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-05T16:01:52.598217Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.598217Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:319f1497226caf3e5e46d9acda51df846593eb4a6a93c6bf65f606b0ac3ead9f","observation_id":"04207df1-0bfa-4b6d-9458-20207a08e057","resolution":{"observed_at":"2026-08-05T16:01:52.598217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-05T12:00:45.274842Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-08T14:19:05.637955Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.274842Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:44fd636b50f91486de53d43641011331306405d7dfb0cab092d59475a6722870","observation_id":"cefde6a1-a184-456f-8e52-c5e09ce4e093","resolution":{"observed_at":"2026-08-05T12:00:45.274842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-04T23:33:04.290230Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.arXiv preprint arXiv:2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.290230Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:303f15342d1a7ac4d02f78eb8f1c6f5d2eb8b7d0ec04c786cb4e828d2daa9e6e","observation_id":"dfafd71d-d7a0-4111-ac51-e2955428a5c4","resolution":{"observed_at":"2026-08-04T23:33:04.290230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:f7485c329af9855e2b0cd3f2577e5d7bc57c23ebf6dec85f6b8ca58b2abba3f6","observation_id":"d28099c9-99dc-49a7-8377-68848241ab74","resolution":{"observed_at":"2026-05-17T01:03:15.223871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-04T11:29:32.431418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.431418Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:744f1a1bfc89353f9e273508a4ab48948eadba02a311843c2ff566bcda5899d4","observation_id":"e26d98a2-a154-49b9-9b21-89d5298ec760","resolution":{"observed_at":"2026-08-04T11:29:32.431418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2510.19414","last_updated":"2026-05-11T03:38:57Z","snapshot_observed_at":"2026-07-06T22:33:48.680749Z","submitted_at":"2025-10-22T09:34:31Z","title":"EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T05:01:57.044869Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2510.19414"},"observation_digest":"sha256:1a43c277d6715d44336488fa3a0b0e1c13b70b15ee47c57e42ab37880e021f3e","observation_id":"823a16f6-e458-4820-adef-e45758a0ca7b","resolution":{"observed_at":"2026-05-18T05:02:23.383902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:b53cdd16d282f810f02ac548c48a3cdbfd9ffb46c22c8072e2aafa96b21a0639","observation_id":"77153097-b6dd-4302-877f-27f9e3db101b","resolution":{"observed_at":"2026-05-13T23:03:24.891256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:086a48e95759986ae30160eee15918d366b27a191df296cfbf4a06177dc3f77c","observation_id":"dff7dc9f-38a9-4243-a83e-443a16023c49","resolution":{"observed_at":"2026-05-11T08:30:57.154210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:967ee6f7a09e3f78e453a560d6f7757a0e9720dc87406e2665b565649b4f6469","observation_id":"46d95095-df79-4898-95cf-9d0b808f6a00","resolution":{"observed_at":"2026-05-13T01:07:00.265442Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:681ff3942275fdc476ea6301504ecce39548ba467c6b440642548f07530021ca","observation_id":"be6446a3-77f2-498c-818d-b1dbf5582866","resolution":{"observed_at":"2026-05-19T19:02:43.589090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:6cacd91af2d79a1f35719882e27079e9ffffab30041d097c025edf6df84b1564","observation_id":"ee013815-f54d-44c8-92bb-fac7cfed4656","resolution":{"observed_at":"2026-07-01T20:26:13.104940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:6fcc5b94856b8398446bdfc848a26200ee7412ec18829eb651c6ba9d8b47c882","observation_id":"5554fe46-4731-44ee-8b2e-3cec4b45bde0","resolution":{"observed_at":"2026-07-02T00:46:24.607854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:f61a4ca01a6a8c02fee86269c1256fdd1ab0b0a1ef1d7cb01fce16b2378a2aa5","observation_id":"4476e729-e5e4-4ced-aa61-c1d5762c8250","resolution":{"observed_at":"2026-07-02T05:16:39.768674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:e9fb8f72f09599ce21980efaee2af482d84a34e8b66ab1396915269a3545feb7","observation_id":"d6c9f23d-4232-4d1b-b5be-cbde1fa35f93","resolution":{"observed_at":"2026-07-02T19:47:19.733226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:834ef3e51890721557a06a9bf197db86825f75507f278221fdf849b2523fdb2d","observation_id":"45724a0f-9436-45d4-983c-cf0fbc79f786","resolution":{"observed_at":"2026-07-03T03:07:35.850892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:2935f480b15c7e548b44d9a853a8f0e3565758da5fe11bb4c818e4ff319bcf70","observation_id":"0f3a401c-6ffa-45d9-8b66-5b3376effd5b","resolution":{"observed_at":"2026-07-03T03:27:35.634796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-03T07:58:02.783857Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:0e2d8f117a85e126290e0556117afe45e6511666e06ffa7ce5fa5267e2b6a3af","observation_id":"b4dfecfa-5f66-46ce-9ec4-c8d33a0bfd67","resolution":{"observed_at":"2026-07-03T03:27:36.170307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.09234","last_updated":"2026-06-08T09:07:23Z","snapshot_observed_at":"2026-08-05T17:27:24.038541Z","submitted_at":"2026-06-08T09:07:23Z","title":"End-to-End Training for Discrete Token LLM based TTS System","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:06.893507Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.09234"},"observation_digest":"sha256:9ec88d676794e9e22a4f438569c80d574ed48309439274fc11e201aa41cb10f0","observation_id":"58c08025-067f-41e3-96ba-0ad7c52fcac6","resolution":{"observed_at":"2026-07-03T03:27:34.892211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.18072","last_updated":"2026-06-16T15:40:37Z","snapshot_observed_at":"2026-08-07T02:45:15.727363Z","submitted_at":"2026-06-16T15:40:37Z","title":"One-Step Token-to-Waveform Generation with MeanFlow in Latent Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T22:45:53.073871Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.18072"},"observation_digest":"sha256:7ae3681874113ff92af631db15174b68bb2c48b0cd7e93e4fc7396ec59b0a4d4","observation_id":"24829c5b-27c9-47d4-acbd-828dfe98d711","resolution":{"observed_at":"2026-07-03T23:19:03.036123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.21882","last_updated":"2026-06-20T04:47:45Z","snapshot_observed_at":"2026-08-08T03:12:18.006572Z","submitted_at":"2026-06-20T04:47:45Z","title":"Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T11:42:44.035902Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.21882"},"observation_digest":"sha256:93ec4bac1e096fbd9c9d0c7aae37178191631c5b545ba34e4ae00fb635b41261","observation_id":"0479e9c8-ef06-4c56-97af-b5a27e608693","resolution":{"observed_at":"2026-07-04T08:29:41.340017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:4e0066b0a5eb44302846d69f7f57fd903ce68f02ef0df5cfd53ad50a81fc9863","observation_id":"d9b06688-7d9e-4526-84ae-34abc4897273","resolution":{"observed_at":"2026-07-01T11:45:47.144382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2607.00363","last_updated":"2026-07-01T03:02:31Z","snapshot_observed_at":"2026-08-04T17:50:05.786197Z","submitted_at":"2026-07-01T03:02:31Z","title":"Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T06:36:42.174254Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.00363"},"observation_digest":"sha256:ba2f72bafa122ebf7158e6e3c801c879a7fe388db68f72f32983c76c13beffe9","observation_id":"a0d0e77a-334f-45cf-a8b6-7686f25d5dba","resolution":{"observed_at":"2026-07-02T06:56:44.308754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2409.03283 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-08-07T15:40:45.553118Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:b1ef0bd34201d0de4a4d94b45447fbd9ea744b46d261401bc69d55c0a2c05cea","observation_id":"7916e613-da85-4173-8696-8df411191f06","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-01T11:33:14.254397Z","title":"Fir- eRedTTS: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.254397Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:af28804bcf143f47114395a048c41c02f9e14a57c90bb1a5f18229785e2e7ac9","observation_id":"1c9468fe-a430-472d-8256-dce62ab51a78","resolution":{"observed_at":"2026-08-01T11:33:14.254397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-01T08:40:27.699814Z","title":"FireRedTTS: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:27.699814Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:fd3824206e2aa5d753b186e9bbba84ad0176b135634c01ca7e5f672c522d909a","observation_id":"c1eae712-ec60-4c69-95c0-911f42e4aa10","resolution":{"observed_at":"2026-08-01T08:40:27.699814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-03T08:35:49.194945Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.arXiv preprint arXiv:2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:49.194945Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:272f4634247ba345015608bb147b87a423430c847c31407210b1cc0e5176cfa7","observation_id":"680b1adf-f1f3-48ed-9db1-03bf0ed52b91","resolution":{"observed_at":"2026-08-03T08:35:49.194945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.03283/citation-record","integrity":"/paper/2409.03283/integrity","json":"/paper/2409.03283/citation-record.json","paper":"/paper/2409.03283"},"outbound":[],"paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2409.03283."}