{"as_of":"2026-08-07T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5da24294ed95066e881eaedbdb00afffed28ee06a09446e34436707940d149c7","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:00:45.443144Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:48.608557Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:10:07.264049Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-04T23:33:04.314045Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.314045Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:66ccdce36f09236770b727a83b22844d9de4f3af8b6c0b7ee1dead6babb5d3c4","observation_id":"4bcdddd7-3fe6-47af-9e1d-29abea65a4a3","resolution":{"observed_at":"2026-08-04T23:33:04.314045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:1f687613853cb352a46e7e823e45340e14b7fd5d8e4f02585be7902c16d4bb55","observation_id":"676e98a2-d3c0-4c1a-aa9a-15964a6a82ae","resolution":{"observed_at":"2026-05-16T19:24:56.169130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:84d4c99eb4817a54791ac2941fab13d3cc11bcf542295d94fb2de85767b078af","observation_id":"85a899a5-1326-4855-9f0c-b55acd8dfa31","resolution":{"observed_at":"2026-05-11T07:16:00.066357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ecf5f59768cf5e15c35c4c1730685bff9553de2212cf17fe3d8abd72b0f67921","observation_id":"def0da8e-14cc-441f-90dd-899d9e8f6df3","resolution":{"observed_at":"2026-05-11T08:30:57.022266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2604.22225","last_updated":"2026-04-24T05:01:55Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T05:01:55Z","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:11.243693Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2604.22225"},"observation_digest":"sha256:5663a5c11ce057df17ceff8dd30affa788ab0f179e94276c7f20a999438cc36f","observation_id":"3e9c3660-7e7d-4837-85e6-e1db2e1f4755","resolution":{"observed_at":"2026-05-11T19:26:06.900141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2605.09386","last_updated":"2026-05-10T07:24:55Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:24:55Z","title":"Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T03:04:44.050889Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2605.09386"},"observation_digest":"sha256:10c4eb4f36f41b20621e5d5d0cc4179a3b257ce869847466b55bcab86adca002","observation_id":"ea201a97-bad9-4520-a255-b746a50ce4f5","resolution":{"observed_at":"2026-05-12T03:06:18.903145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2605.16026","last_updated":"2026-05-15T15:01:45Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:01:45Z","title":"From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T19:25:18.488377Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2605.16026"},"observation_digest":"sha256:7b148d67b7b3850943d98ceaabde17a3a4be85e2fda1a71c4a19e768ae68dbf4","observation_id":"c59f4b74-288e-485e-b9f3-8ef84eb59645","resolution":{"observed_at":"2026-05-20T19:28:55.046486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:4416ddd3a13202f799ace50d52c84c9e3a1e2b7c98be06a50578d8e1ea0c5bfd","observation_id":"b07cea6b-7b1f-499d-a707-763bc2d30046","resolution":{"observed_at":"2026-05-19T19:02:43.571927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2605.27258","last_updated":"2026-05-26T16:36:56Z","snapshot_observed_at":"2026-08-06T13:26:23.950630Z","submitted_at":"2026-05-26T16:36:56Z","title":"PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T15:51:21.519785Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2605.27258"},"observation_digest":"sha256:bca7ed09ecc37d5bbf5b6da5c75a06b88bc15ff5e10ffdc5f5892018b3f55901","observation_id":"347fa992-b235-4df3-881b-b67243fca0b3","resolution":{"observed_at":"2026-06-29T16:23:39.902062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:ccb6f8484845b6d77cab2922092651f06638637e2d0504a75e4719bae82bb134","observation_id":"23b15910-3c75-4b15-9600-4ec0c072da49","resolution":{"observed_at":"2026-07-01T20:26:13.142910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:0136bfe124c8b1fcd371c4586ab18cc2802cf4423b33eb522a606001a8a3b117","observation_id":"7403fb74-abe3-4dee-85de-5ee6503270fd","resolution":{"observed_at":"2026-07-02T05:16:39.764041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:fdcf7373fd572a8a74aa2091f38bd9d684186b5442d4e8b359fd6e37f665196d","observation_id":"e414a990-d9d6-4970-9391-d82056e56a09","resolution":{"observed_at":"2026-07-02T19:47:19.789461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:c58bf67a258c46a2f06e762f2e978fdef3c930b2b67c8e8cd1019907093143d3","observation_id":"4af40350-8541-4072-9114-7128ce4677d3","resolution":{"observed_at":"2026-07-02T19:57:20.057397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:57f24e1b11d236ab68d43ab0c942dbf9ec32e46b4761b323d0da40bbba79c71d","observation_id":"67ed1d33-45d0-4f92-b587-64bb4b7dd29f","resolution":{"observed_at":"2026-07-03T03:07:35.862568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-03T07:58:02.783857Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:aa75b36dbadc1ba5eef4dda84d03549e280bd38f708c8b4113f652bdfe90fbef","observation_id":"8976db81-22b6-4a89-b588-c4602aa08a20","resolution":{"observed_at":"2026-07-03T03:37:35.155827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.20650","last_updated":"2026-06-08T06:54:55Z","snapshot_observed_at":"2026-08-02T23:08:38.292740Z","submitted_at":"2026-06-08T06:54:55Z","title":"EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.972071Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.20650"},"observation_digest":"sha256:dfd32e36a9f365b779412c5b7dd2368ad89a99eb3c712ba4532aa965344a4745","observation_id":"3993a0d3-5e96-4bdc-b983-13a855139985","resolution":{"observed_at":"2026-07-03T00:47:30.569340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.25369","last_updated":"2026-06-24T03:57:21Z","snapshot_observed_at":"2026-08-05T15:29:17.177693Z","submitted_at":"2026-06-24T03:57:21Z","title":"Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T20:43:29.118351Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.25369"},"observation_digest":"sha256:eeffbe9f3bd2d146888b55ad200ad0591c0a45b04265a93d9b9ccf39231df105","observation_id":"698cc9de-f8e5-476a-a516-bc9dbdae1d65","resolution":{"observed_at":"2026-07-04T20:10:07.265869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":"2509.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-04T20:10:07.264049Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot","venue":null,"work_id":"5d448782-48d8-4231-a348-52ac28227f51","year":2025},"citing_paper":{"arxiv_id":"2606.28249","last_updated":"2026-06-26T16:35:48Z","snapshot_observed_at":"2026-08-02T17:24:03.159581Z","submitted_at":"2026-06-26T16:35:48Z","title":"HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T02:05:46.290721Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2606.28249"},"observation_digest":"sha256:9143343feb4240f2d981a9402b371965a83c85b70ae35e53891e0f24d9eaf0ce","observation_id":"dfe95108-84a6-49cc-bf55-78468548ad92","resolution":{"observed_at":"2026-07-01T18:25:57.629251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-07-11T21:24:36.925360Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04140","last_updated":"2026-07-05T06:45:47Z","snapshot_observed_at":"2026-08-06T05:51:10.452020Z","submitted_at":"2026-07-05T06:45:47Z","title":"DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T21:24:36.925360Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2607.04140"},"observation_digest":"sha256:8268f42e472fa00bf9f4d7f71a8a1843bf8850608a1ffdf7e52fe87b431004f8","observation_id":"156c0386-b4dd-449f-940e-2a7df766a339","resolution":{"observed_at":"2026-07-11T21:24:36.925360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-02T06:31:31.608149Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12496","last_updated":"2026-07-15T05:26:04Z","snapshot_observed_at":"2026-08-06T04:10:43.064264Z","submitted_at":"2026-07-14T08:28:48Z","title":"ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:31:31.608149Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2607.12496"},"observation_digest":"sha256:4d1a65fc23040c3259550b0ee583c8171815297d79064c19e48f04fc5f4934f6","observation_id":"5c8c5536-3544-4e4e-9205-72d53a0d1476","resolution":{"observed_at":"2026-08-02T06:31:31.608149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-03T08:35:56.089198Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:56.089198Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:ade129c15760d2c9c6c8cdcf2ea61fbe86087e6ceee5931ab9426d59b0d63a54","observation_id":"b706bb34-4e39-4f81-b778-6bc3753d72b1","resolution":{"observed_at":"2026-08-03T08:35:56.089198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-04T16:29:29.493316Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T00:11:26.246272Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:29.493316Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:0a9ca03b10286e86825a45b37af1fc8a7f01d63af598c40c9778ca27fd42940b","observation_id":"9c8f1cfb-c94d-4215-ad4d-940288e57853","resolution":{"observed_at":"2026-08-04T16:29:29.493316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-07T00:14:48.608557Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T00:11:26.246272Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.608557Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:88a029a83c35c47a30f3ff99ecfeb8b35b7513eb2c0d0560669e80dfe19454af","observation_id":"fc61158c-106d-4638-89d6-178270575d88","resolution":{"observed_at":"2026-08-07T00:14:48.608557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02020/citation-record","integrity":"/paper/2509.02020/integrity","json":"/paper/2509.02020/citation-record.json","paper":"/paper/2509.02020"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-05T12:00:45.274842Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.274842Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:156f45c5bc0be8454740258cbb00e3dac6b14f87ba3ef3ac2b7f2e7ecc8aaab9","observation_id":"cefde6a1-a184-456f-8e52-c5e09ce4e093","resolution":{"observed_at":"2026-08-05T12:00:45.274842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20499","last_updated":"2025-05-26T11:34:20Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T12:39:06Z","title":"FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20499","snapshot_observed_at":"2026-08-05T12:00:45.279735Z","title":"Fireredtts-1s: An upgraded streamable foundation text-to-speech system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.279735Z"},"links":{"cited_paper":"/paper/2503.20499","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:eb125e2a40a90021275f12e6106913c1643dc569283bacc90b10c91e4065fa15","observation_id":"489b64a4-604d-404a-9fa5-6e6923f7132c","resolution":{"observed_at":"2026-08-05T12:00:45.279735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T12:00:45.284776Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.284776Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:98eb95b60f04e9d37fb1d75a9f36acfb8c3b04ec3fc19d5f6abb66a6b2294277","observation_id":"5d251310-1f84-4d67-a078-5a8b47f82b65","resolution":{"observed_at":"2026-08-05T12:00:45.284776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T12:00:45.289852Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.289852Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:5b9ee947658d686809740d5d77e7c94451010f90e7165e9664c7eda62798b86d","observation_id":"7d2eacaa-c0cd-46c9-8700-f55b55ee16de","resolution":{"observed_at":"2026-08-05T12:00:45.289852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T12:00:45.294951Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.294951Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:2a9718b34601bd9a5c666c6f561db943f10a15a6c18375f27403d19232298a10","observation_id":"29256767-0f50-4d5c-ba91-349d19f274cc","resolution":{"observed_at":"2026-08-05T12:00:45.294951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-05T17:33:03.736753Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T12:00:45.299724Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.299724Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:8622285fea783093f60cfd48082be2ecccccd53af2471fbd8993f2f4e63acae4","observation_id":"f6b11d61-fc62-4741-9e45-9c2fd67d14da","resolution":{"observed_at":"2026-08-05T12:00:45.299724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T12:00:45.305208Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.305208Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:1ecdba0576818ef5fafa25381a5a703db7c8f2042ec0ba29a7e764f2fcc4a0bb","observation_id":"c68d5cec-178c-4b7f-87a1-08a6cf00b825","resolution":{"observed_at":"2026-08-05T12:00:45.305208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-05T12:00:45.309565Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.309565Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:fe6b12824d56e6629041ffab5ee2e8d8bfbdf6a143146ff762140c3aae8cd5dc","observation_id":"cc062fb2-9d13-477c-897c-c469a86beab9","resolution":{"observed_at":"2026-08-05T12:00:45.309565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.124483Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":"f6064792-da02-4267-976c-b7dd9b9433bf","year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.314513Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:359e2f9edf7df8d75f23c8dc4253d04444b6ed0f9b3e3b031c5ed3835870b3a4","observation_id":"251bcca0-1cdb-4a25-87c9-fafb3c76c7ec","resolution":{"observed_at":"2026-08-05T12:00:46.129243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-05T12:00:45.318658Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.318658Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:50e42ec423fc85aa5f3b6db6731e4e96f01ba8ee42b880b4eb16a613e7dc8cd5","observation_id":"cc97a2fe-4c5b-4154-80eb-a4cf23513cda","resolution":{"observed_at":"2026-08-05T12:00:45.318658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-08-04T09:21:35.342211Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-08-05T12:00:45.323277Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.323277Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:b98df3139c2f58a0fa71c2cb9ece57c9e701b7dabeb1fe69249b24e7a8c711e7","observation_id":"82ec05d8-8df7-4746-a823-d2fe5760ef14","resolution":{"observed_at":"2026-08-05T12:00:45.323277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.109885Z","title":"Podagent: A comprehensive framework for podcast generation","venue":null,"work_id":"2f4872bf-bc68-4f53-912b-cd28adc8f0a6","year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.327810Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:979d26d14f28c20bcdee087f7b8d2168e0ed568e085c78c46a7b997ac1f6c2c4","observation_id":"20543e3d-db0e-4037-83ad-ebdca0906f54","resolution":{"observed_at":"2026-08-05T12:00:46.114580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.094977Z","title":"Covomix: Advancing zero-shot speech generation for human-like multi-talker conversations","venue":null,"work_id":"10bffde4-6538-46b1-a61f-117473c6325e","year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.332221Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:605d8d70f11e6ada70d78e17955b5502e09f3ead73109bd8958ab2874630360c","observation_id":"0dbdac0b-c7a9-4d3c-8c3e-6e38adc875df","resolution":{"observed_at":"2026-08-05T12:00:46.099725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.336483Z","title":"Covomix2: Advancing zero-shot dialogue generation with fully non-autoregressive flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.336483Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:bc3ca11ef45aa24f3b84050b874ec9ffee028a3748e7814ec2f18148ad22ecc8","observation_id":"b146c7fd-0612-4ee7-b127-281212aa782f","resolution":{"observed_at":"2026-08-05T12:00:45.336483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14345","last_updated":"2025-03-19T07:17:41Z","snapshot_observed_at":"2026-07-06T20:54:45.985432Z","submitted_at":"2025-03-18T15:25:08Z","title":"MoonCast: High-Quality Zero-Shot Podcast Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14345","snapshot_observed_at":"2026-08-05T12:00:45.340930Z","title":"Mooncast: High-quality zero-shot podcast generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.340930Z"},"links":{"cited_paper":"/paper/2503.14345","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:c593811e429d54913a2551ebf3bcf2a53e4e53e7ec35c0f639699d57e3100610","observation_id":"a48fddc6-1147-43b0-9c2b-560188e4da60","resolution":{"observed_at":"2026-08-05T12:00:45.340930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.080226Z","title":null,"venue":null,"work_id":"5962e112-9e2a-4fb8-9412-1a38b3e4e5e5","year":null},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.345227Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:0955d5c0efd840ea49fe900545f7bb121eb4892dc1bb1f9b8edecfdcf25025c3","observation_id":"14c934d0-4c7f-485a-a657-0f88943a0a9d","resolution":{"observed_at":"2026-08-05T12:00:46.085072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.051046Z","title":"Parakeet, 2024","venue":null,"work_id":"391dabeb-ef97-4d80-8c6c-f1ccaf35f275","year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.354761Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:1ccb8b0ced78cc2ab0122564ef12de2ab365a263140e61e680c22569fd79c14d","observation_id":"df16ea93-8aef-4689-a1b5-51eecc291ec9","resolution":{"observed_at":"2026-08-05T12:00:46.055182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09318","last_updated":"2026-04-14T14:21:41Z","snapshot_observed_at":"2026-08-02T11:31:42.381498Z","submitted_at":"2025-07-12T15:18:47Z","title":"ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09318","snapshot_observed_at":"2026-08-05T12:00:45.359674Z","title":"Zipvoice-dialog: Non-autoregressive spoken dialogue generation with flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.359674Z"},"links":{"cited_paper":"/paper/2507.09318","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:4276908b952340b8d13a57ff4c4b424b3c5065be80c282d3162a10f6db2e8ada","observation_id":"22b0f101-4787-4608-86c1-c0a5ae3ee09d","resolution":{"observed_at":"2026-08-05T12:00:45.359674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.036424Z","title":"Text to spoken dialogue generation","venue":null,"work_id":"6470450e-6444-4cb7-a31d-b8ee201c9f12","year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.364350Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:31e5be85abf15bab27c43280a9a8ae24a8fed04d6b85b8ac3b71469564f47bfe","observation_id":"f467db39-b9b1-492f-b7a2-8bc0d7bee920","resolution":{"observed_at":"2026-08-05T12:00:46.040932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-05T12:00:45.368477Z","title":"Vibevoice technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.368477Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:11e0e86e0872d4e511457f9eb9022870f70cd9b866e4cb7874f1939b172c3773","observation_id":"73c02f5b-98d9-445e-a231-b9897de33e5f","resolution":{"observed_at":"2026-08-05T12:00:45.368477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.021275Z","title":"Crossing the uncanny valley of conversa- tional voice., 2025","venue":null,"work_id":"d9144f58-cb5c-472b-bfa8-b0bc9106cfe2","year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.372784Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:1dc10216c41693e744fb7e249d9f67df5a58d17f24fc5e6e19e5a93e1b3ecea1","observation_id":"0afad6cd-6aff-4af9-9e06-252673b779b2","resolution":{"observed_at":"2026-08-05T12:00:46.025912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.005594Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model","venue":null,"work_id":"d9bbf2d2-4006-4fc9-aa65-565e600e0534","year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.377062Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:9f515ace72635b0df99420d17e7b4d4ada326b646f1251d5b14c1a7712fd9ba0","observation_id":"ef406995-7bd4-458a-9f11-208424da88b2","resolution":{"observed_at":"2026-08-05T12:00:46.010433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T12:00:45.381451Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.381451Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:96a1450617e6590a9f6245869f97aa959c5e2585055f4894ff4814cc1a46397f","observation_id":"889ef837-5acf-4ae4-bc89-3030145ccde1","resolution":{"observed_at":"2026-08-05T12:00:45.381451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T12:00:45.385843Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.385843Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:bad00b82fbc13fc53878b1e798a9711f1bfa3009938ecb937ddfc579ce4d0ec7","observation_id":"b986fc34-f565-4f28-9bb0-aabbcd94cffc","resolution":{"observed_at":"2026-08-05T12:00:45.385843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T12:00:45.391077Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.391077Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:51ca681d6da13e5464807bb06acefb40beef38ff262f5af69904d00f5645fa14","observation_id":"25c7f6dc-5a26-403a-a0e8-eeb2b8cad26f","resolution":{"observed_at":"2026-08-05T12:00:45.391077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.989539Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"f2ed4e64-1c8d-4461-9a90-d59d8e54c02b","year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.395542Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:893b8874974aa1e46f8047abe3c951426cd37d32a22f6bb030fdb912265da261","observation_id":"f63e429c-afad-40d9-9618-54c74be991ff","resolution":{"observed_at":"2026-08-05T12:00:45.994370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.973954Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"2bd9e506-f467-44cb-ac40-e66b591cc15c","year":2021},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.399918Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:2cc27792d074d4add162502adb963eaa9a4e7ba20617fad92ef4067746510bdc","observation_id":"ab7c535d-0bda-4896-b7da-61b089fcafac","resolution":{"observed_at":"2026-08-05T12:00:45.979068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.957046Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":"5c3edc2e-8c56-45e6-b869-16f68193287a","year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.404142Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:3002d5c7d294d176eee5d8328dabf896fb0f39705823596c9e3c8ff8e84e3560","observation_id":"cb76bd30-7352-4638-bae8-87eb1a383b24","resolution":{"observed_at":"2026-08-05T12:00:45.962367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.940227Z","title":"Scaling transformers for low-bitrate high-quality speech coding","venue":null,"work_id":"ca277d18-b4e4-434c-aadb-ff21cff64b1e","year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.409065Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:345599fabb2533dce8510c3ef521b01c2ead8b5f6eece4db9c29b02624aa894e","observation_id":"4a6632e9-dec5-4d29-b7cc-3d67b369c452","resolution":{"observed_at":"2026-08-05T12:00:45.944951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.925003Z","title":"Simple and controllable music generation","venue":null,"work_id":"934931f2-6d8a-436c-bd50-328b0938f513","year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.413833Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:67fe698f8ba964e08d76ef6f2435cffb3c4567877ba6605652f713c732669577","observation_id":"5c2fd124-eeea-489c-ac8e-3a0dbc21d53a","resolution":{"observed_at":"2026-08-05T12:00:45.929684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.909065Z","title":"Qwen 2.5: A comprehensive review of the leading resource-efficient llm with potentioal to surpass all competitors","venue":null,"work_id":"e399679d-9d0d-4564-815a-6089abf2a097","year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.418098Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:275b4ffb2eedb38a3a7819637fdd7dcf1465e3b2d5e374f71300544cf914f9ad","observation_id":"36f5adc5-97d5-4776-8b37-15868874c33f","resolution":{"observed_at":"2026-08-05T12:00:45.914030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T12:00:45.422814Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.422814Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:921b9e41bda288c91f00c64e5551f5c3cc90bbd6aa3b5f771ed468d57469bde4","observation_id":"78740931-f52f-485a-baba-662d9142bc05","resolution":{"observed_at":"2026-08-05T12:00:45.422814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T12:00:45.427743Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.427743Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:2db20adf6cb82bd5c8846ee0cbfec4be167b626c0af100e8a8d8f16ffceb3365","observation_id":"6d8e8d91-3e33-49eb-8da4-a442370d71d5","resolution":{"observed_at":"2026-08-05T12:00:45.427743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T12:00:45.432306Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.432306Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:c92fd810d60bc0db684cd4a1bcaa932edc27227750d988d9dc61bf77bdecd333","observation_id":"bf3d3c93-977f-44cf-b01c-dd3aba6139e1","resolution":{"observed_at":"2026-08-05T12:00:45.432306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.893996Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization","venue":null,"work_id":"582128b3-1ff6-47db-9836-6fe89f9e34a0","year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.437900Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:690d372c64e5e0b1bed9a2de3b8c23199c9577e7e2b6f7f5be740b98da5583dc","observation_id":"eb2a2da1-0729-4284-94be-73e437d7e9ab","resolution":{"observed_at":"2026-08-05T12:00:45.898617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:45.876137Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe","venue":null,"work_id":"2c3757a5-34ed-4ddb-8b07-14c5a6879d7f","year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.443144Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:9b3b78f1e3f58c8eda93024acb8524d4adcfa45542c1a6e7ed2c9adf49d7358b","observation_id":"349115e2-7dc5-49bb-82e8-d2889652fb37","resolution":{"observed_at":"2026-08-05T12:00:45.882801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:46.065758Z","title":null,"venue":null,"work_id":"7b68cd4a-2e35-41e7-a492-a9aa8b37c7e1","year":2025},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.349698Z"},"links":{"citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:f742dc3f44227a783e53f2f43ca8c553d93bf9128f070d7b608f225e8c5c1bec","observation_id":"ca17f8e5-94ab-4327-a234-057193db9ad1","resolution":{"observed_at":"2026-08-05T12:00:46.070208Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":21,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 23 inbound Pith citation observations for arXiv:2509.02020."}