{"as_of":"2026-08-18T10:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8afd68bbdb81152ba9f8211266407188a05f84855f3929ae7e0206b0103c4f78","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:05.011278Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11737/citation-record","integrity":"/paper/2608.11737/integrity","json":"/paper/2608.11737/citation-record.json","paper":"/paper/2608.11737"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T00:37:04.855832Z","title":"Seed-tts: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.855832Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:071e6c457c586df92eee044167c742f465cb2a48e5465de5f39517d0fa6b62e0","observation_id":"6299754f-6941-43b3-9c65-1897d925b67e","resolution":{"observed_at":"2026-08-16T00:37:04.855832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-17T16:41:56.671582Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-16T00:37:04.860178Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.860178Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:61e85ea8a30a11deb59dbc8707126b968f93d7f1768831518df7c03d3278aea0","observation_id":"24f6b3a3-7e86-4b8a-bf33-72248c77c095","resolution":{"observed_at":"2026-08-16T00:37:04.860178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-16T00:37:04.864550Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.864550Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:8011bf077d1c3c6e97b102de29c85ed354a8edd74dd4c2c18e5323581671ff43","observation_id":"ef19d6b0-298f-446a-838c-2426a92e094b","resolution":{"observed_at":"2026-08-16T00:37:04.864550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.626652Z","title":"Ds-codec: Dual-stage training with mirror-to-nonmirror architecture switching for speech codec","venue":null,"work_id":"b211d408-92f4-433e-b5ea-776ed2b01e3a","year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.868619Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c14bbb2c2c1177433b72e4abafa937c41c5a3cde28b59460eb7c8e3b4c344126","observation_id":"c7db203f-2dcf-4328-b109-506bf25fb32d","resolution":{"observed_at":"2026-08-16T00:37:05.631902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-14T10:11:40.647550Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11611","snapshot_observed_at":"2026-08-16T00:37:04.872459Z","title":"Sara: A dual-stream vae for high-fidelity speech generation via integrating semantic and acoustic representations.arXiv preprint arXiv:2606.11611, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.872459Z"},"links":{"cited_paper":"/paper/2606.11611","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:b4dbbc88773917c08700dc4c44066bccd9e63123c1c421ac307e3e1e54500b80","observation_id":"775d7f71-93cd-4c9b-aacd-a5b1b1044671","resolution":{"observed_at":"2026-08-16T00:37:04.872459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.609230Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022","venue":null,"work_id":"cebf0d6c-a36c-4869-a102-7373f4a42c48","year":2022},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.876165Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:7051174d854e17d33b6391fdde61483a6c03d2826910dc7f9959475a4c4f0769","observation_id":"26e56797-04fd-4565-8829-026f3014147c","resolution":{"observed_at":"2026-08-16T00:37:05.616681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.880497Z","title":"Neural codec language models are zero-shot text to speech synthesizers.IEEE Transactions on Audio, Speech and Language Processing, 33:705–718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.880497Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:ce4613b3e7c41a9adec11ea79d98e291df4790e15c6cf275db1d1ffeb15e0593","observation_id":"d0725086-5c4b-4806-88ac-ad3c29b57b46","resolution":{"observed_at":"2026-08-16T00:37:04.880497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.884261Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.884261Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:0ea58f16b112079ad80de3a3cbc9231ecc5ebc735da81e8c75a06de92b30dfed","observation_id":"f3a9f138-c9ae-41a3-b09a-77a8b5b633de","resolution":{"observed_at":"2026-08-16T00:37:04.884261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.888080Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.888080Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:60d74a47984454a8349cfed65d235949748b083dfab3446b1b77b16f04041777","observation_id":"97897886-1e82-4a23-8a54-9682a6b4b788","resolution":{"observed_at":"2026-08-16T00:37:04.888080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T00:37:04.891909Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.arXiv preprint arXiv:2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.891909Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:a7b2f2b15328ccd08336d9c939c690eea727c3290c6b074ffd7ec79179a99654","observation_id":"cf54ab6f-ceb9-43f5-8639-0c71bc5ee143","resolution":{"observed_at":"2026-08-16T00:37:04.891909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-16T00:37:04.896325Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.896325Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:48229e0d65205cb95095723b3435937fd56530dc13526670cb86909bda69d945","observation_id":"4f0f3479-6dfa-4191-9acf-269cb5071608","resolution":{"observed_at":"2026-08-16T00:37:04.896325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-16T00:37:04.900278Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.900278Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:dda513cc6a4c5d263ebd60d65568dee85578799fc45f7b9d71520d02d820c9da","observation_id":"dff943c9-eaae-4729-be9c-2d189e7ef9cc","resolution":{"observed_at":"2026-08-16T00:37:04.900278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-16T00:37:04.903997Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.903997Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:d808923d77d33cd145bad20c9c014d4b9838bc924f9051f46d2c19f2aad65c0f","observation_id":"47121a70-ff15-4021-a5c8-1efac8aa7538","resolution":{"observed_at":"2026-08-16T00:37:04.903997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.907580Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.907580Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:a02b052f76eeb51bb15b96967dabacef543c61ea80817c75154727e0b9235c8c","observation_id":"cde3c9fd-c867-4eae-8885-5230e107130d","resolution":{"observed_at":"2026-08-16T00:37:04.907580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-18T07:30:25.553997Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-16T00:37:04.911143Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.911143Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:2bbef63232e3bd647e367d819a7b20bdf444157602d63a32449f9aef55e9930b","observation_id":"ee9a78e7-0c36-4084-b44b-9198b2f3fd84","resolution":{"observed_at":"2026-08-16T00:37:04.911143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-16T00:37:04.915043Z","title":"Conformer: Convolution-augmented transformer for speech recognition.arXiv preprint arXiv:2005.08100, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.915043Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c9ca224822aff4beb5042a93896a327509c1b67bdc4eb61447b1dce275aafb4f","observation_id":"848bc857-ef5c-43a4-a6b0-e6b640ba068f","resolution":{"observed_at":"2026-08-16T00:37:04.915043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-16T13:21:11.032842Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-16T00:37:04.919126Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.arXiv preprint arXiv:2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.919126Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:bb493fae2678132be788b8eb84f20a2740d883fb98aec7e2b3056829e814ba02","observation_id":"d68c1bcb-43ad-440c-b9ef-a1e1f4946ff5","resolution":{"observed_at":"2026-08-16T00:37:04.919126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.923020Z","title":"Didispeech: A large scale mandarin speech corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.923020Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c53f0684efffbc0219700c604e9c4d6a81dc37606755ce0731c679750a7818b8","observation_id":"f76cc8bc-1f3a-4b96-927c-a71265d63cf7","resolution":{"observed_at":"2026-08-16T00:37:04.923020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.926907Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.926907Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:8129f796f639baae9dc26aeae55e022efe0a57cc1131f0e028f46e6738066569","observation_id":"2f2cd431-891c-4a07-ad23-0bb3de3965c2","resolution":{"observed_at":"2026-08-16T00:37:04.926907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.544375Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM transactions on audio, speech, and language processing, 29:3451–3460, 2021","venue":null,"work_id":"46340563-38f6-4f01-b3af-83e67bb44a41","year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.931008Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:3dcb896cd7777e74ac9677eaf2abdc60063f51e70006d941b44c879bb4b942fb","observation_id":"faf71c01-bf65-4aa7-b665-7701c3e67bc2","resolution":{"observed_at":"2026-08-16T00:37:05.549427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.935124Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation.arXiv preprint arXiv:2502.03930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.935124Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:624b03183f9b8c89a3cd64a8e730f3f9b56deb8f0524897755687556e06d255c","observation_id":"3657d78c-4938-47de-9af2-cfa2f82cc64d","resolution":{"observed_at":"2026-08-16T00:37:04.935124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-16T12:55:06.202467Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-16T00:37:04.938708Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis.arXiv preprint arXiv:2502.18924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.938708Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c7ed5d05850900b12facde7bb69b331423336cbe29e4aecf4651a205237d2be0","observation_id":"38fea359-7336-4eca-8aec-8ec2fa84dc1d","resolution":{"observed_at":"2026-08-16T00:37:04.938708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.530170Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and context","venue":null,"work_id":"3315885c-2ce7-4b06-8c41-6a6d149dcf4c","year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.942649Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:0f861287d9379f576d879712314057ad6af99e77d9f5f9c3ae19a32df1a889e1","observation_id":"7eb41eb7-2020-4432-89de-a3686b7633d0","resolution":{"observed_at":"2026-08-16T00:37:05.534863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.515159Z","title":"High- fidelity audio compression with improved rvqgan.Advances in Neural Information Processing Systems, 36:27980–27993, 2023","venue":null,"work_id":"2bc47383-ec99-4711-aa83-c1cae9c9b12d","year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.946072Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c6ea9fe83df15aad405563480fe0f03856cedf4f305f3e5e83e85c58ca535f52","observation_id":"201224c3-6514-4c19-a9a5-45de04100265","resolution":{"observed_at":"2026-08-16T00:37:05.521990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-08-17T23:22:26.979510Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-08-16T00:37:04.949485Z","title":"Ditto-tts: Diffusion transformers for scalable text-to-speech without domain-specific factors.arXiv preprint arXiv:2406.11427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.949485Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:675279c97776b300e0a292bfeeb0c928da827636595f080e361a3003d8e109b5","observation_id":"0f71aab3-e39d-4989-b3f4-31a948676316","resolution":{"observed_at":"2026-08-16T00:37:04.949485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-13T06:34:37.505459Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-16T00:37:04.953206Z","title":"Zero-shot voice conversion with diffusion transformers.arXiv preprint arXiv:2411.09943, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.953206Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:3247043cd72817a50bef3a400fa346e5aa3bbc59762950501aeacbacb18e4c24","observation_id":"6e64899a-7835-46d9-bb90-30dbda7a87e4","resolution":{"observed_at":"2026-08-16T00:37:04.953206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-08-16T13:44:53.534590Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-16T00:37:04.957117Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis.arXiv preprint arXiv:2406.05551, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.957117Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:e91b5eb29988890754ab7ebb55977031f17aa09317c15f10c0dd761807851b54","observation_id":"4b115cb4-af6c-4869-9f42-bc6710c32c45","resolution":{"observed_at":"2026-08-16T00:37:04.957117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-08-16T13:44:47.492627Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-16T00:37:04.960658Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model benchmark.arXiv preprint arXiv:2406.05763, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.960658Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:689ed10ac166acba19e32a44add9b0091e247d783c091db109d430718cb96d22","observation_id":"ea442264-10cd-41a2-98d6-e8cf3df62d6f","resolution":{"observed_at":"2026-08-16T00:37:04.960658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.964166Z","title":"Librispeech-pc: Benchmark for evaluation of punctuation and capitaliza- tion capabilities of end-to-end asr models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.964166Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:51912b2223c5151b3cac2f871251abcb58d800239c827eff3a208d3bf406587c","observation_id":"c0a8bac5-196d-4068-8128-52d64fa6ed3c","resolution":{"observed_at":"2026-08-16T00:37:04.964166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.967650Z","title":"Autoregressive speech synthesis without vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.967650Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:8286b43a97ebb2e152d054174494104b98cdca2ab10139d43c6ed4fe7df2b558","observation_id":"90ac5d2e-5115-4339-aa2e-12d74942f7f7","resolution":{"observed_at":"2026-08-16T00:37:04.967650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.971209Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.971209Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:f6e685b5da92455acfbf433a0c95e4b34a4d9c7e76bbfa75099477240abd6273","observation_id":"3caaa9a8-a762-44b4-abb2-2e4f28dba4d6","resolution":{"observed_at":"2026-08-16T00:37:04.971209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.975118Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.975118Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:fd0cf8354bd807903e89525a52a6e4f64f5159cac800f659db3184a8757c28b9","observation_id":"a9d67925-d54f-4a3d-99e7-02fc5d60a9ff","resolution":{"observed_at":"2026-08-16T00:37:04.975118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.978650Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.978650Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:75c8afc1cc26cc0ef444586cd752caaa4f9b7290e399006d1f33acae09537e85","observation_id":"dbfe518d-49fe-447c-aead-9e343fd9bef5","resolution":{"observed_at":"2026-08-16T00:37:04.978650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-16T15:27:27.142221Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-16T00:37:04.982405Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.arXiv preprint arXiv:2306.00814, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.982405Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:203c7035f18071f6aa9ad31069cd941c4581f2b9829d841323260b09981d0616","observation_id":"bef0a40f-7795-4b00-ac2a-a536a6ff8af7","resolution":{"observed_at":"2026-08-16T00:37:04.982405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-13T16:11:28.134657Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-16T00:37:04.986772Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.986772Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:5f6aa3f032206e8befc5f274b04865586af1f1253b2bc9ddb3019c1991fbe7d3","observation_id":"a1c13e3b-44d7-4ed7-934c-2568ce3b2d8d","resolution":{"observed_at":"2026-08-16T00:37:04.986772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T00:37:04.990844Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.arXiv preprint arXiv:2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.990844Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:d428eeca7e1b01617d4e5e0427308ec7100db3ce2074f42a761c4d143aa00085","observation_id":"ae40bb28-6d73-43a9-a72c-fa9cccee1085","resolution":{"observed_at":"2026-08-16T00:37:04.990844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-16T20:32:23.736592Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-16T00:37:04.994189Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec.arXiv preprint arXiv:2409.05377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.994189Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:06bbe947555f8d5c8a20b3c3635a0953892fc4b541f93d0366df7510e61b886c","observation_id":"81311671-a9d0-4270-9e88-5af927fd25c1","resolution":{"observed_at":"2026-08-16T00:37:04.994189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-16T00:37:04.998310Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models.arXiv preprint arXiv:2308.16692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.998310Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:7306049245894c0b09412ef924db17d407784ac6156a208f50489dbc39b856d3","observation_id":"c8019c36-794d-4b8e-9aed-58afb3dd4281","resolution":{"observed_at":"2026-08-16T00:37:04.998310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-08-13T00:49:16.394376Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12456","snapshot_observed_at":"2026-08-16T00:37:05.002453Z","title":"X-vc: Zero-shot streaming voice conversion in codec space","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.002453Z"},"links":{"cited_paper":"/paper/2604.12456","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:72d43fb309b64e2948555f2a827fb1f2f58b5e569df7756f758f18bcd445fe21","observation_id":"3e209853-2f7b-4c21-9c50-9e32064c4973","resolution":{"observed_at":"2026-08-16T00:37:05.002453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.007627Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.007627Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:29f9802a7b97dbb5c32c495bf89a76e0faac9bfa15c1e8d880202353f69cb3c4","observation_id":"17a4ed74-2ab2-4784-b52c-030b5cb0a95a","resolution":{"observed_at":"2026-08-16T00:37:05.007627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.011278Z","title":"V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning.arXiv preprint arXiv:2509.24650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.011278Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:244889e17870fc5d0b5fdcc251daa5cf4f134960c6e41f1d0d2e17fd366160c0","observation_id":"e29db32b-1c62-41d3-8dc8-db4e941dadf6","resolution":{"observed_at":"2026-08-16T00:37:05.011278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T06:19:04.637756Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.11737."}