{"as_of":"2026-08-08T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0267526ae5f2a1d2464b0f711b8e5dfeead0e0afcfccfff0fc4afb8bb692b5cf","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:19:58.490777Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T23:22:40.218077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19462","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"V oices- tar: Robust zero-shot autoregressive tts with duration con- trol and extrapolation.arXiv preprint arXiv:2505.19462,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-01T23:32:05.105330Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2505.19462","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:82b8dbcd5f8cbab881181850ca8ba519767c10bbe5889ed7f5e17963de177133","observation_id":"4a70ccd9-9a71-43f5-a190-b1e16e566dd0","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19462/citation-record","integrity":"/paper/2505.19462/integrity","json":"/paper/2505.19462/citation-record.json","paper":"/paper/2505.19462"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:49.841291Z","title":"Soundstream: An end-to-end neural audio codec.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:495–507, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:49.841291Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:d01e6825ddd202be482c0e27fb9a19fb5d8b934be9e6b142aca8a7de8ef51261","observation_id":"1d9a321e-26ae-4b4f-8f8e-d74b54358d5a","resolution":{"observed_at":"2026-08-07T14:19:49.841291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T14:19:49.901237Z","title":"High fidelity neural audio compression.ArXiv, abs/2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:49.901237Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:fa7edf783563df222a0470450c328a29eb90af0ebe5a9fe1bcbfdf035626e364","observation_id":"70b9dbd1-e4e9-4bdf-a20d-6b0e93c64b32","resolution":{"observed_at":"2026-08-07T14:19:49.901237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T14:19:50.066833Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching.ArXiv, abs/2410.06885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.066833Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:33e3b986022c52cfae1ef5c6c461c2325b91ff8d0ef716119c9a8f991ef39079","observation_id":"2460dc9a-5101-4a73-b0ba-b16d0f199337","resolution":{"observed_at":"2026-08-07T14:19:50.066833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:50.173827Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.173827Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:eb74322fa573aefffcad0abc5a693863f9219fcc06df49a099d37e1b569855a9","observation_id":"c05b4db4-dc42-462e-93ba-1d2c9cada271","resolution":{"observed_at":"2026-08-07T14:19:50.173827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:19:50.254673Z","title":"Neural codec language models are zero-shot text to speech synthesizers.ArXiv, abs/2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.254673Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:249c7dffae196870cf123fe17ab7a4bff4df4ae893b8471c7f769511034848ab","observation_id":"413b2487-d923-4f77-921b-443342a17858","resolution":{"observed_at":"2026-08-07T14:19:50.254673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:05.251968Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers, 2024","venue":null,"work_id":"0a46a08f-6b19-4684-b1e6-472669e31811","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.374743Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:67ddd2a39077cbbf78cb302fe2e0c8e1b28220c7562657aeb9c3182fde93f71f","observation_id":"e854fbbc-f772-4500-8022-aa9bc2b23ef7","resolution":{"observed_at":"2026-08-07T14:20:05.424679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:04.831068Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":"cb0eb0a6-551b-4229-bc29-eea2ecb2bad9","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.481272Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:a93b3739a40eb5afd69ee61dd60e0903bc8de3dfa37fc751c8b451b18758423a","observation_id":"9918ab20-a36c-4e57-8ef1-e28ca562c615","resolution":{"observed_at":"2026-08-07T14:20:05.056341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:04.486853Z","title":"On generative spoken language modeling from raw audio.Transactions of the Association for Computational Linguistics, 9:1336–1354, 2021","venue":null,"work_id":"90623ad3-737d-417a-9253-57345019e580","year":2021},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.603358Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:e7dd5c85582b31c249741b60ac2e747ec14761e4ee10cfbe6c2e1ea474c7d02a","observation_id":"6404e8c6-308b-48ab-b2ff-92543293ef9a","resolution":{"observed_at":"2026-08-07T14:20:04.656485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:04.115428Z","title":"Audiolm: A language modeling approach to audio generation.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 31:2523–2533, 2022","venue":null,"work_id":"166ac955-ac20-4427-9fb6-e0dcac53c7fa","year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.727860Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:054bd5b9f895ff2527fefb0443787a9310fe35866b506fd2defc3688d6480024","observation_id":"09cc527d-f973-43eb-9ce5-a5c6bd7309e5","resolution":{"observed_at":"2026-08-07T14:20:04.287314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T14:19:50.833721Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.833721Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ff5885e03650e9eb66e5468ca96273ca99c269584bc2024ce1869c2983972891","observation_id":"ebbb6bb1-5a6c-4a0b-8b3c-05f49645f4d4","resolution":{"observed_at":"2026-08-07T14:19:50.833721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.813346Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal supervision.Transactions of the Association for Computational Linguistics, 11:1703–1718, 2023","venue":null,"work_id":"d70329de-389a-421e-9ba6-5fda7e7f564f","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.893333Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:3347a44f3459ab1b6931a71dc363b8af4d1df0903844cc6f684df2277f1c9dbc","observation_id":"986297ee-6df1-432f-954f-d02096739bf5","resolution":{"observed_at":"2026-08-07T14:20:03.955411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-07T14:19:50.973655Z","title":"Soundstorm: Efficient parallel audio generation.ArXiv, abs/2305.09636, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.973655Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:8812b50c061f4e196adc099535b2436cf6738992fba319a374cad8b9f46e76ec","observation_id":"bb56d6d4-287a-4e76-8944-dd5c35448e75","resolution":{"observed_at":"2026-08-07T14:19:50.973655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-07T14:19:51.036153Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale.ArXiv, abs/2306.15687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.036153Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:3dd28cc93b90fe7fa1135064d1ea91189b1029aaab96b93ae307c6b0749bb71a","observation_id":"c44eb73f-b23e-479f-822f-8d99bf5d7fe1","resolution":{"observed_at":"2026-08-07T14:19:51.036153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T14:19:51.135367Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.ArXiv, abs/2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.135367Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:8855b4403a0de9443afe83a29ff8989c3820da6e8870a6d49bcdefa8b78c9ac8","observation_id":"03333264-800a-4980-89ee-16fd2c942e25","resolution":{"observed_at":"2026-08-07T14:19:51.135367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22179","last_updated":"2025-03-11T19:21:57Z","snapshot_observed_at":"2026-07-06T19:41:37.282089Z","submitted_at":"2024-10-29T16:17:01Z","title":"Robust and Unbounded Length Generalization in Autoregressive Transformer-Based Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2410.22179","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22179","snapshot_observed_at":"2026-08-07T14:19:58.942363Z","title":"Robust and Unbounded Length Generalization in Autoregressive Transformer-Based Text-to-Speech","venue":"cs.CL","work_id":"155f87d3-d086-4ab1-9adb-6d427e75af54","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.283267Z"},"links":{"cited_paper":"/paper/2410.22179","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:9742277590fc39d45b5ae051cbcb8d71cc1bf46fdd9099a828cd4ff0ab123cd8","observation_id":"3a1a758a-6b3e-4758-a03d-e2c1796f49f5","resolution":{"observed_at":"2026-08-07T14:19:58.963053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T14:19:51.454188Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.ArXiv, abs/2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.454188Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:363b90336f673fed2e8bbf15c9d3d5186a0a41b3330d6b44a9d021905b01e62b","observation_id":"27763106-efe7-4f7b-834b-59b89b87e191","resolution":{"observed_at":"2026-08-07T14:19:51.454188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T14:19:51.609437Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.ArXiv, abs/2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.609437Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:6cfa5edafae12ad6abaadb421995c562fbcdd18f41a08435dd3a1f0918c194cb","observation_id":"9382fd7f-03e0-478b-9daa-2c1b9d74e65d","resolution":{"observed_at":"2026-08-07T14:19:51.609437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.513999Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":"2572e2a0-8f41-42a6-8210-9ac5b9624125","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.705529Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:4f20247ab1882875b2b856b901741ce42dd84b324a4a2fab3ebe9fa4136ce808","observation_id":"3b032d13-40de-4694-b4d7-3fd94ebbce1d","resolution":{"observed_at":"2026-08-07T14:20:03.667748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.297350Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering","venue":null,"work_id":"0e7cc485-0fa6-4f2e-9fef-e6e4e999b302","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.826778Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b2a57e00e318d5964e3cf04253e4433a3615ffc9d5633e5f3f276da5a1c88eb9","observation_id":"b84f76b2-5175-4208-9515-21c1bc861091","resolution":{"observed_at":"2026-08-07T14:20:03.396435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T14:19:51.952647Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment.ArXiv, abs/2406.07855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.952647Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:17d34bfabd67f0694467872e9dc6f4f3a795418687453669c73be59645cfc976","observation_id":"c099402e-4fee-4705-b271-6f0c51e6f718","resolution":{"observed_at":"2026-08-07T14:19:51.952647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.067499Z","title":"Vall-t: Decoder-only generative transducer for robust and decoding- controllable text-to-speech","venue":null,"work_id":"a631bfef-e735-49e4-8545-200862e6cbf3","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.092794Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:76a62a489c7cac9be50a145320f343127e0e65a9768936972f738f3308862b89","observation_id":"474ee284-a658-4782-b777-5fa639db753e","resolution":{"observed_at":"2026-08-07T14:20:03.193256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.884306Z","title":"Attention- constrained inference for robust decoder-only text-to-speech.2024 IEEE Spoken Language Technology Workshop (SLT), pages 630–637, 2024","venue":null,"work_id":"ecef1740-563e-40e7-9b95-5f426bd464d2","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.174655Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5fc450074655359345f2d18428bce82b27619b4aabef2f94dadad70e15bd3d03","observation_id":"669cdead-4f97-4776-88a7-4186167f048e","resolution":{"observed_at":"2026-08-07T14:20:02.969811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17957","last_updated":"2024-06-25T22:18:52Z","snapshot_observed_at":"2026-08-01T09:49:00.239459Z","submitted_at":"2024-06-25T22:18:52Z","title":"Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17957","snapshot_observed_at":"2026-08-07T14:19:52.306333Z","title":"Improving robustness of llm-based speech synthesis by learning monotonic alignment.ArXiv, abs/2406.17957, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.306333Z"},"links":{"cited_paper":"/paper/2406.17957","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:42bfae59b4ef8fdc6913a9fc5cdbb4118b331f0650b64ae3f4036a6c73249ce2","observation_id":"60758394-101e-43fd-8c43-d555c12e201d","resolution":{"observed_at":"2026-08-07T14:19:52.306333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11630","last_updated":"2024-09-18T01:31:19Z","snapshot_observed_at":"2026-07-06T19:17:19.354772Z","submitted_at":"2024-09-18T01:31:19Z","title":"Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11630","snapshot_observed_at":"2026-08-07T14:19:52.424117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.424117Z"},"links":{"cited_paper":"/paper/2409.11630","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:719363ce4a52f6cc406b5a8ef02bbcf188c98c06645716c3a2a7c9d2d8e86aea","observation_id":"85484e04-365d-408c-a020-e216707c56b9","resolution":{"observed_at":"2026-08-07T14:19:52.424117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.743627Z","title":"Mega-TTS 2: Boosting prompting mechanisms for zero-shot speech synthesis","venue":null,"work_id":"9cb23cc8-2e86-401a-ac8c-473d74468679","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.548815Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:2a8e7f7235ca528643eedf5a2169048118ab51c2b9c55cb77f81fd225b6c713c","observation_id":"32e5db4f-f25a-4307-9d78-607b7fadd358","resolution":{"observed_at":"2026-08-07T14:20:02.826188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07556","last_updated":"2025-01-02T03:07:29Z","snapshot_observed_at":"2026-08-07T22:51:00.030892Z","submitted_at":"2024-09-11T18:24:07Z","title":"SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07556","snapshot_observed_at":"2026-08-07T14:19:52.702338Z","title":"Ssr-speech: Towards stable, safe and robust zero-shot text-based speech editing and synthesis.ArXiv, abs/2409.07556, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.702338Z"},"links":{"cited_paper":"/paper/2409.07556","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:884e75f074e9aafa72dd2e888d6f3f5b5f94761156ad85704cd3cb4bb5fef9ec","observation_id":"ed023195-40ab-4345-b43f-4eda5a5f4a1a","resolution":{"observed_at":"2026-08-07T14:19:52.702338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03204","last_updated":"2024-05-19T21:34:28Z","snapshot_observed_at":"2026-07-06T17:55:28.812944Z","submitted_at":"2024-04-04T05:15:07Z","title":"RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03204","snapshot_observed_at":"2026-08-07T14:19:52.899498Z","title":"Rall-e: Robust codec language modeling with chain-of-thought prompting for text-to-speech synthesis.ArXiv, abs/2404.03204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.899498Z"},"links":{"cited_paper":"/paper/2404.03204","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:1b3a1cf2dc566875429de6c344fe0ecebad0eab6042045c8ca0d1556d1c1c290","observation_id":"873d0146-bc69-4a97-8ac2-5e2a681475df","resolution":{"observed_at":"2026-08-07T14:19:52.899498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-07T14:19:53.043874Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback.ArXiv, abs/2406.00654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.043874Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:9b2d86a03bdfc2ec10b071b50b2af1489c2f690272ae84205a8f5da805c2212e","observation_id":"35f44ca9-e9d1-47d2-974d-62fe1ca1d699","resolution":{"observed_at":"2026-08-07T14:19:53.043874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02243","last_updated":"2024-07-02T13:04:04Z","snapshot_observed_at":"2026-08-07T02:35:48.901547Z","submitted_at":"2024-07-02T13:04:04Z","title":"Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02243","snapshot_observed_at":"2026-08-07T14:19:53.169474Z","title":"Robust zero-shot text-to-speech synthesis with reverse inference optimization.ArXiv, abs/2407.02243, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.169474Z"},"links":{"cited_paper":"/paper/2407.02243","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f2faaa1801ccb82ee38323477cf9ab391344ee0fd0099ab3222d31bb5834a5a1","observation_id":"4ff82b7b-3459-4cce-a038-ca8c65736997","resolution":{"observed_at":"2026-08-07T14:19:53.169474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.551919Z","title":"Desta, Roy Fejgin, Rafael Valle, and Jason Li","venue":null,"work_id":"cc048dd0-a6b0-4a9c-8e68-0b9ce2f9ad3c","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.311490Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:bbb0d09a9362f1093b0abbb30591b0befcf9f7404f56080e8e9a20697d94aa25","observation_id":"cb710981-e29d-40bd-8c39-1305b93c9d47","resolution":{"observed_at":"2026-08-07T14:20:02.632742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T14:19:53.462342Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling.ArXiv, abs/2303.03926, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.462342Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:3b9d2cd6e68a3420c573ceb47798dfc84e9cdf76efc08f95ee97f718d4f70ad3","observation_id":"7e1872e8-7f8e-468d-bf75-a5acd1a15bc1","resolution":{"observed_at":"2026-08-07T14:19:53.462342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00976","last_updated":"2024-11-01T13:54:48Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:16:30Z","title":"Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00976","snapshot_observed_at":"2026-08-07T14:19:53.626191Z","title":"Generative pre-trained speech language model with efficient hierarchical transformer.ArXiv, abs/2406.00976, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.626191Z"},"links":{"cited_paper":"/paper/2406.00976","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:45fef3ce50f28f60305079ebebfcdd943250f19685b1ab460b8ec4f515416892","observation_id":"012daf19-969a-4d96-a9d1-43fba4969a32","resolution":{"observed_at":"2026-08-07T14:19:53.626191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T14:19:53.771128Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation.ArXiv, abs/2305.16107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.771128Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5371c6233e7d74d7467e334c65f1be1b787307388a66616068230e4d0d6a481e","observation_id":"dc3048c9-080b-4860-b527-1fcdc0f87fc5","resolution":{"observed_at":"2026-08-07T14:19:53.771128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-07T14:19:53.892566Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt.ArXiv, abs/2310.04673, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.892566Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c9ce35ea9cf9ad6321ce3cd2196c25342b7ecd4927b8a694663dc0e5ed3d8805","observation_id":"6279db10-5903-4d71-adf5-822e051483e3","resolution":{"observed_at":"2026-08-07T14:19:53.892566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.357673Z","title":null,"venue":null,"work_id":"2af20b57-4209-49ca-a605-f5f9ea4acbf0","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.016530Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:232c4ee7598dab5d4f6b0b6fe4903e450d62c547a071096fef11c62758329de8","observation_id":"f41a6ef4-5484-4196-b1e3-a003a49b9111","resolution":{"observed_at":"2026-08-07T14:20:02.462834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18045","last_updated":"2024-01-31T18:06:29Z","snapshot_observed_at":"2026-08-02T21:52:26.531178Z","submitted_at":"2024-01-31T18:06:29Z","title":"SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18045","snapshot_observed_at":"2026-08-07T14:19:54.204415Z","title":"Speechcomposer: Unifying multiple speech tasks with prompt composition.ArXiv, abs/2401.18045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.204415Z"},"links":{"cited_paper":"/paper/2401.18045","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:049a19ab8e74e8f3bc1f4045355e7a65153d0808ba55ca625cd1f6f147c847a9","observation_id":"d7ab772c-e025-41bb-a22a-24ce39553164","resolution":{"observed_at":"2026-08-07T14:19:54.204415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.164299Z","title":"Metis: A foundation speech generation model with masked generative pre-training","venue":null,"work_id":"140eb000-83a2-4f81-b77e-231c7d0d89fc","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.327352Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:41e72348e946038baab51c54c45d1397e34c264ba732cf639466db73720dd2db","observation_id":"84f6cce3-b598-495d-8db5-7f4ce98de632","resolution":{"observed_at":"2026-08-07T14:20:02.247472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.973137Z","title":"Prompttts: Controllable text-to-speech with text descriptions.ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5, 2022","venue":null,"work_id":"f58a2bdf-65a1-4f2b-bbe0-732823984e92","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.422588Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:d1239a7bfa1e839da301037d86b5cd7b309baf196fa74691f26842f1172da078","observation_id":"556d9d7d-cac4-4f08-b791-226968ee62bb","resolution":{"observed_at":"2026-08-07T14:20:02.047892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13662","last_updated":"2023-06-25T11:42:52Z","snapshot_observed_at":"2026-08-07T22:40:53.704509Z","submitted_at":"2023-01-31T14:26:52Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13662","snapshot_observed_at":"2026-08-07T14:19:54.567317Z","title":"Meng, and Dong Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.567317Z"},"links":{"cited_paper":"/paper/2301.13662","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:73e3953306c4109cb7bd7f8ffced2be009cb95dedcae2b1e27ca453d98cb3b4d","observation_id":"fc53d6c9-e5c1-4e46-8f80-0122508deb35","resolution":{"observed_at":"2026-08-07T14:19:54.567317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19522","last_updated":"2023-06-01T09:30:41Z","snapshot_observed_at":"2026-07-06T15:35:45.200564Z","submitted_at":"2023-05-31T03:16:59Z","title":"PromptStyle: Controllable Style Transfer for Text-to-Speech with Natural Language Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19522","snapshot_observed_at":"2026-08-07T14:19:54.715981Z","title":"Promptstyle: Controllable style transfer for text-to-speech with natural language descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.715981Z"},"links":{"cited_paper":"/paper/2305.19522","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:81874d509baed9817c364369600eefd934fa615f12e6b87926716b02fbf2959e","observation_id":"2ceec292-ba82-4ff9-8de3-dfdc53dd723a","resolution":{"observed_at":"2026-08-07T14:19:54.715981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14430","last_updated":"2023-08-28T09:06:32Z","snapshot_observed_at":"2026-07-06T16:11:10.831438Z","submitted_at":"2023-08-28T09:06:32Z","title":"TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models","version":1},"cited_work":{"arxiv_id":"2308.14430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14430","snapshot_observed_at":"2026-08-07T14:19:58.700116Z","title":"TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models","venue":"eess.AS","work_id":"ab5cdcee-d4b9-4c62-b6e7-41796539921d","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.931851Z"},"links":{"cited_paper":"/paper/2308.14430","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:e32e7a69b366fec5dabe29ff64e7f7dab15074ffff30fa38545dae4fc9576d72","observation_id":"a3ac4ea4-86e6-4c5e-976e-593653ca213a","resolution":{"observed_at":"2026-08-07T14:19:58.766245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-07T14:19:55.063985Z","title":"Prompttts 2: Describing and generating voices with text prompt.ArXiv, abs/2309.02285, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.063985Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:aae7688d9a48f95ca1745dba35941278de02eb2dfca1fcbc98aeda468f3fdf45","observation_id":"1a8ba9e7-f22b-493f-b6e8-46229dd6c244","resolution":{"observed_at":"2026-08-07T14:19:55.063985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-08T00:23:43.789368Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T14:19:55.191205Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.ArXiv, abs/2402.01912, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.191205Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:35ce6d410b24cd14118546384c91da2bba7442c6d0ffd767d53b1d55353ebf15","observation_id":"a0230389-f536-413d-b453-4a4d8395e27d","resolution":{"observed_at":"2026-08-07T14:19:55.191205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.772237Z","title":"Scaling rich style-prompted text-to-speech datasets","venue":null,"work_id":"7bccc693-5797-421b-b2b5-3a787bb1b594","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.310667Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:de9597e4de736813e48919745a53b21b0c1dcb2dae31c0af576e2b1de9ef6c4a","observation_id":"44ff2b8f-9d24-4841-84b3-62414e426ed8","resolution":{"observed_at":"2026-08-07T14:20:01.854731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:19:55.465301Z","title":"Moshi: a speech-text foundation model for real-time dialogue.ArXiv, abs/2410.00037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.465301Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:cbf94ad82e59205af48bf602213a92c5bfe3f73c708231ecec4616fbe16f92dc","observation_id":"61f0d21b-5e1d-40cf-91ef-18199528b189","resolution":{"observed_at":"2026-08-07T14:19:55.465301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02622","last_updated":"2024-08-05T16:47:22Z","snapshot_observed_at":"2026-08-06T01:09:51.135247Z","submitted_at":"2024-08-05T16:47:22Z","title":"Language Model Can Listen While Speaking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02622","snapshot_observed_at":"2026-08-07T14:19:55.581577Z","title":"Language model can listen while speaking.ArXiv, abs/2408.02622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.581577Z"},"links":{"cited_paper":"/paper/2408.02622","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:fcc85c16d8a39e9d2aaf6663dae11a7c86c199d4f393469b2590733da3d57533","observation_id":"91447976-ac9f-4a61-9ca5-c61009dce3b5","resolution":{"observed_at":"2026-08-07T14:19:55.581577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:19:55.644063Z","title":"Llama- omni: Seamless speech interaction with large language models.ArXiv, abs/2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.644063Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:7f1dc67d73cf87b84452867bf153a8d682c55217773b6721d36ce5d85363def2","observation_id":"9ca4f5b7-4a33-40d1-aa74-c22a6e2656c5","resolution":{"observed_at":"2026-08-07T14:19:55.644063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-07T14:19:55.723227Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation.ArXiv, abs/2411.18138, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.723227Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:9bc55f492645fc3d5c8e9375110aee6ca1f703f392c7e7a15d29e75c3e9b5f28","observation_id":"0c878640-8d68-4e7b-97c0-52e1752594f0","resolution":{"observed_at":"2026-08-07T14:19:55.723227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11727","last_updated":"2024-09-18T06:27:26Z","snapshot_observed_at":"2026-07-06T19:17:23.847280Z","submitted_at":"2024-09-18T06:27:26Z","title":"Enabling Real-Time Conversations with Minimal Training Costs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11727","snapshot_observed_at":"2026-08-07T14:19:55.833609Z","title":"Enabling real-time conversations with minimal training costs.ArXiv, abs/2409.11727, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.833609Z"},"links":{"cited_paper":"/paper/2409.11727","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:45e90b6ac638658b136bab237eb4077f51c6c97c8fdade7a3c138ea4f5e5ceea","observation_id":"832e6d0f-0bf6-40fd-bae9-48da9426e755","resolution":{"observed_at":"2026-08-07T14:19:55.833609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08035","last_updated":"2024-10-12T06:46:39Z","snapshot_observed_at":"2026-07-06T19:31:13.821669Z","submitted_at":"2024-10-09T05:04:31Z","title":"IntrinsicVoice: Empowering LLMs with Intrinsic Real-time Voice Interaction Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08035","snapshot_observed_at":"2026-08-07T14:19:55.952954Z","title":"Intrinsicvoice: Empowering llms with intrinsic real-time voice interaction abilities.ArXiv, abs/2410.08035, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.952954Z"},"links":{"cited_paper":"/paper/2410.08035","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c7b4a6996b7e94c920fb845adb37b82560b472deb4039eef99faa791092922f6","observation_id":"b1889e61-ab6e-4d2e-92cd-ac6d3819c761","resolution":{"observed_at":"2026-08-07T14:19:55.952954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.529188Z","title":"Llm-enhanced dialogue management for full-duplex spoken dialogue systems","venue":null,"work_id":"9db5ea79-e52b-4fa0-b783-6d203b51c9e8","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.035454Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:2aa37efc96f494de078579691940ce796f655ec13d9d4e35b2eba64b12839083","observation_id":"c1dad2e6-6205-48be-adc3-86345098b25a","resolution":{"observed_at":"2026-08-07T14:20:01.644408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T14:19:56.106020Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data.ArXiv, abs/2402.08093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.106020Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:deac6d9a9e2e3b7b3d5847703f89d6c1c71642e074a30f7f8649b490f0ec686c","observation_id":"5c38d1d3-bd8b-427f-bff7-00677543bc84","resolution":{"observed_at":"2026-08-07T14:19:56.106020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04380","last_updated":"2024-10-06T07:20:58Z","snapshot_observed_at":"2026-08-03T07:51:42.862937Z","submitted_at":"2024-10-06T07:20:58Z","title":"HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04380","snapshot_observed_at":"2026-08-07T14:19:56.181491Z","title":"Hall-e: Hierarchical neural codec language model for minute-long zero-shot text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.181491Z"},"links":{"cited_paper":"/paper/2410.04380","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f28eaf771235b0bf03103bfd2113ed7fb4b4ce599b24352fe1f2fcd096082523","observation_id":"992085bb-1e13-4e77-a897-c0c0e2e2511d","resolution":{"observed_at":"2026-08-07T14:19:56.181491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-07T14:19:56.312162Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers.ArXiv, abs/2304.09116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.312162Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5e9ee2f81358fd1f1bc911843295f73ceb90bda176bdb0d915441d4bd32e2f11","observation_id":"d5407115-8935-4156-98a6-2901d3393e33","resolution":{"observed_at":"2026-08-07T14:19:56.312162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.330701Z","title":"Shih, Rohan Badlani, João Felipe Santos, Evelina Bakhturina, Mikyas T","venue":null,"work_id":"2263d160-541d-46b5-9754-6d0f97b812dc","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.381071Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b4d452ed9788a3ed07002a803f1ecbf955102659c68cf2bedfeb5e25a4a26fc4","observation_id":"556b0628-1098-4b0f-8d76-a2ba4395e922","resolution":{"observed_at":"2026-08-07T14:20:01.415277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.093694Z","title":"Ditto-tts: Diffusion transformers for scalable text-to-speech without domain-specific factors","venue":null,"work_id":"a228a3a6-87b9-4f0a-a2c0-89bf8967f6d5","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.451386Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:2020997689bb53d94ac683c6f03c23eeef430106ba67f7a7899407c27c2f082e","observation_id":"37fd8c4d-8a2b-4ab1-87ab-b21dca27f849","resolution":{"observed_at":"2026-08-07T14:20:01.204599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:56.583065Z","title":"Peebles and Saining Xie","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.583065Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5c3cb12593682581bfd84f4a569065f2de0ef830ef879749714149894f8d7b25","observation_id":"433d7614-33db-4942-975d-0ae475faa212","resolution":{"observed_at":"2026-08-07T14:19:56.583065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.886267Z","title":"Dmospeech: Direct metric optimization via distilled diffusion model in zero-shot speech synthesis","venue":null,"work_id":"0a5d5c64-15bd-4d8a-8fd1-ca2c8d0cfee6","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.683947Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:96fc11669052fd734493c50319e944d83e2d8972a78f1d7018a934125b28a5c1","observation_id":"22457582-96a8-4eea-9a32-f5ecc442de3a","resolution":{"observed_at":"2026-08-07T14:20:00.990413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.751681Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts.2024 IEEE Spoken Language Technology Workshop (SLT), pages 682–689, 2024","venue":null,"work_id":"2b607d79-f211-4c19-9544-e0e89f41050d","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.779894Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:aa836694b7f49c185cae7595e1192aefa43367e04e11efd5e7f8fc08f821a839","observation_id":"1e2b3cef-62ad-48af-b47a-1ddb4dcb323e","resolution":{"observed_at":"2026-08-07T14:20:00.801253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:19:56.842801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.842801Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:6489ac8533127c4e6dc5fdab19bdac4bcbce516c5d01b70e4e1c8a6a3ce37cb2","observation_id":"a77996d5-2d3b-4528-9b14-7bd57feddcde","resolution":{"observed_at":"2026-08-07T14:19:56.842801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T14:19:56.932091Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.ArXiv, abs/2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.932091Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:76fe5cb9a44bbaf712aee45d73747edaa5f3a64973de98dc55ed6f36459dfc9c","observation_id":"235bff6a-1867-49b6-87de-bd2096abb91f","resolution":{"observed_at":"2026-08-07T14:19:56.932091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-07T07:25:59.961338Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-07T14:19:57.022040Z","title":"Simple and controllable music generation.ArXiv, abs/2306.05284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.022040Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:22dbedb6bb28939c22d722cbf8b26270e96981b4262de1b1b75dac0a454ea453","observation_id":"62d1ea48-ddeb-422a-afc6-9cd1cf666d36","resolution":{"observed_at":"2026-08-07T14:19:57.022040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.089308Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.089308Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:04ea61b408fdbb8addb9ea75b1f3f24919e5cf30befecbd835bee86fa0081db9","observation_id":"b5d23f41-e7c4-4aef-9075-65944122b465","resolution":{"observed_at":"2026-08-07T14:19:57.089308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.629400Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":"acb7f1cc-de90-4a64-b6dd-6f56978e5454","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.181904Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:59adcc626d4b3fb7b2385d8dea2118a894d0901163c8702f3fc4be771d6ceaa3","observation_id":"d3c1883d-8489-4d10-998e-13991ac28e25","resolution":{"observed_at":"2026-08-07T14:20:00.668512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.278975Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.278975Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:742e996fb90c6a62b4c8e0254317e0c3a59692d98f0ab0db85a1900fdb4b8e6f","observation_id":"deee603a-0ce1-4795-8030-32fc1e0db0d1","resolution":{"observed_at":"2026-08-07T14:19:57.278975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.355945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.355945Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ebdb63825c843706bf1224e4e945036ce7b608d991e8cbaef4a8df66ff90d553","observation_id":"0df4e2a8-decb-4308-9f13-f80961a67480","resolution":{"observed_at":"2026-08-07T14:19:57.355945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.434211Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.434211Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:920d856913356b956f649022710cb15483e9851f2b11b363d098820840bfc7f4","observation_id":"a4750667-7041-41f0-84fe-797038ed46c6","resolution":{"observed_at":"2026-08-07T14:19:57.434211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.490614Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation.2024 IEEE Spoken Language Technology Workshop (SLT), pages 885–890, 2024","venue":null,"work_id":"8cc89baf-7ae6-46e5-a40e-1307c34f550c","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.537109Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b001950620f9ebcb46ce29f0cf02fb0381fae807b20f396be582fc7c905756b8","observation_id":"032496ba-6547-4544-80ef-b8c1d4fbca3b","resolution":{"observed_at":"2026-08-07T14:20:00.546516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.317030Z","title":null,"venue":null,"work_id":"5a588d3c-ea84-4ce8-9458-0a5ad7ebda25","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.594796Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:89ae3ae20035f506a0b18beb629c6d4014002576affc2cb30f76d54b7e31bd7a","observation_id":"99fa98a6-c588-438f-b2d3-69705bb847a2","resolution":{"observed_at":"2026-08-07T14:20:00.387300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.130048Z","title":"eSpeak NG: Speech synthesiser.https://github.com/espeak-ng/espeak-ng","venue":null,"work_id":"2612c95d-fd45-46d5-83d3-0bf9debcf790","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.695586Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ec5b77aca573a518ed44f9d73596a517d2d3eea9d8e29375949f86b1bc1381e8","observation_id":"0b8773f0-7299-4522-ab03-186b7534942e","resolution":{"observed_at":"2026-08-07T14:20:00.232493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:19:57.780080Z","title":"Seed-tts: A family of high-quality versatile speech generation models.ArXiv, abs/2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.780080Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b979749bae24b029ac473625a211462cb873f72a90aa9a522445e64d1916d0bc","observation_id":"8d541a03-a710-477c-a4db-f2ce42905748","resolution":{"observed_at":"2026-08-07T14:19:57.780080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.987555Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","venue":null,"work_id":"888d51f9-faaf-4b64-902d-3fbb6a4b9347","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.837727Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:0340c2122b50e7e02a46986d6e1ca792d1449b121df84d41ef3f729b0c619e2e","observation_id":"fc9d4cbb-a552-4058-8c24-680bc8651cad","resolution":{"observed_at":"2026-08-07T14:20:00.042837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.866142Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":"64dd7800-5e92-43e0-b7fa-b9ee13a34208","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.919375Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:922c514e5f002a655a4ff245e48a43a848abc1f7db9af0cd50c6cd376713f87b","observation_id":"cc47ff8e-9be7-4e0f-aaca-e4557fceaf5d","resolution":{"observed_at":"2026-08-07T14:19:59.926601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.679801Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022, 2022","venue":null,"work_id":"9a88d6d8-3993-485a-9e14-fc3b659b45d1","year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.017967Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:e5024177dfb5cc0fe47ca0b0a0ee08469233741f0b55294b5f3c7d7ac7abb8ce","observation_id":"b8179d0d-46ab-486a-a30d-a4ba1206f51a","resolution":{"observed_at":"2026-08-07T14:19:59.759952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:19:58.084628Z","title":"Robust speech recognition via large-scale weak supervision.ArXiv, abs/2212.04356, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.084628Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:69613b46e7d86838a7b95177aa201ae80a8581a87861eaf79766f242c611b015","observation_id":"7ffd8915-540a-457e-ad2a-feebe127b0e5","resolution":{"observed_at":"2026-08-07T14:19:58.084628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.546190Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16:1505–1518, 2021","venue":null,"work_id":"446e4037-b285-48d0-91b8-281abe05c9ab","year":2021},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.176788Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:d5cabaaec6c1f6d3d7f2d73107ee6ad374762be019a34a5de621468ab67a99c8","observation_id":"9774d91c-d74b-419e-80da-0d25f97b1e5a","resolution":{"observed_at":"2026-08-07T14:19:59.605196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.393198Z","title":"Speech quality assessment","venue":null,"work_id":"132e44ce-bf69-4374-a943-fe382d6ea9a2","year":2011},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.249319Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ba956a14b13ba74e04c546409173970e86234fa783ddfd6ec52263c5610c887d","observation_id":"fcdb7826-d3bc-4038-8c87-1cdf16295d18","resolution":{"observed_at":"2026-08-07T14:19:59.455875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:58.330976Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.330976Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:e8ba70299a2796a92afa6098d282383f16f20d6c5130ae7330af5931693c59bb","observation_id":"8d91192c-2adb-4c99-bb69-82eb63c45c81","resolution":{"observed_at":"2026-08-07T14:19:58.330976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.233764Z","title":"Fast and high-quality auto- regressive speech synthesis via speculative decoding","venue":null,"work_id":"75ce3a86-dbfa-420f-8ce6-c0ad54e70d32","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.406514Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:89826ffeedbee913f47d64b3f2d01361671e181ee4626bea1ff7423cab2d4423","observation_id":"bcfe4542-9f26-42fc-a7fd-831a2e9c5aa1","resolution":{"observed_at":"2026-08-07T14:19:59.295479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.085711Z","title":"natural” in comparative naturalness task with “similar","venue":null,"work_id":"f4225826-d43c-490e-822b-9f16b9071dec","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.490777Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:e4a5bd848b30ab1662f3869042d287dc34dad9df90de060b148f5fc4497a8489","observation_id":"0fa78f88-7c67-4229-9457-1550633ce4dd","resolution":{"observed_at":"2026-08-07T14:19:59.140627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 1 inbound Pith citation observation for arXiv:2505.19462."}