{"as_of":"2026-08-16T02:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e697450ee2dc3a52271aa15f36130c8bb61ad0a613913d16a1a1b1b9fadada36","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:34:47.857279Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08638/citation-record","integrity":"/paper/2608.08638/integrity","json":"/paper/2608.08638/citation-record.json","paper":"/paper/2608.08638"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-14T04:34:47.690816Z","title":"arXiv preprint arXiv:2301.02111 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.690816Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:0fd0b19daa0ce0b6b7b3e9fbe091f5007a97d44e8ee5d5937abc7f4d11654a1c","observation_id":"9f348351-f5c6-48eb-aebd-70385bd661f2","resolution":{"observed_at":"2026-08-14T04:34:47.690816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.596616Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":"e70d03ef-cdd0-4aeb-8a44-2f3a87a86c3c","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.696570Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:d6d7751285ef5d1219b8496c6ba705d3340539a0380bf33bdfcb2979943fb192","observation_id":"2265625b-dbaf-4695-bae1-ced74b0f97e7","resolution":{"observed_at":"2026-08-14T04:34:48.600345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.584227Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"f2b34996-2533-4571-bf3a-57f14d813675","year":2024},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.700590Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:7d2ab58d985a10ded79b044559c95fe9d6140d230ddd7d9952e853d305e2da8e","observation_id":"263b3929-e08d-4039-aa48-bbfce87a285c","resolution":{"observed_at":"2026-08-14T04:34:48.589000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.573419Z","title":null,"venue":null,"work_id":"a90638ae-46fd-4dc1-8442-33ad9745002f","year":2021},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.704386Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:b2309472acc773ce2c5932707d32cae84f1a0f7e6faee42ce0a54755a5e1e350","observation_id":"528bde7a-10be-4cd5-ae0d-7a3fa4d60659","resolution":{"observed_at":"2026-08-14T04:34:48.576877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.560236Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"eb61a5ad-57e2-41de-80b5-e16c09730f63","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.708558Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:778e517c257ae3e1bdf8ff24280c518ac84dad4d316e62e6f6fde9a759bb4684","observation_id":"ca9de21b-070a-4a41-8e40-9000f901dffa","resolution":{"observed_at":"2026-08-14T04:34:48.566541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03199","last_updated":"2024-01-09T21:02:34Z","snapshot_observed_at":"2026-08-15T10:51:00.332950Z","submitted_at":"2023-09-06T17:59:57Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03199","snapshot_observed_at":"2026-08-14T04:34:47.712299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.712299Z"},"links":{"cited_paper":"/paper/2309.03199","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:6c4bebde3348cb2ec3d098f26e46da49ff3431e4e033022dff50ab3f999d46f6","observation_id":"c4a55a63-e3d1-44f3-9972-2cbbcf19b7fd","resolution":{"observed_at":"2026-08-14T04:34:47.712299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.548930Z","title":null,"venue":null,"work_id":"d0646f21-d7df-4c0d-ba69-1b922e5fd7e5","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.716159Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:fbc23a8ca265374532d158011d59ce4c02a9cafd0bdb8b7a593bcf5e1539acec","observation_id":"dc69aa60-8551-4c30-baf7-d3c52fff7bb2","resolution":{"observed_at":"2026-08-14T04:34:48.552579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-14T04:34:47.719682Z","title":"arXiv preprint arXiv:2407.05407 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.719682Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:f38e658eb21e967f6e8168fee3a25a2b45969a1619329b9de114f9d007ac8490","observation_id":"cd0a88a1-8c3f-498e-823c-f267199e3654","resolution":{"observed_at":"2026-08-14T04:34:47.719682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-15T06:56:49.859129Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-14T04:34:47.723267Z","title":"arXiv preprint arXiv:2412.10117 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.723267Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:f356450fd77078446ea5b2500356d4cad0e7241553ad8d096bff1103f45ae0f5","observation_id":"b4764bab-f4c4-4c0d-8fea-fd213af4b19b","resolution":{"observed_at":"2026-08-14T04:34:47.723267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.537916Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"02f15609-528d-4381-b413-0b2aaccdfcce","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.727270Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:4b3390361e495943218183d444428c2322710509c03d4583c689ebfb385e4118","observation_id":"c08ef51c-77f7-419c-9563-d504c0366d5c","resolution":{"observed_at":"2026-08-14T04:34:48.541526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.730831Z","title":"arXiv preprint arXiv:2410.16048 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.730831Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:7ed80242ff13f6650044d049c668341ed2c588ce5d427ce8c6c3dc052e91e37a","observation_id":"a8005653-95e4-4bd2-b93d-aae2f764b6f8","resolution":{"observed_at":"2026-08-14T04:34:47.730831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.526410Z","title":"2025 , url =","venue":null,"work_id":"1dffd17d-7809-497a-886e-8e948be62be7","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.734210Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:3cbe7c23bb74792ab25047dd955d457d77df5a8237add06061110a8db7122f5c","observation_id":"c5be50df-da2b-48ed-b227-0d540de1b06c","resolution":{"observed_at":"2026-08-14T04:34:48.530357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.515286Z","title":"2025 , doi =","venue":null,"work_id":"3efc7eaa-1626-4d8c-acba-b52a2b90b3ad","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.737637Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:0003a407c03dd8be2cbe983a371289a990fadade4f5678414eb78b3461ea145a","observation_id":"bfc28a2b-d9d1-43af-ae53-37b9ae64f760","resolution":{"observed_at":"2026-08-14T04:34:48.519301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.741058Z","title":"arXiv preprint arXiv:2509.06926 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.741058Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:8d72f94023e1733f52ebda7666acb76764f43023beac09317139bed90ac06962","observation_id":"39ad39d4-2362-4965-9625-e2ab8828681e","resolution":{"observed_at":"2026-08-14T04:34:47.741058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-08-11T17:38:48.356878Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-14T04:34:47.744852Z","title":"arXiv preprint arXiv:2412.08635 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.744852Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:bfdd9926538359253e0314a09f5c78892e461ccbe46dc0536805cb4aa11df158","observation_id":"65323f6f-84f2-4476-8031-fa97c37987c5","resolution":{"observed_at":"2026-08-14T04:34:47.744852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.502765Z","title":"High-Fidelity Audio Compression with Improved","venue":null,"work_id":"1a8b7dd0-1d43-41f5-8f99-ed13a876da88","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.748625Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:bb24652c8f02e7d23d8647e600557560993795d199d56f0b2edbbe549dbe8f7f","observation_id":"f18bc46a-a7fd-4235-a096-7c3f0a283207","resolution":{"observed_at":"2026-08-14T04:34:48.507858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-08-15T16:51:35.217742Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-14T04:34:47.751890Z","title":"arXiv preprint arXiv:2508.19205 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.751890Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:49359487493f7908e1f912a55dca029b04692a2be8f9895f5896a7a9828aaee8","observation_id":"81886fc8-a880-426b-8207-de3d5d56cd95","resolution":{"observed_at":"2026-08-14T04:34:47.751890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.490593Z","title":"2025 , eprint =","venue":null,"work_id":"fc196a96-fc32-4cf1-9568-b197933fc4a5","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.755814Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:4298522bf3a6dca0b73b1858854ac516fce2f0e6dafd4358404620e25d237b28","observation_id":"36ae63b0-65a6-4bdf-832c-69dd7ac4aced","resolution":{"observed_at":"2026-08-14T04:34:48.494830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.479354Z","title":"2025 , eprint =","venue":null,"work_id":"5a234586-b804-4701-ad94-e928f9528369","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.759287Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:d461258024f6eaf2a14f11f11fafabbe9bc2360a84d3bb37b912fa880ef79716","observation_id":"c2ec74ab-3073-4aa1-9268-44398cfcf990","resolution":{"observed_at":"2026-08-14T04:34:48.483310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.467381Z","title":"2025 , eprint =","venue":null,"work_id":"b9ce8d9a-eb9d-4247-96f3-3c12cdc88c1f","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.762805Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:17aeb42b0c8c6dfc3d935943f477ae25718620fea0e6dd6477d7c379c9923985","observation_id":"083af3b6-ba30-4d94-8c49-60a8b74fdbda","resolution":{"observed_at":"2026-08-14T04:34:48.471583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.455694Z","title":"2025 , eprint =","venue":null,"work_id":"cc24de69-23ae-4216-8373-7cac3f514b01","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.766120Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:fd70a5d87631093256f4e1789a5eeb663cfdd525a6e94f61c910ea7799d2a346","observation_id":"428a9006-3935-4abc-b8e5-abb2d9ebcb9f","resolution":{"observed_at":"2026-08-14T04:34:48.459216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.443705Z","title":"The Eleventh International Conference on Learning Representations , year =","venue":null,"work_id":"8de5758e-9869-49cc-98ad-d37e3ef9899a","year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.769256Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:802ddd5d04663065abfbc82c2a4403302e6e6541df65831beac478fa3f98316d","observation_id":"73cbeffa-3907-46cf-955d-7867ebef71a8","resolution":{"observed_at":"2026-08-14T04:34:48.447427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-14T04:34:47.772701Z","title":"arXiv preprint arXiv:2207.12598 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.772701Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:e41980dee65c37d329b0aeefd770da96506a8dcdcce731bd7882c24362877a00","observation_id":"e02c77d7-d48f-4e73-9ca5-c67b6f3c0572","resolution":{"observed_at":"2026-08-14T04:34:47.772701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.431919Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":"d68f2b6d-df67-442e-90b7-2b18442145ff","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.776552Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:e94edf852ab700aeff7c7da9806e02960042195d460f8587688e7dd1703535ba","observation_id":"46c16d2c-5daa-43bb-b59f-14e089c95063","resolution":{"observed_at":"2026-08-14T04:34:48.436450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.419311Z","title":"The Tenth International Conference on Learning Representations , year =","venue":null,"work_id":"d507e6f1-b7a2-4c25-bb0c-f024e66297ef","year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.779605Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:552cb059ebc8a7f5e22e4f17267b205896532f5c146dbe4de044b25b9571968a","observation_id":"6c2bd392-48c0-45e8-a72f-6180f6937928","resolution":{"observed_at":"2026-08-14T04:34:48.424221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.407983Z","title":"Proceedings of the 40th International Conference on Machine Learning , series =","venue":null,"work_id":"321f03aa-4889-4aa2-b530-1dce87a0c80e","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.783172Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:e1bf23c0e892be42799da68af6dd4d8fbf172d9a696e524382aa54ec9fdd5555","observation_id":"09873062-4a0f-47f8-b6b3-cfeb06f4c75f","resolution":{"observed_at":"2026-08-14T04:34:48.412154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-14T04:21:47.598355Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-14T04:34:47.786352Z","title":"arXiv preprint arXiv:2505.13447 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.786352Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:eeacca4d264c7e973992ed0cfe8ff7517dfac921b62315e9f599c32add0af746","observation_id":"c295d162-8dfe-4232-96ed-089ee32ea4c7","resolution":{"observed_at":"2026-08-14T04:34:47.786352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.789831Z","title":"arXiv preprint arXiv:2510.07979 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.789831Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:cc55f9618ed61e23021be74bad63bd867723d03d38e92bae8f6132d797f4e1d3","observation_id":"b27b8a3b-f804-435f-86b3-827857d3dfb4","resolution":{"observed_at":"2026-08-14T04:34:47.789831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.396603Z","title":"The Thirteenth International Conference on Learning Representations , year =","venue":null,"work_id":"9ca74a8f-9e3d-4324-8783-97c95d1ea94f","year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.793206Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:5e0bf33cc1facadc6aaac48764cbaa818ea607c574660e5b580c4545087935c1","observation_id":"13f99b37-cf3c-4cff-b71b-5083e02514e2","resolution":{"observed_at":"2026-08-14T04:34:48.400368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.796494Z","title":"Transactions on Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.796494Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:9fe7941a5eab784d01a84f649dac0079e68244dd78128918fa115469220cbeff","observation_id":"ad0d5956-ddb7-45b3-ad18-48c0736bc789","resolution":{"observed_at":"2026-08-14T04:34:47.796494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.799959Z","title":"2022 , doi =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.799959Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:764e3fd0c79a8de5b4b497055fc6245afba000ba481ef88a64da90c58b7b0378","observation_id":"6f56e798-40f0-4c8f-a3d5-51565053e899","resolution":{"observed_at":"2026-08-14T04:34:47.799959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.803174Z","title":"2020 , doi =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.803174Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:068fca2ce20235a6fb1759ef09464383494a874afd3ced41821f17ccbc1d49c4","observation_id":"3aa0008a-61ab-4e8b-b154-266b1337adba","resolution":{"observed_at":"2026-08-14T04:34:47.803174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.364414Z","title":"2015 , doi =","venue":null,"work_id":"18e70b2a-d930-4f21-b462-5d3b0ec54217","year":2015},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.806731Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:6cd92c63c777275488f03010f75476e5df37ced6ce9acc0bd6d251cfe5fd93bd","observation_id":"93a6d603-a4fd-45b2-8461-56b8219426b6","resolution":{"observed_at":"2026-08-14T04:34:48.368273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.351928Z","title":"Proceedings of the 40th International Conference on Machine Learning , series =","venue":null,"work_id":"858f7f7a-7d40-468a-a03c-847fb44991f5","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.810384Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:4e7182b063c169626245031b924f5303107c4d02b2eecc16b2b4cf352cf9e728","observation_id":"4f0bb643-69ee-44e1-bfe1-458b4d73fd3d","resolution":{"observed_at":"2026-08-14T04:34:48.355838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.341490Z","title":null,"venue":null,"work_id":"2a7bf61c-b81c-4410-a9b4-f78f462ae9e2","year":2024},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.814011Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:4b1500eb78e9d49c24fcc632d99e4910aacedf37a487120504410b8c4f505507","observation_id":"056454a2-9fe3-4340-a6e3-bd0ebda5ad3c","resolution":{"observed_at":"2026-08-14T04:34:48.345096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.331125Z","title":"2023 , doi =","venue":null,"work_id":"ca5cb783-eefb-4d3d-80c6-0d0e047e8af1","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.817524Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:9ab4d1c663cfe0d6519dba88d8ea92ecb87dfd1e2cf87dfe37e0cd294dff49d0","observation_id":"c965efa6-0138-4ce3-99ca-a9a8277bcc45","resolution":{"observed_at":"2026-08-14T04:34:48.334685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.318357Z","title":"2022 , doi =","venue":null,"work_id":"56cc25ee-be5e-4da6-ba1c-eb5916434c36","year":2022},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.820763Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:7eee8ed38657d32a04dbcf4840b5479aea5ca0975229143a5c0639ddc2471623","observation_id":"c53016fa-7f3d-477f-9966-877847cbb790","resolution":{"observed_at":"2026-08-14T04:34:48.322397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.306364Z","title":"2026 , eprint =","venue":null,"work_id":"00ce9e06-ecbe-4da9-b6e0-07573399952b","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.824208Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:21e807d75f6ea87a6df5b38200b5ac620317eb055c6c5b69a738b3c316198279","observation_id":"da649455-cd2b-4fc7-b64c-724111984689","resolution":{"observed_at":"2026-08-14T04:34:48.310203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.294838Z","title":null,"venue":null,"work_id":"fff8bbfd-1dc5-4c75-b8c2-a8d70529a350","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.827519Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:a8f83620af19b89bc2f612964c1982b7f9ae7b1f5cdada1276acbcf8a43f365c","observation_id":"00857867-259e-438d-97e5-5ea59ba9c2f5","resolution":{"observed_at":"2026-08-14T04:34:48.298673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-15T08:18:32.827110Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-14T04:34:47.830741Z","title":"arXiv preprint arXiv:2509.02020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.830741Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:7ef086303a07f0f7a87b3d77bbbb17cbf53617197808de11411d125cbea64149","observation_id":"f6a00cd0-c484-42da-ae3f-df317a6ab822","resolution":{"observed_at":"2026-08-14T04:34:47.830741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13053","last_updated":"2025-08-07T03:12:26Z","snapshot_observed_at":"2026-08-13T16:12:03.853679Z","submitted_at":"2025-06-16T02:48:17Z","title":"ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13053","snapshot_observed_at":"2026-08-14T04:34:47.834426Z","title":"arXiv preprint arXiv:2506.13053 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.834426Z"},"links":{"cited_paper":"/paper/2506.13053","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:bc3c9826379d62a03e08b7866b1a5018513cb3181eea97285c8b80dcb177bce5","observation_id":"d48ff219-ef5f-4097-b213-fb27449d39b1","resolution":{"observed_at":"2026-08-14T04:34:47.834426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-14T04:34:47.839144Z","title":"arXiv preprint arXiv:2506.21619 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.839144Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:a242fba67eec7a44c3b2422d455ac5f05f6c5ad7fe105713797e890b7b07024f","observation_id":"118e73e2-b728-42ec-ab50-4485a16f7c18","resolution":{"observed_at":"2026-08-14T04:34:47.839144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-13T01:08:56.872280Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-14T04:34:47.842901Z","title":"arXiv preprint arXiv:2505.17589 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.842901Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:f79125b013632a5fa465ce0f8c92d0eccb753edea536ff45a54320204c85d345","observation_id":"a709c555-245c-4f56-bd60-43e4691a48f2","resolution":{"observed_at":"2026-08-14T04:34:47.842901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.284896Z","title":"Interspeech 2022 , pages =","venue":null,"work_id":"a2ed8e6f-6761-404f-a17e-05096a2acc05","year":2022},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.846901Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:bcb43ee83cc9736aeea22f4712acb55afbe81270647703713829b60be728cb75","observation_id":"80e12354-253c-4f35-aa32-75f8ade94d32","resolution":{"observed_at":"2026-08-14T04:34:48.288224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.274888Z","title":"2026 , eprint =","venue":null,"work_id":"6cee6485-4768-401f-b3e3-5c66adb5e117","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.850315Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:d39d02a532da4047c4330358d7b2a98ca6b520c72470a2dd34345cc84e1f2b45","observation_id":"9bd9d3af-0c4b-4776-8f64-f9e3603f81f4","resolution":{"observed_at":"2026-08-14T04:34:48.278229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.261812Z","title":"2026 , howpublished =","venue":null,"work_id":"e758c9a9-869a-4a5f-963b-2325ab01426e","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.853760Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:55ea9b84075ea861ba82852cc9073f381048c00235b595994bd14f8cb1a23a3c","observation_id":"9004cfd9-b545-4e17-9985-aa8d0974c1ac","resolution":{"observed_at":"2026-08-14T04:34:48.266572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.857279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.857279Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:88ac8e2a973c3b16630753e7fcad0c429061d65512e810c38952ddf76b3b658e","observation_id":"c724480d-11d0-4999-bb45-1ecc651c3803","resolution":{"observed_at":"2026-08-14T04:34:47.857279Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T08:18:59.687835Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2608.08638."}