{"as_of":"2026-08-07T11:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e760358cd0ae9a4537ce859667e22ba3c216568d9c6ee4e30d29ef145680ca57","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:55:50.720088Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12197/citation-record","integrity":"/paper/2507.12197/integrity","json":"/paper/2507.12197/citation-record.json","paper":"/paper/2507.12197"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T16:55:49.452658Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.452658Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:2d898afe16816627e26544c0e944d0b1b680edf2d452bf5229cd4da5128269e0","observation_id":"971e9b2c-bccb-40d3-ac1b-bd6a2a5cb146","resolution":{"observed_at":"2026-08-06T16:55:49.452658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T16:55:49.747483Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.747483Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:4338cfc5dee6ae7b8ecc96f139678780ca95a54f604ff3d0d6e458f8cacff697","observation_id":"90cb3af2-4b64-47b7-972a-918d54202787","resolution":{"observed_at":"2026-08-06T16:55:49.747483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T16:55:49.826784Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.826784Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:7f71a2f0f35eae0b401ac420afa4cce096b374d8a664933a0d10ee32a46b85bd","observation_id":"70fe884f-f9ee-406b-9b21-b6aaa865037e","resolution":{"observed_at":"2026-08-06T16:55:49.826784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T16:55:49.922280Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.922280Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:bf578c8c8446f8b8c167531d26777ffe636be059354f077675956f9cdaa6f54e","observation_id":"8ee08fab-3606-49ca-a030-696e0f56c49b","resolution":{"observed_at":"2026-08-06T16:55:49.922280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03540","last_updated":"2023-02-07T15:48:31Z","snapshot_observed_at":"2026-07-06T14:49:19.585577Z","submitted_at":"2023-02-07T15:48:31Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03540","snapshot_observed_at":"2026-08-06T16:55:49.981725Z","title":"Jaehyeon Kim, Jungil Kong, and Juhee Son","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.981725Z"},"links":{"cited_paper":"/paper/2302.03540","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:307860ab05e725d77979167bff4078ce7c2e01274e0e78125bdf9d7cb9f48577","observation_id":"06c0925f-3d35-4bb7-9e45-55b0626476e6","resolution":{"observed_at":"2026-08-06T16:55:49.981725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-06T16:55:50.078904Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.078904Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:30fa19b3f3dd958a86fbaf46792c971fceed5aaffe54702a3a958211c5b95962","observation_id":"5cf50fe2-f983-4810-9806-b75e9749fe36","resolution":{"observed_at":"2026-08-06T16:55:50.078904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07691","last_updated":"2023-11-20T04:23:08Z","snapshot_observed_at":"2026-07-06T15:41:59.079694Z","submitted_at":"2023-06-13T11:04:43Z","title":"StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07691","snapshot_observed_at":"2026-08-06T16:55:50.153909Z","title":"Julian D Parker, Anton Smirnov, Jordi Pons, CJ Carr, Zack Zukowski, Zach Evans, and Xubo Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.153909Z"},"links":{"cited_paper":"/paper/2306.07691","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:d9be3339d9c934e5f583deb64ebb9dd70224a0e031359549f5326c7587cdf38f","observation_id":"87337e4f-1806-45e6-bfb4-bede7ddf54e3","resolution":{"observed_at":"2026-08-06T16:55:50.153909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-07-06T19:59:01.756640Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-06T16:55:50.237226Z","title":"org/abs/2411.19842","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.237226Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:d4a79d074bf18d9aed680425521d000f0c0ffd95c7b0a6dab718194d62bfed31","observation_id":"02ec6650-2b1e-4979-8b8e-003742c21c5d","resolution":{"observed_at":"2026-08-06T16:55:50.237226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T16:55:50.287364Z","title":"Xinsheng Wang, Mingqi Jiang, Ziyang Ma, Ziyu Zhang, Songxiang Liu, Linqin Li, Zheng Liang, Qixi Zheng, Rui Wang, Xiaoqin Feng, et al","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.287364Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:fd6b5a726ae89a2e5c571baec29ab9b3356d5d38e73975a6ab8ebbd170afd756","observation_id":"628de9bd-5f27-43bd-ab8d-750b22b24240","resolution":{"observed_at":"2026-08-06T16:55:50.287364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T16:55:50.479314Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.479314Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:86a8bb09d9c123434a1dc31f1f7cbf24877a1963e48ef82af11b8f6e2944235c","observation_id":"506e6954-1a24-43c5-aaa2-a2c3c992b00e","resolution":{"observed_at":"2026-08-06T16:55:50.479314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:55:51.094652Z","title":"Multi-band melgan: Faster waveform generation for high-quality text-to-speech","venue":null,"work_id":"fe29888c-d1be-4c15-b2bf-bf9f0fb9f1af","year":2021},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.545372Z"},"links":{"citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:dc63df9eb38d22ab717f19a15c3fa51b70d811aff4b79520e72a251ddf11ffc9","observation_id":"8df2d612-4795-4727-945d-4dbb76992aac","resolution":{"observed_at":"2026-08-06T16:55:51.136842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T16:55:50.665549Z","title":"Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.665549Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:41cd504e036550a2cd9ceed3db5b6eb98e4242745cb5ee8a642539705dcc4ea9","observation_id":"f0330872-1376-4cc9-92cb-e1e56c0a857c","resolution":{"observed_at":"2026-08-06T16:55:50.665549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-07-06T21:22:45.982350Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-06T16:55:50.720088Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.720088Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:1923987a267bae5f6ffb9cbf470c67755d6ba3b0953845bb97e7026bfc31840f","observation_id":"5a717487-dfee-48e8-8cad-7c7e4e17f5a7","resolution":{"observed_at":"2026-08-06T16:55:50.720088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-06T16:55:50.034113Z","title":"9 Kundan Kumar, Rithesh Kumar, Thibault De Boissiere, Lucas Gestin, Wei Zhen Teoh, Jose Sotelo, Alexandre De Brebisson, Yoshua Bengio, and Aaron C Courville","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.034113Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:ae7ac150f8fcd3a0fead9441a40126ed3130ae9368cb9abef95b63228fd052aa","observation_id":"45171cba-3a9e-437e-8d8f-363ea2e819ae","resolution":{"observed_at":"2026-08-06T16:55:50.034113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:55:49.676482Z","title":"doi: 10.1109/jstsp.2022.3188113","venue":null,"work_id":null,"year":1941},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.676482Z"},"links":{"citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:b2d38578374a94eee241e21dbb8b7dc40207fbf45f98e6f65c24a556c934615e","observation_id":"affebd7b-7615-4ba4-9882-6e541db2e17b","resolution":{"observed_at":"2026-08-06T16:55:49.676482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T16:55:49.583767Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.583767Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:f81bb1daed2ec4f4987c381455c1ddb8bf8f5fac38b04753a672afd697304dcf","observation_id":"799f044e-036b-4f20-a99e-2041da5c1500","resolution":{"observed_at":"2026-08-06T16:55:49.583767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T16:55:49.512702Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.512702Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:cad592b0147d3462487058940530dcbb34c00a314759b3493576601015619565","observation_id":"edcddf70-53f9-47ca-b41a-b5fb3e02e6dd","resolution":{"observed_at":"2026-08-06T16:55:49.512702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T16:55:50.368580Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.368580Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:a03eaa76e62cc3c9208e7278ccec661b29e91f2ef34812f32e69b194d6d0b525","observation_id":"a32f064e-3d61-4988-8f59-e4bee014f2fa","resolution":{"observed_at":"2026-08-06T16:55:50.368580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T18:06:17.269625Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2507.12197."}