{"as_of":"2026-08-08T15:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c917531cb948c53708776b8af03f63d16c01356d4457ae092c89c703ce72a1c","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:30.804516Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T21:31:09.399885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:16:11.072472Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"cited_work":{"arxiv_id":"2505.24496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24496","snapshot_observed_at":"2026-07-01T20:16:11.072472Z","title":"Wenrui Liu, Qian Chen, Wen Wang, Yafeng Chen, Jin Xu, Zhifang Guo, Guanrou Yang, Weiqin Li, Xiaoda Yang, Tao Jin, Minghui Fang, Jialong Zuo, Jionghao Bai, and Zemin Liu","venue":null,"work_id":"1869080a-9e62-4da2-be4c-43b0ad768e8c","year":2025},"citing_paper":{"arxiv_id":"2512.07571","last_updated":"2026-04-06T08:39:08Z","snapshot_observed_at":"2026-07-06T22:38:03.983093Z","submitted_at":"2025-12-08T14:05:40Z","title":"A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T00:46:08.921194Z"},"links":{"cited_paper":"/paper/2505.24496","citing_paper":"/paper/2512.07571"},"observation_digest":"sha256:89d4e1a0d5c4bf813e5698b918991f637f9b20eb6fa8c3a046af92f36e4d8b20","observation_id":"bb66ea14-8f2a-41c6-be0f-073aabe5ae2a","resolution":{"observed_at":"2026-05-17T00:48:45.982486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"cited_work":{"arxiv_id":"2505.24496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24496","snapshot_observed_at":"2026-07-01T20:16:11.072472Z","title":"Wenrui Liu, Qian Chen, Wen Wang, Yafeng Chen, Jin Xu, Zhifang Guo, Guanrou Yang, Weiqin Li, Xiaoda Yang, Tao Jin, Minghui Fang, Jialong Zuo, Jionghao Bai, and Zemin Liu","venue":null,"work_id":"1869080a-9e62-4da2-be4c-43b0ad768e8c","year":2025},"citing_paper":{"arxiv_id":"2605.30748","last_updated":"2026-06-01T01:53:31Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T02:25:02Z","title":"Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T21:31:09.399885Z"},"links":{"cited_paper":"/paper/2505.24496","citing_paper":"/paper/2605.30748"},"observation_digest":"sha256:dd9bcd823e2c15d1d6b47311001513322ee12d94a7494ec4db39e9a379fd933d","observation_id":"a6d9c15d-b53a-43b1-9aba-e28e92808ccf","resolution":{"observed_at":"2026-07-01T20:16:11.074055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24496/citation-record","integrity":"/paper/2505.24496/integrity","json":"/paper/2505.24496/citation-record.json","paper":"/paper/2505.24496"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-07T12:27:24.325215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:24.325215Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:740d7b1aa6de64291eff34917ac92203148ee536e77d992374c369f34e7c53af","observation_id":"c198cb4f-2277-46e4-b818-dc7780d4147a","resolution":{"observed_at":"2026-08-07T12:27:24.325215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.596029Z","title":null,"venue":null,"work_id":"edd1589f-92fd-4742-a3f7-3e4fe2d89867","year":2006},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:24.462003Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:d25f06ee4e721feb4a3c4df2361030ce604501016eb493c7680aab4cdc3e329e","observation_id":"edaab79b-3a62-4c0c-91b8-ba89f5b2d5e5","resolution":{"observed_at":"2026-08-07T12:27:34.666030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04029","last_updated":"2024-10-05T04:29:55Z","snapshot_observed_at":"2026-07-06T19:28:18.775189Z","submitted_at":"2024-10-05T04:29:55Z","title":"SyllableLM: Learning Coarse Semantic Units for Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04029","snapshot_observed_at":"2026-08-07T12:27:24.602975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:24.602975Z"},"links":{"cited_paper":"/paper/2410.04029","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:5c11a8780fcb6d4774fe248f74354ae1018457984e9f2470a278e2966160a941","observation_id":"bfee4669-8a90-4c16-9f93-88822094d260","resolution":{"observed_at":"2026-08-07T12:27:24.602975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05787","last_updated":"2025-01-10T08:41:42Z","snapshot_observed_at":"2026-08-08T07:30:09.769546Z","submitted_at":"2025-01-10T08:41:42Z","title":"MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":"2501.05787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05787","snapshot_observed_at":"2026-08-07T12:27:31.509181Z","title":"MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model","venue":"eess.AS","work_id":"68eb44d6-bb7c-4308-afd4-714f1cdf58db","year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:24.720460Z"},"links":{"cited_paper":"/paper/2501.05787","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:83d67e7cc5b1cc8a65dab50034cc4f0ebf649e26925e48a47afffd270d653421","observation_id":"85cca677-1b93-4b49-a515-98d54bc050b1","resolution":{"observed_at":"2026-08-07T12:27:31.591486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-07T12:27:24.909961Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:24.909961Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:6a73b4ae3cd57b328dc1964485bf6d4afbe0887d467cb31610cbed79315b5a77","observation_id":"bebc49f9-7056-4d7b-a1a7-053c58262520","resolution":{"observed_at":"2026-08-07T12:27:24.909961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T12:27:25.084551Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.084551Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:e23096c9737a86887fcdb10cc68cf660d0d2aa69b4cd9b465533dc4e98a5d458","observation_id":"7cf99313-2e9f-452c-ad98-1832a9f59aad","resolution":{"observed_at":"2026-08-07T12:27:25.084551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T12:27:25.262496Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.262496Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:0d7e8cc077ba83d6ff4070cd8b83d6195b2da01d48f8c85c80e03fbfbd568139","observation_id":"d2aea3f9-24c4-499c-ab07-bcca87572d2a","resolution":{"observed_at":"2026-08-07T12:27:25.262496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T12:27:25.458653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.458653Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:f7e0e504df4279200989cb91dd6c53783cc3b0305efe0ab57bdf2cc2113c210d","observation_id":"8bf7acdd-960c-4c94-9766-173297f31e72","resolution":{"observed_at":"2026-08-07T12:27:25.458653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:25.600769Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.600769Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:f3eae66097c3bc4454659c625f4216fe9214b18ef7029c4724189a83e701e4a3","observation_id":"6a8f3746-4c35-4145-85b4-f581da39e7d2","resolution":{"observed_at":"2026-08-07T12:27:25.600769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19971","last_updated":"2024-12-27T02:48:43Z","snapshot_observed_at":"2026-08-04T04:27:26.323473Z","submitted_at":"2024-03-29T04:42:12Z","title":"3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19971","snapshot_observed_at":"2026-08-07T12:27:25.781504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.781504Z"},"links":{"cited_paper":"/paper/2403.19971","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:1f74eb11d2500f2c5c496affe42c45fb4d4d1eb2cecf475290e6af29179b6ba2","observation_id":"ff74aab7-912a-4854-8803-81fc31d1ff0c","resolution":{"observed_at":"2026-08-07T12:27:25.781504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07168","last_updated":"2025-03-02T09:16:05Z","snapshot_observed_at":"2026-08-01T16:45:50.204787Z","submitted_at":"2024-10-09T17:59:04Z","title":"Sylber: Syllabic Embedding Representation of Speech from Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07168","snapshot_observed_at":"2026-08-07T12:27:25.946050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.946050Z"},"links":{"cited_paper":"/paper/2410.07168","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:4ec50ee4f5aaf1290129303e3a9c19df268ebe7ffbbad2ccd113eb55c6fd07f7","observation_id":"ac8039c6-d6e6-4c4d-a396-592356a8a347","resolution":{"observed_at":"2026-08-07T12:27:25.946050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:26.132145Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.132145Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:d449014eb0e52d17e83abea818192af0be4597b94cda3272e4ce804cc9132056","observation_id":"678a8410-e5f5-47eb-b1e5-fb9d8b1148b3","resolution":{"observed_at":"2026-08-07T12:27:26.132145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:27:26.250366Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.250366Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:f20808410650e7d82650cd8c010e41aa42862aa0d30607ec71f3e24447f5269a","observation_id":"754937e3-48ee-4aac-bf30-f7d5d76257a1","resolution":{"observed_at":"2026-08-07T12:27:26.250366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T12:27:26.370288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.370288Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:20386b4f9a74db53281f39235c9338382f84c20a6ba9f6846499f53be80faa1d","observation_id":"23ee3594-44f4-489c-90d2-8113b1b7325f","resolution":{"observed_at":"2026-08-07T12:27:26.370288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:26.503820Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.503820Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:eada960d90b4d5c69432c73758b8585f1bf533c55217b9137628f9aa796718f4","observation_id":"fc9b3575-3c63-406e-9df8-319dba0bc389","resolution":{"observed_at":"2026-08-07T12:27:26.503820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06089","last_updated":"2021-03-10T14:42:31Z","snapshot_observed_at":"2026-08-07T00:20:05.002017Z","submitted_at":"2021-03-10T14:42:31Z","title":"Variable-rate discrete representation learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06089","snapshot_observed_at":"2026-08-07T12:27:26.634866Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.634866Z"},"links":{"cited_paper":"/paper/2103.06089","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:4c70408e66ad482e5b20da1df813899e1a8f96b401d2a3e5dfe017ecd6b59f79","observation_id":"9a9b888a-0be7-4c57-a0d2-f5ba9de84b66","resolution":{"observed_at":"2026-08-07T12:27:26.634866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T12:27:26.764353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.764353Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:c82cbf46c6e0c00190fdeffed67195996267ff793c57b29dc289496e92c14fa9","observation_id":"32b36240-57df-4b54-8520-42b0fefa9669","resolution":{"observed_at":"2026-08-07T12:27:26.764353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.488758Z","title":null,"venue":null,"work_id":"cc0e499f-96ef-41cb-a5ab-d2e35f0e6736","year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.848440Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:692b05923f24b8c1760eebd5af73b84a181e829011b204da5bd104b1cee50c08","observation_id":"e80d3b2b-0f52-4f09-91ce-94141c23eb23","resolution":{"observed_at":"2026-08-07T12:27:34.531586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T12:27:26.941992Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.941992Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:49c43647cf5e6c02a3f8e17979bbc75086c2ba589d9c681f59effc6e2b0162bb","observation_id":"474b2f4d-d387-4824-ac27-39948ab44abc","resolution":{"observed_at":"2026-08-07T12:27:26.941992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:27.086737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.086737Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:07e5d16e476aafe2581f6c4e9a968a51f790f930b13cedcc4e1b7eb63aa3431c","observation_id":"804f4053-fb7c-47a2-8cda-497b332e9879","resolution":{"observed_at":"2026-08-07T12:27:27.086737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T12:27:27.227981Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.227981Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:6eb797fd5bb3f2e51480fb1740ee1d6efd1327f64bf9115c53e8f7494a9f1db7","observation_id":"b24e8798-a39f-40c1-b133-d801cb3473be","resolution":{"observed_at":"2026-08-07T12:27:27.227981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.330672Z","title":null,"venue":null,"work_id":"7960760c-4083-474b-b7d7-c9334580cc61","year":2021},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.360528Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:4626b4afb176ea77b3c58b17fc164b7d0361a2861c92164e7c70242da16e3264","observation_id":"eac5391e-e554-4825-98e6-738d8d2b430b","resolution":{"observed_at":"2026-08-07T12:27:34.415182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T12:27:27.428134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.428134Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:216966ba1ab2cd8805991edfd6d6dc6e1b515951e4749fb6b554d9a3c21a33d3","observation_id":"a8a22c26-ed85-4d7a-8176-72047c6f98a2","resolution":{"observed_at":"2026-08-07T12:27:27.428134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20067","last_updated":"2025-02-27T13:16:41Z","snapshot_observed_at":"2026-08-07T17:42:59.278834Z","submitted_at":"2025-02-27T13:16:41Z","title":"UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20067","snapshot_observed_at":"2026-08-07T12:27:27.497683Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.497683Z"},"links":{"cited_paper":"/paper/2502.20067","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:9830903e69aeb1e75cf49a5817bb8332d94e67ce0c4b901c23af22e605787a8d","observation_id":"64b67d22-e821-4b10-83e8-f4dad82a4fd7","resolution":{"observed_at":"2026-08-07T12:27:27.497683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.195699Z","title":null,"venue":null,"work_id":"9ae238a8-a6b8-4f12-b97f-a3b826a8c576","year":2008},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.560168Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:077fc4bc9585062a92c42dc1bc4f8e167fb6a8feac474752502797ad4c71758e","observation_id":"a4cc8cad-7112-4835-b95d-48f150541425","resolution":{"observed_at":"2026-08-07T12:27:34.250492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.010217Z","title":null,"venue":null,"work_id":"fdc7ac1f-c56e-46cc-849d-3435eb4da47f","year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.678102Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:a67fc92d81b58270f8b51cf8347cff636e48736b5de69a3ef0d3fe95f0e0d939","observation_id":"13c7ab8f-b3e7-4ad4-b1fd-78eb7cf3f024","resolution":{"observed_at":"2026-08-07T12:27:34.084950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.870750Z","title":null,"venue":null,"work_id":"501f3840-f655-4e82-adf2-e3fc4d3baf88","year":2020},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.798917Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:a9bf07b75c4fd39f5bf653b535d67b0a78bb704aa806e4b82d852281011c05af","observation_id":"bc8600bc-c246-4104-8726-e3f149b77625","resolution":{"observed_at":"2026-08-07T12:27:33.920312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.698713Z","title":null,"venue":null,"work_id":"44cf00d6-93a0-4154-ac16-7a193faa91b4","year":2020},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.873350Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:18dfd03467210f9d89f2702757a03ccfbeef01ea61fc6313fb3c7788f388b0d1","observation_id":"af9e4769-dff0-4dbc-8696-882fbfa1d5fe","resolution":{"observed_at":"2026-08-07T12:27:33.763898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.505319Z","title":null,"venue":null,"work_id":"bb348866-2f76-40bd-af07-2830a02ea50f","year":2020},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.960289Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:43bb793f309d2142701a3236f33b4174d603a2153c30a9a792813abe6aa63b69","observation_id":"cba51742-9535-4d59-9282-9d7c22eee1e2","resolution":{"observed_at":"2026-08-07T12:27:33.598852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.088446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.088446Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:7bbe5785a93b999b778844c11036077def55ab2d4e68a5a8bc95a7453e5f4c48","observation_id":"fd6b9d05-f1fe-4556-badc-32f6e149c0b5","resolution":{"observed_at":"2026-08-07T12:27:28.088446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T12:27:28.164670Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.164670Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:6f9c75b4301165935d98bdbf8338a7f2363eac5088b1fb720c1c4d930dfc8cc4","observation_id":"409174c7-b487-4315-9c12-d8f74aa4f8fc","resolution":{"observed_at":"2026-08-07T12:27:28.164670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.383210Z","title":null,"venue":null,"work_id":"b74883ec-08de-4ae9-8afb-aa1da6819eec","year":null},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.249212Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:e5d5ac18712a7bb1ee770c177e0c87c8ecee09b6a3c0b9e55dafa35002a8eace","observation_id":"11e468d2-c148-40b4-af74-958742a806e8","resolution":{"observed_at":"2026-08-07T12:27:33.433196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04380","last_updated":"2024-10-06T07:20:58Z","snapshot_observed_at":"2026-08-03T07:51:42.862937Z","submitted_at":"2024-10-06T07:20:58Z","title":"HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04380","snapshot_observed_at":"2026-08-07T12:27:28.424043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.424043Z"},"links":{"cited_paper":"/paper/2410.04380","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:097af0a8a42f3c8d812e9efe67c097dbffc4e4311b9e47dfbb7fb74add7556f1","observation_id":"7f4a5b07-c22b-41c6-bf22-5d42a07dcd83","resolution":{"observed_at":"2026-08-07T12:27:28.424043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.492283Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.492283Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:3943b5aff0db79b4329f4fbd99339bc4affafbe72ec08b2228b6377671563ee0","observation_id":"d1ec0cdd-833f-4b56-a1f9-cc5307e78352","resolution":{"observed_at":"2026-08-07T12:27:28.492283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16973","last_updated":"2024-06-14T00:29:46Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:38:32Z","title":"VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16973","snapshot_observed_at":"2026-08-07T12:27:28.583954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.583954Z"},"links":{"cited_paper":"/paper/2403.16973","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:3a7509500ef89d548833a40b8a273098ff53e66b1cc140be8605a490bb720039","observation_id":"d9c938da-1af9-4a58-b535-e9c9e7662bac","resolution":{"observed_at":"2026-08-07T12:27:28.583954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T12:27:28.670735Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.670735Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:39379b7539fbf6d28b7ce46ff99a2fc0ae389860756be29e9b5ccf1650d451b0","observation_id":"e970c14b-eae9-4458-9ce8-70ac03908f86","resolution":{"observed_at":"2026-08-07T12:27:28.670735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.073245Z","title":null,"venue":null,"work_id":"98327b3d-4e00-4701-b5fb-5b7d1058afee","year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.759042Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:3832cb60f560a36cd9278f42a0cd233d9fb6cccb5992a50ceac39328e8b0be23","observation_id":"acf9bf34-8d6b-4cff-8e05-7c6e4a1bed9f","resolution":{"observed_at":"2026-08-07T12:27:33.137114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.852939Z","title":null,"venue":null,"work_id":"04f5bc81-9427-40b8-a6a0-a3f596956191","year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.833170Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:1eda8763b144c4b0776a25a129273ae1dd508b4240f15b72dff269c9afbadf1a","observation_id":"c6d42c4b-40f1-49e6-98a3-8d5b3f9d1870","resolution":{"observed_at":"2026-08-07T12:27:32.965545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T12:27:28.903428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.903428Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:fe604f8f388f1ea8094106caf92a630ebda41ddd39f667d6c3545c34a01522c0","observation_id":"6d61baa9-d03a-428a-a061-6c8cb9922bea","resolution":{"observed_at":"2026-08-07T12:27:28.903428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.042521Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.042521Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:972e92a2386991f125feeb8e6591b76529353707e2409a8dfa2681b9388e4925","observation_id":"43042dcb-3e18-4ce3-9eeb-ba2d7105f563","resolution":{"observed_at":"2026-08-07T12:27:29.042521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.659585Z","title":null,"venue":null,"work_id":"661ae69c-805e-40fb-b24a-df22eb1423cc","year":2021},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.116611Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:221fa3400c29e2c942291f93b9a2eef63c2ff0bc2b1ef3321f0cdebe99361211","observation_id":"ffb30411-f999-45e3-831b-7e0cb6e92f21","resolution":{"observed_at":"2026-08-07T12:27:32.753480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.415114Z","title":null,"venue":null,"work_id":"778df10a-c1c8-429e-b32e-a8df4333153c","year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.189410Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:b5a891515254f0876d4e0c2060328f71626b0bf8dfdf5108826ce25f5269fa8c","observation_id":"38305736-0f56-4965-b26b-c9792c6a6ce0","resolution":{"observed_at":"2026-08-07T12:27:32.589857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-07T19:28:41.853565Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-07T12:27:29.295374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.295374Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:06067d663743a336304bfcccf8659b3e732685c3ed3d084019e526fb4344922b","observation_id":"88b84e91-c007-4a5d-9186-1ade72b1f353","resolution":{"observed_at":"2026-08-07T12:27:29.295374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.225426Z","title":null,"venue":null,"work_id":"a8ad6cf9-2a05-4be8-b1a4-2c885ffaf2f1","year":null},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.430837Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:bfde347aa4730df05ae64d4e2e210bf4e61a716638d907b69be16e4cae8d77fc","observation_id":"b079e618-c75c-4a31-acc4-37d02cfc53ea","resolution":{"observed_at":"2026-08-07T12:27:32.285196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:27:29.656297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.656297Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:7b14c31a35ee8e852dabcc388c3d193acb66e447b6d83d06b423e26895b07056","observation_id":"4e81728e-ab1f-4880-a6ab-9b88524bc37a","resolution":{"observed_at":"2026-08-07T12:27:29.656297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04060","last_updated":"2025-04-22T07:59:31Z","snapshot_observed_at":"2026-08-07T16:08:27.561459Z","submitted_at":"2025-04-05T04:57:12Z","title":"VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04060","snapshot_observed_at":"2026-08-07T12:27:29.799802Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.799802Z"},"links":{"cited_paper":"/paper/2504.04060","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:3ff49702275df04c7e7abe3a213945a12a9d3a16927295ce60f5d71446822390","observation_id":"4072c288-ec98-4003-8ff6-bdcc3fc82fba","resolution":{"observed_at":"2026-08-07T12:27:29.799802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T12:27:29.941725Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.941725Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:83d97ec5be302f5cd2418492837b6376bb91a3e0022c30381b4f39cef96fffe3","observation_id":"ee274426-26c7-41a7-83ea-6e304359fe61","resolution":{"observed_at":"2026-08-07T12:27:29.941725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-07T12:27:30.047060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.047060Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:ba7bf747c4f680d02c9ee94ec2b2da2ccc8430ca549e37b2db2935247f1526f1","observation_id":"1681cb1f-31c1-41c1-a254-49e330700f19","resolution":{"observed_at":"2026-08-07T12:27:30.047060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T12:27:30.136628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.136628Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:fe5d552421856c338b17ac9472fd2a54d146342bf263a175005415e38a8905e6","observation_id":"05bcfd94-028f-404c-86a9-ce88db9cb736","resolution":{"observed_at":"2026-08-07T12:27:30.136628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.861332Z","title":null,"venue":null,"work_id":"e842905d-9a8d-430e-af15-cb43fc629279","year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.198123Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:5afe116b5c9045aaab4334e55a2c21995a989848b6d0a94cdf62481d7036d0e7","observation_id":"e80bb3a2-ddd5-4cec-b903-be5f1ad0f61d","resolution":{"observed_at":"2026-08-07T12:27:31.928376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-07-06T19:08:09.037019Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-07T12:27:30.294583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.294583Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:9d6b5abac70bd9ee15ab0a555a45a1503ac4e55d98bcc9cf841bc7eb38299a2b","observation_id":"68424da3-44ef-427b-8bc8-191d0020f98c","resolution":{"observed_at":"2026-08-07T12:27:30.294583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.717547Z","title":null,"venue":null,"work_id":"66d3eb0d-082f-4869-93db-92c70ef19f5f","year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.408972Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:95dcbd0cfb6202815c1c35abe514697ce64dd4fac4693af0577908749bbe8622","observation_id":"cd4cc1ab-fa79-4a54-947f-2a87b497e724","resolution":{"observed_at":"2026-08-07T12:27:31.763814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.480580Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.480580Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:6a3238f4c4e58bfad6f28cec5a375f871a146a2bd0d9d2e9c5e8f38ef3891cac","observation_id":"2fdcfe29-5aad-4dd9-8383-9aa86becdca2","resolution":{"observed_at":"2026-08-07T12:27:30.480580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T12:27:30.556326Z","title":"Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.556326Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:c3882d61d0f8dfdbfc5ed87e765a2635b67a478ceac8afda94e45be835863138","observation_id":"740be111-7553-461f-b72b-20d9ddaa4162","resolution":{"observed_at":"2026-08-07T12:27:30.556326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T12:27:30.730309Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.730309Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:e061f73e805b85fe2e99cfb28eb54bdb7d6d64a8aa052de68b05d2826fb8aca0","observation_id":"dbc5ac70-5974-4e85-8076-9615b6a0b18e","resolution":{"observed_at":"2026-08-07T12:27:30.730309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T12:27:30.804516Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.804516Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:a8d745fa234c2d3887c6ab16866d51cb020c26a9f84869d86b068245ab21aa3c","observation_id":"d5f0d1cd-218f-4da7-ac90-59d6970cf277","resolution":{"observed_at":"2026-08-07T12:27:30.804516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.224482Z","title":"Frontiers in Communication 3 (2018), 25","venue":null,"work_id":"f2a7c3d2-8b1c-4cf8-9fad-e605c3f576c3","year":2018},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.359500Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:4d484c19ae2cf42a6b1c291d12e5bfc82bb530d3443e69c868afc9a86fb58c99","observation_id":"fa6e1986-3774-4bbe-82ef-ebc2b9637baf","resolution":{"observed_at":"2026-08-07T12:27:33.286849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.036096Z","title":"Nature Communications 16, 1 (2025), 803","venue":null,"work_id":"c8a1c7b0-dcf5-4a3c-b5e6-3cce7e2d98cc","year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.512154Z"},"links":{"citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:2ff42745c2366ac512e0e2bc3fabdaa4f9bf5836924353c857970e251ce92f7d","observation_id":"5e6daf83-adb9-4827-9bec-cf163542bb2c","resolution":{"observed_at":"2026-08-07T12:27:32.110037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2505.24496."}