{"as_of":"2026-08-16T08:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38fe4a25519ea127a27cc71422736c7857b809f99529935dd2f599a62a3dc13e","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:15:23.055549Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08286/citation-record","integrity":"/paper/2608.08286/integrity","json":"/paper/2608.08286/citation-record.json","paper":"/paper/2608.08286"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-12T00:15:22.966458Z","title":"LucaDellaLibera,FrancescoPaissan,CemSubakan,andMirco Ravanelli","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.966458Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:f9307cc382234305dd79f62b13a8746895c90a989ba281ae7138aeb2b7b9ad49","observation_id":"b750918b-8b95-4e55-9042-cf6776c0b7fb","resolution":{"observed_at":"2026-08-12T00:15:22.966458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05299","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.712204Z","title":null,"venue":null,"work_id":"f512a647-6196-4aa7-9b30-7409be2f3b96","year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.969847Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:5698459a7fb0bf2d08ffaabf9752c29d30178d557628ad97e600ec7bf884df0b","observation_id":"2cdbb5ac-acb0-4bf6-b5e8-1379f62bb23d","resolution":{"observed_at":"2026-08-12T00:15:23.716930Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-12T00:15:22.972684Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.972684Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:4cea067be448124e1aa8a68fe883d944f1601be901a961f1759cfc854fde0377","observation_id":"4cafe02c-b60c-4800-9652-81b9419f94f3","resolution":{"observed_at":"2026-08-12T00:15:22.972684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.423","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.113133Z","title":"16 YiweiGuo,ZhihanLi,ChenpengDu,HankunWang,XieChen, and Kai Yu","venue":null,"work_id":"9e622b7d-1dc1-483a-a580-b89db4f03004","year":2026},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.976967Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:7880b660d07b48cf8d18c2f0b7d94ac9ffaa95ae65463de622df3ee3b810524c","observation_id":"85648047-3cb3-4e35-b1c2-735661c22afe","resolution":{"observed_at":"2026-08-12T00:15:23.116937Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-13T18:08:04.369199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T18:08:04.369199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2025-1106","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.101283Z","title":"NadavHar-Tuv,OrTal,andYossiAdi","venue":null,"work_id":"00a25e41-e229-45e0-93cf-71917afec20e","year":2025},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.980061Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:eddbced0a05eb2b35428c57d5b374af94660ff6f5d58a015ee2ff97cbad51df2","observation_id":"c7876959-d0f1-4515-8286-e7a222a7e710","resolution":{"observed_at":"2026-08-12T00:15:23.106902Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-13T18:08:04.476783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T18:08:04.476783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:22.986532Z","title":"Harry Julian, Rachel Beeson, Lohith Konathala, Johanna Ulin, and Jiameng Gao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.986532Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:80fe49faf24cc89ebfd8739726fc43b97c2df6354a2e79057f63b69120e1ac11","observation_id":"78c4e1da-8186-4199-81db-0b9f26c668a6","resolution":{"observed_at":"2026-08-12T00:15:22.986532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09550","last_updated":"2025-09-12T06:43:25Z","snapshot_observed_at":"2026-08-11T13:43:56.973470Z","submitted_at":"2025-09-11T15:39:59Z","title":"Finite Scalar Quantization Enables Redundant and Transmission-Robust Neural Audio Compression at Low Bit-rates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09550","snapshot_observed_at":"2026-08-12T00:15:22.989838Z","title":"Jungil Kong, Jaehyeon Kim, and Jaekyoung Bae","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.989838Z"},"links":{"cited_paper":"/paper/2509.09550","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:177dd656000b1106dfca3ccf607dda053742ac6ff2ebff462f7068e6ae5cf45b","observation_id":"e7566782-808e-4cb6-ab93-18919a4410d6","resolution":{"observed_at":"2026-08-12T00:15:22.989838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.767688Z","title":"Montreal forced aligner: Trainable text-speech alignment using Kaldi","venue":null,"work_id":"34ed12d4-925e-4e51-b8c6-8c059746a6fa","year":2017},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.994783Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:2417e0c4c8854980a98bdb623b560d26189dd55a7df944e406d87341a32b94fa","observation_id":"3791d20b-f13b-4c85-addc-9828bfc49cd0","resolution":{"observed_at":"2026-08-12T00:15:23.772910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-2135","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.077727Z","title":"Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur","venue":null,"work_id":"3e6c90b7-a6ac-4cc0-89a9-627461e1d6b9","year":2024},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.013594Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:613e31ee5a7be550d84c36a3c15b3d64d9b8523bf795c1910844a4f493a7804c","observation_id":"e61731eb-39d7-4959-a2b6-697f3f267a64","resolution":{"observed_at":"2026-08-12T00:15:23.082455Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-13T18:08:04.944743+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T18:08:04.944743+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-15T12:11:16.120794Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-12T00:15:23.020983Z","title":"Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, and Hiroshi Saruwatari","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.020983Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:a27eeaf98510d2496a32d5c3a89277d9d903e370acf6e2da3b1811fee2ff340e","observation_id":"78820abc-3b26-4e8f-b799-c9ffb95c07a7","resolution":{"observed_at":"2026-08-12T00:15:23.020983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-13T16:08:20.566487Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-12T00:15:23.024338Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.024338Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:180786c8b002707ccc3196e0f436b83d8c2aeea2d6551a4ee394df6d5b16ba74","observation_id":"1e4b5ed5-0c19-49f4-8d7f-5b9810faf0ec","resolution":{"observed_at":"2026-08-12T00:15:23.024338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00385","last_updated":"2025-05-31T04:31:02Z","snapshot_observed_at":"2026-08-12T05:59:14.233667Z","submitted_at":"2025-05-31T04:31:02Z","title":"MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00385","snapshot_observed_at":"2026-08-12T00:15:23.032346Z","title":"Laurin Wagner, Bernhard Thallinger, Miroslav Stankovic, and Mario Zusag","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.032346Z"},"links":{"cited_paper":"/paper/2506.00385","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:15a3b0ac23139a97142bb0a99c60d244fccb354157837a4cada9aa66ab5c80c1","observation_id":"0e13cfd5-72e7-48c3-8426-d5203d46a295","resolution":{"observed_at":"2026-08-12T00:15:23.032346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"cited_work":{"arxiv_id":"2607.19033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.19033","snapshot_observed_at":"2026-08-12T00:15:23.475461Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","venue":"cs.CL","work_id":"aa187c95-b501-44e3-a22a-8e9de2ff3257","year":2026},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.039683Z"},"links":{"cited_paper":"/paper/2607.19033","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:3ec8e4e8cdce435fef2ba58878beb6c15dd0e12e651fbb3e50a70d43199b0dad","observation_id":"8f600229-0b91-43ba-9765-7dbfcefa954f","resolution":{"observed_at":"2026-08-12T00:15:23.478725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.042977Z","title":"Yuancheng Wang, Haoyue Zhan, Liwei Liu, Ruihong Zeng, Haotian Guo, Jiachen Zheng, Qiang Zhang, Xueyao Zhang, Shunsi Zhang, and Zhizheng Wu","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.042977Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:443477b9680fb697d706ea2939968caaa960ee9c5b4f7dd10e66177f1137ab42","observation_id":"19fe2a0b-5d0b-430a-9885-8f3e678956f9","resolution":{"observed_at":"2026-08-12T00:15:23.042977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.046190Z","title":"Detai Xin, Xu Tan, Shinnosuke Takamichi, and Hiroshi Saruwatari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.046190Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:adca892b0baafdda96f12119c254826e908a895b46e7d37cb2420a1d15247f71","observation_id":"d910d2a4-a97d-46fd-b6af-db581bfa13d3","resolution":{"observed_at":"2026-08-12T00:15:23.046190Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2407.10671","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.317736Z","title":"An Yang et al","venue":null,"work_id":"9dfcc274-e8a2-4249-bb6a-47240fd3ce0f","year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.049313Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:d5dd01356b4ff71d845db96aec33ac9cc50628035323dad78bf584b1e44a6c16","observation_id":"de98056c-99a6-4a4a-ae4c-b4ef6728cb0d","resolution":{"observed_at":"2026-08-12T00:15:23.320953Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-11T13:49:10.843528+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T13:49:10.843528+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-12T00:15:23.052303Z","title":"DongchaoYang,HaohanGuo,YuanyuanWang,RongjieHuang, XiangLi,XuTan,XixinWu,andHelenMeng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.052303Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:53049e201c04adff9f981524230c7872fd50889acd405c310053e0e4757cd077","observation_id":"51606635-d0c9-4acd-8ae2-23c75d0c566c","resolution":{"observed_at":"2026-08-12T00:15:23.052303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.055549Z","title":"Xin Zhang, Dong Zhang, Shimin Li, Yaqian Zhou, and Xipeng Qiu","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.055549Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:c249653188a1142e373c3e2ca4aefddd83af779f5dec280c24b567633cafcbc7","observation_id":"1ddde720-ecad-422b-8964-00b9c9ef1c70","resolution":{"observed_at":"2026-08-12T00:15:23.055549Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.7178","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:23.593645Z","title":null,"venue":null,"work_id":"d43f91f0-0b8b-44f3-8b31-0a5aa6392d05","year":2015},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.017011Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:6173691807b1fed598013713032f53d1cd3be98f23463732bdc491542201d7ca","observation_id":"3c3ffca4-fce9-462f-916b-a4fb3d0967ea","resolution":{"observed_at":"2026-08-12T00:15:23.598627Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:22.998055Z","title":"Pooneh Mousavi, Jarod Duret, Salah Zaiem, Luca Della Libera, Artem Ploujnikov, Cem Subakan, and Mirco Ravanelli","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.998055Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:3919ab25064b1e79df4a542968ebb854f58ce66ecaa5a80b9a872ac5000a896d","observation_id":"e3db7876-5287-4fe0-ac6d-b954b0f0a347","resolution":{"observed_at":"2026-08-12T00:15:22.998055Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-12T00:15:22.983028Z","title":"Qwen3-TTS technical report, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.983028Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:c707eca840e53f02fdbc4f1d6df0dda4e718f8f9798298b0e7922b2903753058","observation_id":"f6f5a47b-d744-4265-a5a9-2e296c29b069","resolution":{"observed_at":"2026-08-12T00:15:22.983028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T00:15:22.963072Z","title":"Alexandre Défossez, Laurent Mazaré, Manu Orsini, Amélie Royer, Patrick Pérez, Hervé Jégou, Edouard Grave, and Neil Zeghidour","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.963072Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:f71bebe09574a28fa019927281d19c92e8f526dd9909c7a6a46e01fa9b151c51","observation_id":"b45f9ab1-6ed2-4ca9-bedf-ac2352ae781a","resolution":{"observed_at":"2026-08-12T00:15:22.963072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-14T06:59:09.454627Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-12T00:15:23.027676Z","title":"Hubert Siuzdak","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.027676Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:6c7859961b9ca1b7478d0056b1b368df92732baf5a959f70c93fd21ee5024ddb","observation_id":"cb07ca61-e82c-45c3-a0a8-9ccbe848488a","resolution":{"observed_at":"2026-08-12T00:15:23.027676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-15T19:06:12.976129Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-12T00:15:22.951195Z","title":"Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang,JianZhao,KaiYu,andXieChen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.951195Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:fdad63eaf3346e98c7963435c0166f196697627c5b4cda9681419f2424896a64","observation_id":"7e2eb48c-4064-4630-a7c3-89ab44b59d4b","resolution":{"observed_at":"2026-08-12T00:15:22.951195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:22.955426Z","title":"Yushen Chen, Kai Hu, Long Zhou, Shulin Feng, Xusheng Yang, Hangting Chen, and Xie Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.955426Z"},"links":{"citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:a6a12aa44d1949aea4b355f28a4d5e68c5a7f197ac18087228166f6d6d83872e","observation_id":"f7c4e0b9-93a1-44fb-bb2a-67184bdb22dc","resolution":{"observed_at":"2026-08-12T00:15:22.955426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12383","last_updated":"2026-05-25T07:44:26Z","snapshot_observed_at":"2026-08-13T12:32:29.342842Z","submitted_at":"2026-04-14T07:17:55Z","title":"On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12383","snapshot_observed_at":"2026-08-12T00:15:22.959556Z","title":"Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:22.959556Z"},"links":{"cited_paper":"/paper/2604.12383","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:c66009489af9dc319bbf53f7c0cd348fc62d0a1bf60fc1bc41afe51c426fc80f","observation_id":"ff2a4f74-3c11-4560-a2aa-5a0385ce0fb6","resolution":{"observed_at":"2026-08-12T00:15:22.959556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":6,"verified_fuzzy":1},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2608.08286."}