{"as_of":"2026-08-06T04:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2b2af9c055d35f98d3bd48e2c99a51fc2009edf9b4a3c9aed25b09cb716d1a6","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T05:20:49.952030Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.04418/citation-record","integrity":"/paper/2606.04418/integrity","json":"/paper/2606.04418/citation-record.json","paper":"/paper/2606.04418"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.00594","last_updated":"2026-05-05T13:18:46Z","snapshot_observed_at":"2026-07-06T22:43:55.785732Z","submitted_at":"2026-01-31T08:20:39Z","title":"Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":"2602.00594","doi":"10.48550/arxiv.2602.00594","metadata_source":"pith","pith_arxiv_id":"2602.00594","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling","venue":"cs.CL","work_id":"31b0b3ce-06a6-4156-b0d6-9014a0723c52","year":2026},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2602.00594","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:8dd15fd35be7820f8329c2d2c75064e6fb08d8c9b12a87cc7042967fdb405b1e","observation_id":"35573f12-6d52-4096-8d69-969cca7b64d3","resolution":{"observed_at":"2026-06-28T05:21:39.869212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8485.2024","doi":"10.1109/icassp48485.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://dx.doi.org/10.1109/ICASSP48485.2024.10447579","venue":null,"work_id":"c4a0500e-cb13-456d-825a-73ad45e75f95","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:8fc6487e9e02d97d83a082804a6e6f06f180fba8d44de13c0cbee88e7f0d952f","observation_id":"9c2578c1-928e-422a-bd70-3173d739cb81","resolution":{"observed_at":"2026-06-28T05:21:39.847082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2018-993","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attentive Statistics Pooling for Deep Speaker Embedding , booktitle =","venue":null,"work_id":"6f384cbe-5945-4b3c-b7af-41ae76698e48","year":2018},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:59a519a5e2aa8333d4a13c9f44cbae3c1cf1f2f4841affa3a7a470ab1a4e0cf5","observation_id":"bd04bbec-8e24-4d2c-818b-167f0737bb4b","resolution":{"observed_at":"2026-06-28T05:21:39.863130Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1070.2023","doi":"10.1109/iccv51070.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2023 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"b8a8bb9e-1d31-40e2-9cab-ae21e338dde6","year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:bba4731435ca04b4100a1001298edce00108cd7bb5a85c2546f214fc868a6215","observation_id":"7c97e162-ed0c-4bea-8229-8a427656cdbd","resolution":{"observed_at":"2026-06-28T05:21:39.830247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3922.2022","doi":"10.1109/icassp43922.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Zhou, A","venue":null,"work_id":"ad61b46b-30ce-4e77-9b24-298e8b28f2dd","year":2022},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:8afffeef6a13dba5d747f3df6d6a562ed8b31b93567baf29a0ebecdb5c678027","observation_id":"4e1b6965-9f57-4cd4-8bff-78b4d542c552","resolution":{"observed_at":"2026-06-28T05:21:39.843477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T00:50:01.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T00:50:01.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-07-06T22:02:36.959365Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"cited_work":{"arxiv_id":"2507.18897","doi":"10.48550/arxiv.2507.18897","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InICASSP 2021-2021 IEEE International Conference on Acous- tics, Speech and Signal Processing (ICASSP), pages 606–610","venue":"ArXiv.org","work_id":"40938cf7-d6bd-47f1-a2cd-45e37adda59c","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2507.18897","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:56d6162766b9deeedc1e43817f59f53cb1080c2c9a4482cfd8a5c423bf9abc20","observation_id":"4fd98e9a-bfcf-4e56-bc5f-8fea8212fb17","resolution":{"observed_at":"2026-06-28T05:21:39.776420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2688.2022","doi":"10.1109/cvpr52688.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"0a23d1b7-bd56-43cc-8a80-7c43ce994e1e","year":2022},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:64774645a0f87ceb5609bf7fe8d567ec56a8e4de47efbffa386d7772d7487527","observation_id":"97e38ae8-bcfa-4288-9f88-27e4c026daf9","resolution":{"observed_at":"2026-06-28T05:21:39.839310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":"2503.01710","doi":"10.48550/arxiv.2503.01710","metadata_source":"pith","pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","venue":"cs.SD","work_id":"31f99dad-40ae-4a19-aeff-eafa54f5b42a","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:c51a4023df39d837d80ef1c162e11d417b7c33bc6aec3925cd94ea4f9b7c65bb","observation_id":"3174fc14-969f-4e16-b1f8-dda8ee890e65","resolution":{"observed_at":"2026-06-28T05:21:39.804685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2020-2650","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ECAPA- TDNN: Emphasized Channel Attention, Propagation and Ag- gregation in TDNN Based Speaker Verification","venue":"Interspeech 2020","work_id":"4688853f-0796-4060-b054-238bc2bbd612","year":2020},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:559f1cb909fdbed6eeb7bc9efdc0f6081a47cb63c8bbbac44c387a2ea676bd25","observation_id":"95eee689-4932-446a-956a-1495335b02e5","resolution":{"observed_at":"2026-06-28T05:21:39.835969Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:49:26.178833+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:49:26.178833+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.846137","doi":"10.1109/icassp.2018.8461375","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Khudanpur, S","venue":null,"work_id":"cb04757e-5e12-4114-b15c-8dfdb78276ec","year":2018},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:94e5c036fe5ea54af8e096d745b8cd130fe68896f02744fd184ba444431e9e51","observation_id":"9b1025b7-e108-4949-883a-aab276e2864f","resolution":{"observed_at":"2026-06-28T05:21:39.816980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T17:53:55.991667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T17:53:55.991667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.318811","doi":"10.1109/jstsp.2022.3188113","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html","venue":"IEEE Journal of Selected Topics in Signal Processing","work_id":"7d155bea-12ee-4311-9cc9-09e1315de397","year":2022},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:116b38aadbdf3b621e8c1a08c4487c66b349dcf0ee9063479e5e48c5f09accbe","observation_id":"dc34fffa-5700-4974-819e-68397651b6f7","resolution":{"observed_at":"2026-06-28T05:21:39.791932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:49:45.636217+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:49:45.636217+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.312229","doi":"10.1109/taslp.2021.3122291","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units","venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"01bc0841-3ef8-4720-9eb0-fe0a5a831e62","year":2021},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:b69e98475f848b58e7e15e7eb6e3df7ec061882c33a8e044fa52829a96463e4d","observation_id":"74dbc207-449a-42af-a47c-bf2e2be74fd4","resolution":{"observed_at":"2026-06-28T05:21:39.790085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:33.939513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:33.939513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"wav2vec 2.0:","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:e2512631c798bbd7799be6f9013c6073a685687f36fe3828ff4e0a818915ab00","observation_id":"7872efa4-430f-4b19-83f5-e6d925f66af7","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"Neural Discrete Representation Learning , booktitle =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:d9ecb5185dc3ffbc9d0fb6207a9c84af6517ccb579f6e978cd00004c37b1d0ca","observation_id":"d6c85265-6a8c-4b63-b637-cff10b36e87d","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:195636a05b297a99ac8844740458d1437f9c87bb97dcc5d44b84fd7f6fcdba10","observation_id":"641224f9-d03d-4917-b45f-8828ef06a1c4","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:fe3d071ce482bf9cf0136fda177537b870d1cef9cf7146e5159d55016362c602","observation_id":"433ec5b2-1545-488d-9fa3-90d9737a9233","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis , booktitle =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:860bdf2a9c57cba2be715952a84070aac0494a9a4e20946b04060adf4c45b67a","observation_id":"5990753a-b156-4d5e-902b-383be41dde78","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"High Fidelity Neural Audio Compression , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:dab5dcd10a0917cb53fc721cdb7b0bfd506cf607060059770b775193d9db196b","observation_id":"61b3cb67-83fd-4d57-ad9e-76af0bc9e056","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"High-Fidelity Audio Compression with Improved","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:e9b4ef6ee42881bc6b618a5f9459473882029e8153f37c312a8ff4c98c3d4a9c","observation_id":"46c7a0be-3b9b-4bfc-b1bd-6d1aa08827bc","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1559","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation , booktitle =","venue":null,"work_id":"0b387692-e053-4c41-a27b-609bff5fc79d","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:85fa6039369e54fb987dac3260a4aa0cc2d8cd2b5cf12c08a62adc9c4f81571f","observation_id":"56ef43fb-16ff-497b-941b-427fb1ab3497","resolution":{"observed_at":"2026-06-28T05:21:39.855452Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.04465","doi":"10.48550/arxiv.2502.04465","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Focalcodec: Low-bitrate speech coding via focal modulation networks","venue":"ArXiv.org","work_id":"487890a0-b141-492c-8f4b-6ca1cd2526ed","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:c771453051b4d8fbd890f6371815f9a2fb15aa1a5f532fe51b8be43383aa4aed","observation_id":"86d262d4-58ba-4b0e-b2f4-ed7c3f780bd6","resolution":{"observed_at":"2026-06-28T05:21:39.860903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":"2508.19205","doi":"10.48550/arxiv.2508.19205","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vibevoice technical report","venue":"arXiv (Cornell University)","work_id":"6d46a99d-ed41-4221-8fbe-35859ee85e2d","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:346efbbffdc6eb179d97830fd465a3d0d933e07fdc93d5ced8a0377e91cc5605","observation_id":"5224681c-b3d5-4408-82f3-594a74bd512d","resolution":{"observed_at":"2026-06-28T05:21:39.852485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:665b710836c5ee5762097a340da3d4ee361b1c30c6d499d00dfcb14ec826c46c","observation_id":"dca2dab1-3332-4b84-8c17-c065c96ac84c","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2502.04128","doi":"10.48550/arxiv.2502.04128","metadata_source":"pith","pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":"eess.AS","work_id":"7e72b079-ae3c-4584-aead-bab435ab5950","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:407f81e78d426abfe838125f5d9923b27c4ca39d0e52f04113222f732f6f0912","observation_id":"534e3033-9c5b-40ec-87db-62011f4ff70d","resolution":{"observed_at":"2026-06-28T05:21:39.866030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1016","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UnivNet:","venue":null,"work_id":"a6366ddc-a7d5-4227-bf77-84fdeeb95312","year":2021},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:7f1c7960a1b3c01969dfdf872bba2f57181afab2cc315a8ffe7088aa061e96b2","observation_id":"2e723673-d047-4408-a420-3eaab5c0fd44","resolution":{"observed_at":"2026-06-28T05:21:39.824795Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T09:49:56.484301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T09:49:56.484301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"BigVGAN:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:6d4541d2598179d45d666d6b3c0f57dc422b06e924f8c4b156eff645a2dd3393","observation_id":"99ccfa1c-cb5c-4245-9d41-c41843f7f2ef","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:b4774ebd04b4c096cd3f1777c137f21f30a42dafd05df8ffbc45a5110cd8b97f","observation_id":"5dabbddb-8d36-4852-8cc6-b8948af088d5","resolution":{"observed_at":"2026-06-28T05:21:39.857848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:3934b24f6b4ca3824e7144d48c57e833a9917043ab1991ea153038b9122ce226","observation_id":"8c2e8bca-077e-4e20-bef8-d007808562f9","resolution":{"observed_at":"2026-06-28T05:21:39.772589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14128","doi":"10.48550/arxiv.2509.14128","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2509.14128 , year =","venue":"ArXiv.org","work_id":"7cfdf406-6e6c-4f9d-8072-9e9796b4ced8","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:dcae9a8052a7c6c26dc358b7735fc15bb9fca4b6bf40b2e4cc868e493a9b5af0","observation_id":"c3485699-94bc-4197-95ec-da97668ac4a9","resolution":{"observed_at":"2026-06-28T05:21:39.807860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-439","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Interspeech 2022","venue":"Interspeech 2022","work_id":"e2710c48-0be2-462f-8daf-593a4233fd65","year":2022},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:663a3cd39701a23509deb71cc9583c1e9ea99cbeb4f21e23f147d0892993bf57","observation_id":"13dade32-c32f-43ef-8740-80457b84f0be","resolution":{"observed_at":"2026-06-28T05:21:39.862974Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.806787+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.806787+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9357.2023","doi":"10.1109/icassp49357.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: ICASSP 2023 - 2023 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"d4aa6117-860d-404b-ac11-39169a0ac02c","year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:ccc263b9986d46cc7e4b8130eb2c749e9aae20ca68a899710f68ee8f0796d134","observation_id":"f2cbe538-2a52-4994-8ce9-0a854cd1a3f7","resolution":{"observed_at":"2026-06-28T05:21:39.835550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-2116","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reshape Dimensions Network for Speaker Recognition","venue":"Interspeech 2024","work_id":"7395be17-a8ff-4ee6-97fd-d6b57e6878bc","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:0455a85ce5e43dd51eaaeaf0adb34c0bed596da95c895343672e02a905a343d2","observation_id":"70c309cd-fd0e-4d55-90b0-8a1de86ab0f5","resolution":{"observed_at":"2026-06-28T05:21:39.849229Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T17:53:58.809714+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T17:53:58.809714+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"C Users J","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:e653965b18d23584862b09a769eacfd1f455a63475796400127f70b8bc5e9633","observation_id":"611a5e2d-f0e4-437a-bfb9-744acbbd9f58","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"Gray , title=","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:613fcda41e944975bebe88d714bf16978c23788859a0cd2065cc1e2f927f94df","observation_id":"47b49f36-2feb-4c52-873b-3736084ae197","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/s101211259","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sensors , volume =","venue":"Sensors","work_id":"e943527e-7f2a-4817-b342-a3a8d416e3bd","year":2010},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:134ef63f7d19611904ecc03c9b8b5dd5aedc4816f7c0bca6a7afd1679466933f","observation_id":"286f5cff-c65f-4896-a739-080252b1c75e","resolution":{"observed_at":"2026-06-28T05:21:39.792454Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"Neural computation , volume=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:7f849f36ea23199789cff298426e690da83de6772a7c2daed9f48c1230f68b87","observation_id":"394623c8-11e0-43c3-89bd-80e664631a86","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1584","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","venue":null,"work_id":"785b19a2-87eb-47b4-bad9-92044904a7fa","year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:8fcf98a1ed2aae34195aa458aff90c157d083874a03168d5853398cfc6efdf9b","observation_id":"142cc661-e6ce-4873-b5e0-316f87edd103","resolution":{"observed_at":"2026-06-28T05:21:39.860420Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.15907","doi":"10.48550/arxiv.2501.15907","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emilia: A large-scale, extensive, multilin- gual, and diverse dataset for speech generation","venue":"arXiv (Cornell University)","work_id":"4a6ce565-770f-41dc-b23b-3f5f048bf113","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:0f35ee27361ae1311119ed1ed0572a9b3fbb429b3467272db7c64ba2716ecdf0","observation_id":"e6fdd493-b935-49df-8143-53f7fd9b854d","resolution":{"observed_at":"2026-06-28T05:21:39.814083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1965","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GigaSpeech: An Evolving, Multi-Domain","venue":null,"work_id":"d4ad6855-c32d-4a01-8e81-b0c9f2308607","year":2021},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:3f306f9ce17608cfdef4b4fc7bc1e69d236cf2bb9575effa198dc558a1e5f150","observation_id":"b0620059-3141-41b9-8a55-c5098ddaf857","resolution":{"observed_at":"2026-06-28T05:21:39.827386Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1905","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , booktitle =","venue":null,"work_id":"52ba3005-106a-443d-ae07-564dcdcb5bfa","year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:ec8480f53cb2d96d9e57c7b56ee67db61b8bda269ef8f4a6aaea0db9083e05de","observation_id":"43d54c4f-67a3-4593-9612-a003da37fcd7","resolution":{"observed_at":"2026-06-28T05:21:39.830094Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4892.2023","doi":"10.1109/slt54892.2023.10022601","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","venue":"2022 IEEE Spoken Language Technology Workshop (SLT)","work_id":"40fae33b-9fae-463c-a675-eb181eb874ec","year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:f0b822518ad368d995e2ab38cd7fd76889fcd3a190da19e7674e4154ef52564a","observation_id":"baa303eb-3ffa-40bf-9cbc-c5ba33564e56","resolution":{"observed_at":"2026-06-28T05:21:39.844230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:f25032212700cdea79c6b3a2d0221ef7fb3d771538b1e8c3deaee668179c4a23","observation_id":"4025d02d-9805-4f45-bf49-324464bc4ed5","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8485.2024","doi":"10.1109/icassp48485.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://dx.doi.org/10.1109/ICASSP48485.2024.10447579","venue":null,"work_id":"c4a0500e-cb13-456d-825a-73ad45e75f95","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:93b20e93407059d2fd0b8c47b7bef4e550b4e291650efdffb945b28b642b7d11","observation_id":"005ced62-6479-4db8-884e-cd8d05a0f791","resolution":{"observed_at":"2026-06-28T05:21:39.838702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:35b7cc32a83e5eacef37a58558237aa20a5a52de2b6f824fcf6b86c1edeeec80","observation_id":"e4465350-649e-44f5-b8ea-3416ec4e05fb","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-2441","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu","venue":null,"work_id":"82062014-09e6-4a32-9daa-dc3712dea0c5","year":2019},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:b61e7fee60cb1faa8a65f52cf3dc61531ef9c64bed6a22c53a0368ca8abdf99f","observation_id":"ab74e4b5-93f3-4ec9-87cf-55ea663dbaa3","resolution":{"observed_at":"2026-06-28T05:21:39.845584Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T09:49:57.294935+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T09:49:57.294935+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"Simple and Controllable Music Generation , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:9fbf6d63854dc82c197750e45c8deb3b12ed1b52c6c8662b6af3c3b93e288232","observation_id":"69c5bc55-6f47-4062-b342-88c466535288","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:5c15445cad73df925172b5544d2385b4ec0a935559bdc68166b8feff8effb7fd","observation_id":"56cca99c-ac62-4935-844d-3307dc3e73b2","resolution":{"observed_at":"2026-06-28T05:21:39.872068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17052","doi":"10.48550/arxiv.2509.17052","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sidon: Fast and robust open-source multilingual speech restoration for large-scale dataset cleansing","venue":"arXiv (Cornell University)","work_id":"44af7233-5aae-4d90-9435-fce1ce78ea3f","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:8692e07df923116afad8bdf9bd47b759dd56aeb7762aa2e834757e855e646e9f","observation_id":"29d8c45d-976f-4774-9f78-fcce42560d97","resolution":{"observed_at":"2026-06-28T05:21:39.851036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.846131","doi":"10.1109/icassp.2018.8461310","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pyroomacoustics: A python package for audio room simulation and array processing algorithms,","venue":null,"work_id":"ad859377-e408-4a5c-b4b7-71f8eab8ec61","year":2018},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:1c36cc4b3ed0a93b8604c76ce82264fae27d48502daa8903b0d87c2259d6225e","observation_id":"72c82a01-9826-47e1-8ef5-7b649dee5955","resolution":{"observed_at":"2026-06-28T05:21:39.819911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.795226","doi":"10.1109/icassp.2017.7952261","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemmeke, Daniel P","venue":null,"work_id":"5f4fb44f-6e07-4cb7-816f-efe601e93294","year":2017},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:2eb7d2c8004883bfbaad10866d62a1cdad61446a5e303cf7b576063402137f8f","observation_id":"a24b9e12-0c1b-4104-ab1b-984c3ed6cd86","resolution":{"observed_at":"2026-06-28T05:21:39.806809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T14:20:41.234855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T14:20:41.234855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.313320","doi":"10.1109/taslp.2021.3133208","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ericsson, L., Espinosa, M., Yang, C., Antoniou, A., Storkey, A., Cohen, S","venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"75a3a79d-8018-497c-81de-21e29215b542","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:6e74d09153b0944ca02e5b833321b909e485479e8258c0d6f24fa796499a4faf","observation_id":"635c1b9b-3348-4b19-9b35-908219e1aec9","resolution":{"observed_at":"2026-06-28T05:21:39.798843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-2821","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WHAM!: Extending speech separation to noisy environments","venue":null,"work_id":"cd485890-0dbb-4435-8640-2a8df071ba3d","year":2019},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:8cbd3a995c3f541168ad6d2e3f263d93a208e1a8effa3a9b96939ebc6ebbc55d","observation_id":"590af918-c75e-4743-b6c7-2417f413d59b","resolution":{"observed_at":"2026-06-28T05:21:39.803724Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-07-06T10:07:08.388976Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:0c7c264614c745333ef33ea8460cc4113b25ac7f18ba357d08af9685daaec445","observation_id":"69a15ad5-1818-4586-ad04-70fbff2f53cc","resolution":{"observed_at":"2026-07-02T09:56:51.761438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2017-950","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VoxCeleb: A Large-Scale Speaker Identification Dataset","venue":"Interspeech 2017","work_id":"e26dc880-e8c4-46e6-aec7-37c3e215c4b6","year":2017},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:924074e7dac7b5f79bfab582680713cb26a82232fe53d5c1925c9fd0f57fe0f7","observation_id":"831b6115-b449-40ae-8567-677fbb583546","resolution":{"observed_at":"2026-06-28T05:21:39.853383Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:d3d7fbccfb455d975b1332370049e10c7f9827fc8af94efe3eb53d024ad04bc6","observation_id":"0209404c-e9bb-4f67-b002-953f162dc551","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:0f855271def9e27efa9268ebbd08a573e22ae0db28fb137ebb61925fbf3dbf32","observation_id":"46ebadd5-dedc-4f62-b567-e0c5fccbeb1e","resolution":{"observed_at":"2026-06-28T05:21:39.848241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T05:20:49.952030Z","title":"Parker and Anton Smirnov and Jordi Pons and CJ Carr and Zack Zukowski and Zach Evans and Xubo Liu , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:adf5fe24adcff8e8a6603af8c77c5213e367766f3968567850e3f89ff2237dda","observation_id":"ef916669-df6c-4c35-a6fc-11524f13bb13","resolution":{"observed_at":"2026-06-28T05:20:49.952030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2025-468","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DualCodec:","venue":null,"work_id":"df393cf9-adf4-48b6-b08f-e6774bd9ec80","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:ca7bd24be9f2f43ea293f954e897be1099df487bf65bea358ce06653370d5c9a","observation_id":"93bdf356-00d5-4e9f-ac77-e60a68e8d3cd","resolution":{"observed_at":"2026-06-28T05:21:39.854490Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02702","last_updated":"2024-11-21T10:31:03Z","snapshot_observed_at":"2026-07-06T17:55:08.182604Z","submitted_at":"2024-04-03T13:00:08Z","title":"PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders","version":3},"cited_work":{"arxiv_id":"2404.02702","doi":"10.48550/arxiv.2404.02702","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02702","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Promptcodec: High-fidelity neural speech codec using disentangled representation learning based adaptive feature-aware prompt encoders","venue":"arXiv (Cornell University)","work_id":"f48155d4-5798-4179-ab1a-b7d138168ffd","year":2024},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2404.02702","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:d0c71faf0ff36d8c5405ba525d2d016ba72c4f49902db82565dfa851da3e9543","observation_id":"cb6cebef-6221-4a61-bf5e-efd76448a699","resolution":{"observed_at":"2026-06-28T05:21:39.788836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":17,"verified_exact":31,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2606.04418."}