{"as_of":"2026-08-07T19:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2729d9186f9ceb9b7b9cf06f13fb2dcdf1ed6f2af99b6166820c5966719e27a2","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:12:00.395703Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:11:56.263021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:12:00.605940Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"cited_work":{"arxiv_id":"2506.22362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.22362","snapshot_observed_at":"2026-08-06T22:12:00.605940Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","venue":"eess.AS","work_id":"9494d0cf-ac72-43b5-b700-f7b1a4475224","year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.263021Z"},"links":{"cited_paper":"/paper/2506.22362","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:4c0b47b443d4227695770936453755596f879204149085f758534547f765c3d8","observation_id":"5b9800ea-3637-49ad-8f7e-0333b5d11c53","resolution":{"observed_at":"2026-08-06T22:12:00.657415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22362/citation-record","integrity":"/paper/2506.22362/integrity","json":"/paper/2506.22362/citation-record.json","paper":"/paper/2506.22362"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"cited_work":{"arxiv_id":"2506.22362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.22362","snapshot_observed_at":"2026-08-06T22:12:00.605940Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","venue":"eess.AS","work_id":"9494d0cf-ac72-43b5-b700-f7b1a4475224","year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.263021Z"},"links":{"cited_paper":"/paper/2506.22362","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:4c0b47b443d4227695770936453755596f879204149085f758534547f765c3d8","observation_id":"5b9800ea-3637-49ad-8f7e-0333b5d11c53","resolution":{"observed_at":"2026-08-06T22:12:00.657415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.835178Z","title":null,"venue":null,"work_id":"bd5f7e83-7665-4dc3-a14d-8ea147c14048","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.378331Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:06b607b0906210615dc09c2732d5da8dbc91b3d5e21c381473afbe98a429dcc3","observation_id":"8df8c223-4cfd-4c6b-82d9-88e276c36f6b","resolution":{"observed_at":"2026-08-06T22:12:05.884534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.501529Z","title":"SS-SC and SS-CL are optimized with 1e−4 learn- ing rate for 1 million steps","venue":null,"work_id":"5b29705e-1c71-4607-8108-2c950607f960","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.883055Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:ed734350a008f61d8a7ff95d2eb58c4d63f1701e2f72b6c22f2fcfb13527e307","observation_id":"61ed7bf7-03e8-4cb2-92e4-ad7026f60aaf","resolution":{"observed_at":"2026-08-06T22:12:05.545419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.383016Z","title":"There are two major limitations: it only supports non- 2The 10 audio clips are sampled uniformly from LibriTTS test-clean omitting those less than 5s","venue":null,"work_id":"95a0ff5c-4529-4ccf-9001-1363d267dc99","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.068976Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:b7c121c9a1d573b5594b6f726255a2f6c9146f380475fe6cfb011da78ffda2a2","observation_id":"58d2b895-c15f-4d5c-979d-86e1565358a0","resolution":{"observed_at":"2026-08-06T22:12:05.432611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T22:11:57.819506Z","title":"High Fidelity Neural Audio Compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.819506Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:df1e5740ef7793a01a05a2e76ab2d4b2bf7403e1771c97d3aa775927bbf0aca2","observation_id":"697cd690-a421-48a1-b57a-f10af5163824","resolution":{"observed_at":"2026-08-06T22:11:57.819506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.706066Z","title":null,"venue":null,"work_id":"164373fd-1518-40bd-a18a-ba73f2ea4298","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.556586Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:28af7fdaf4783444fd4e91f1fd396d4bc3fdf4c9b197481d07f08097dd2aa67b","observation_id":"470f8e5c-fd4b-44f3-a4ed-73491a7869a3","resolution":{"observed_at":"2026-08-06T22:12:05.785845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.270242Z","title":"HuBERT: Self-Supervised Speech Rep- resentation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"64829aee-a0e7-493e-996a-167f1e508091","year":2021},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.215975Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:b4c8584c0fd7860c3ed04f3051ada9e05f0e557c445fdba0e55840b54f1f491c","observation_id":"cb89ca61-b5f7-4f40-bbcf-3a46db86612f","resolution":{"observed_at":"2026-08-06T22:12:05.326298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.148899Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Represen- tations,","venue":null,"work_id":"b28c85fd-3226-4435-867f-cfcfb93c5be3","year":2020},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.401222Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:0584907827d8bb2cabf6e3e195a20249e54142d5938fc709bc372fb39d9fd310","observation_id":"7f71171f-daf1-4a7f-be44-40d65d974f96","resolution":{"observed_at":"2026-08-06T22:12:05.192372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:11:57.528724Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.528724Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:694277fe116dc56012f39d40904b10ae4fb7b2925aa3d1da8ff29df5475faa1d","observation_id":"d5a9493a-cb89-4734-9dbf-e5e0eeb6fddf","resolution":{"observed_at":"2026-08-06T22:11:57.528724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.028154Z","title":"w2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre- Training,","venue":null,"work_id":"3fae04b1-a7ba-44ec-903c-ed52a91887f2","year":2021},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.697694Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:0ec866a490e49819b143b65fbedb3769430a1bee818c7066be5136f9777d42d8","observation_id":"fd77f7af-be89-4f03-bdd7-70e59f5c7aab","resolution":{"observed_at":"2026-08-06T22:12:05.084487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.301334Z","title":"PolyV oice: Language Models for Speech to Speech Translation,","venue":null,"work_id":"f7bcef01-224e-4ba8-ae4a-cafe1ab7140a","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.332796Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:5ea79356c4b2422c3b61190d907a1da78fb5a900b0f90f33d4b781fd45b00fa2","observation_id":"28cb9e28-d715-4793-8603-bff255369fec","resolution":{"observed_at":"2026-08-06T22:12:04.407814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.876474Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"b9bcd55a-bbb5-4a7c-9c94-e0dcedda3a1f","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.887238Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:0d9f8842b2825a9e7a5a597eace972622e2a70e725a0c464fd5614eb4d739129","observation_id":"2ae3cbb9-8dce-49cb-8963-43e3a5d44fe8","resolution":{"observed_at":"2026-08-06T22:12:04.950584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.652665Z","title":"AudioLM: A Language Modeling Approach to Audio Generation,","venue":null,"work_id":"62baf191-a79b-4fd5-8c79-388abe380f8e","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.968067Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:9bb2e0adfb7b40a6af1e6ca784ec339d18105729d318f30d7cf475a959d7928a","observation_id":"5616e741-3b16-4a35-b52a-46ffd11ba287","resolution":{"observed_at":"2026-08-06T22:12:04.753500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03540","last_updated":"2023-02-07T15:48:31Z","snapshot_observed_at":"2026-07-06T14:49:19.585577Z","submitted_at":"2023-02-07T15:48:31Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03540","snapshot_observed_at":"2026-08-06T22:11:58.039438Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.039438Z"},"links":{"cited_paper":"/paper/2302.03540","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:3cb9293eaa5c1c4b2344699419793e1358950ad208ff9918f3ec898860a76b4d","observation_id":"f371b50b-589e-4282-903e-299acaccadd5","resolution":{"observed_at":"2026-08-06T22:11:58.039438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T22:11:58.112443Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.112443Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:ffbea8e8084729cea85381e5198f2e8a0470fd6b84d6620120b00c9150d5698a","observation_id":"f6314508-c797-4b3c-b0c6-6201c39e2af5","resolution":{"observed_at":"2026-08-06T22:11:58.112443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.514746Z","title":"TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript- Conditioned Speech Separation and Recognition,","venue":null,"work_id":"32638627-74c6-45bf-be94-e013d92ec2d0","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.204048Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:85ec639ce0e51d05c1f276576494efefa0ec7a7e7fa8a81ba23546fc450bdedf","observation_id":"53225d5e-261b-47b4-b570-6f689c6a2011","resolution":{"observed_at":"2026-08-06T22:12:04.590748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.582418Z","title":"Denoising Diffusion Probabilistic Models,","venue":null,"work_id":"faa0443b-1127-4020-a0c3-2fab7a366324","year":2020},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.800630Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:e568bab60bb545c3587eb1f6d30827393f6f044ac4d7c60b0acada28ba7cce12","observation_id":"741d6f2e-ded0-471f-8981-7d2a8d44a1cd","resolution":{"observed_at":"2026-08-06T22:12:03.658852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-07T11:17:00.922804Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03382","snapshot_observed_at":"2026-08-06T22:11:58.428052Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.428052Z"},"links":{"cited_paper":"/paper/2502.03382","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:f616a5e48a78a51b1bac1a11d5caf7db6dfe34536a0394e21527db643f889e47","observation_id":"541cf954-a92b-44d0-ac2b-02138a4b836a","resolution":{"observed_at":"2026-08-06T22:11:58.428052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T22:11:58.489098Z","title":"Moshi: a speech- text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.489098Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:037b95538d3213cd611d3b6ad0fb9c1a19cfc1f5500f22a3a0bce6e8a92f187c","observation_id":"346f092b-0acc-4437-bcc2-9fd0777a651b","resolution":{"observed_at":"2026-08-06T22:11:58.489098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.093202Z","title":"Autoregressive Image Generation Using Residual Quantization,","venue":null,"work_id":"d0ffdb07-39ab-41ea-b34e-50d37eb281a9","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.579941Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:9aa39d0ed500777d9850c7f4a8ea9804b902e09a9511b13a2ae145ed28ec3876","observation_id":"ba766575-ff7d-4c67-8a2f-1b753275e311","resolution":{"observed_at":"2026-08-06T22:12:04.193477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.918679Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"82b35aa6-9040-4851-bb01-11fa51a63f23","year":2020},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.652586Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:0c8e0bf5fda79d8c2287b2e6c6d783cc64d29aecd0246c2c4247ec0ea722314b","observation_id":"0503de73-1854-4765-b019-aa31e7982554","resolution":{"observed_at":"2026-08-06T22:12:04.004761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.741242Z","title":"Mel- GAN: Generative Adversarial Networks for Conditional Wave- form Synthesis,","venue":null,"work_id":"8fddd4ec-57b1-440f-a5ba-5e1b74786a42","year":2019},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.731676Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:32b3f01ae0b1d809fe354fe37576d655ee57da8ca3e01a5c6e84153b10747efd","observation_id":"2eee440f-7147-4fdf-b57b-56e8a377ca85","resolution":{"observed_at":"2026-08-06T22:12:03.825848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.665500Z","title":"Auto-Encoding Variational Bayes,","venue":null,"work_id":"c4478767-ad1b-4abc-8f98-a71d5ce121cb","year":2014},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.303877Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:f39bed94871966919999ffdb1efccc164e028a62a66c9144f775d371690dd4e7","observation_id":"b518cc89-7d79-492f-b39e-9406b9a98ced","resolution":{"observed_at":"2026-08-06T22:12:02.760597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.437356Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermody- namics,","venue":null,"work_id":"be143c1c-5262-4631-be9b-07ceb1737b60","year":2015},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.879689Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:bfeb1a158527a5de1d59417614454d5cb61f969a335e7d0480ae049d96f89650","observation_id":"29dbd204-1178-4dc2-aa33-9055e61bcc79","resolution":{"observed_at":"2026-08-06T22:12:03.492841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.596203Z","title":null,"venue":null,"work_id":"85f7fd00-d54a-4278-9407-ac4e43783d63","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.737595Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:7fed717bcb9e1a572684b81de71d0f17e144b0984f9bbe9374a35ee303dc7712","observation_id":"415f794e-88e2-4cbb-9868-005b8a65a511","resolution":{"observed_at":"2026-08-06T22:12:05.654095Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.261781Z","title":"Multi- step Distillation of Diffusion Models via Moment Matching,","venue":null,"work_id":"6819e1c3-5d9a-4aee-8450-55bf87bfac1a","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.962209Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:a6cbfd38f30d925a62b57048df298e1b14d32fc3cd59533670c63eabb544153c","observation_id":"75e26e44-6ab8-478a-9520-2502c3b003aa","resolution":{"observed_at":"2026-08-06T22:12:03.345517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.046093Z","title":"SpeechTok- enizer: Unified Speech Tokenizer for Speech Language Models,","venue":null,"work_id":"b9ebe94f-43df-42a3-b604-fa005be03fdd","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.044535Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:910718ed41b5b9e292d659df1c4e9247353682bc07a5fe03189304359ede281b","observation_id":"09f42aa1-4ebc-4c2d-a76a-6ec7a3930a25","resolution":{"observed_at":"2026-08-06T22:12:03.154376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.846547Z","title":"Simple and Controllable Music Gen- eration,","venue":null,"work_id":"37952a16-2395-4c9e-aabc-44237abba6c1","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.138687Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:a4c5b5e9eab012c5078f861ff339b3c6b070fed1094cd37fb9133434a5aa6465","observation_id":"1a30a0b0-92f1-4a23-8d32-43abdcd71bd9","resolution":{"observed_at":"2026-08-06T22:12:02.959308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-06T22:11:59.228454Z","title":"SoundStorm: Efficient Parallel Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.228454Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:38017d6d1db5e29313a7b666434458d2a32bb096905b9ec4e809167a43052322","observation_id":"d6b0c266-afa8-44f9-8036-d6e1b059ab5c","resolution":{"observed_at":"2026-08-06T22:11:59.228454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.480017Z","title":"FiLM: Visual Reasoning with a General Conditioning Layer,","venue":null,"work_id":"7d517a37-0ae8-47ea-afda-46d72ca6c507","year":2018},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.401405Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:280ba979e94ed62cebf6a460218f0d9c1dbc435f54062cd91a963079613152d4","observation_id":"57ce0ac9-6869-4c4a-ad8d-8a7f7314c980","resolution":{"observed_at":"2026-08-06T22:12:02.583977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.290012Z","title":"High-Resolution Image Synthesis With Latent Diffusion Mod- els,","venue":null,"work_id":"5261622f-db6e-4d5c-8f7e-0df3cead9ea3","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.467113Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:95bd4957c43fa0e4b3bb57a742adcf5d06f72d268dfed684bf646ed2c311d301","observation_id":"5ff8a0bc-abcd-4e0b-bcd1-eb5534083d2f","resolution":{"observed_at":"2026-08-06T22:12:02.376140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.118440Z","title":"Improved Denoising Diffusion Probabilistic Models,","venue":null,"work_id":"afaa5518-5570-4cf1-81b5-ad3a309d0a0e","year":2021},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.562721Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:5e1ed9b5806264c059917ad7e5d38db5d62666e82959245c876d09a8c50ebd96","observation_id":"77eab515-24e4-4ea3-b1e9-cd5e767fa542","resolution":{"observed_at":"2026-08-06T22:12:02.220833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.934975Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models,","venue":null,"work_id":"fd60b995-b21b-4b1a-a51d-ca78dab177b6","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.627762Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:154e0e1a79ad3111d252cf3533e273be97639607dc88847e1d8869f8355a5e6d","observation_id":"67e37efe-fc40-4e9b-992e-6b321fc40388","resolution":{"observed_at":"2026-08-06T22:12:02.030022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.724883Z","title":"Understanding Diffusion Objectives as the ELBO with Simple Data Augmentation,","venue":null,"work_id":"d0f3776a-d949-495a-8799-18568ea9a9b3","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.723665Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:3410ce23374e7c06846c6d74cd66a9811c1187e8b8c4869758d2264286899a45","observation_id":"43f4d6bd-f5e9-4c83-a00c-da998cabf0cc","resolution":{"observed_at":"2026-08-06T22:12:01.835199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T22:11:59.809510Z","title":"WaveNet: A Generative Model for Raw Audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.809510Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:13bc5bec36d465b030a394babbfcab6564c4206da8027a35d91f96ba7a185fd4","observation_id":"98e74125-b74a-4b75-8179-05ebc6103f4f","resolution":{"observed_at":"2026-08-06T22:11:59.809510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.553377Z","title":"Improved Distribution Matching Distillation for Fast Image Synthesis,","venue":null,"work_id":"3ddd91bd-eddc-4651-9751-c58879b02f79","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.912833Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:8b31d7bada1b5244c9c793b5ec6449b90f16893851f49a9cfe58fd8daf28e968","observation_id":"ee08011d-db9e-4b47-af8a-a1ced36515b6","resolution":{"observed_at":"2026-08-06T22:12:01.628591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.352639Z","title":"Adam: A Method for Stochastic Opti- mization,","venue":null,"work_id":"d50755db-fa75-4f2f-a204-a267a47cab13","year":2015},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.998448Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:47be918e86501c4268aafe63d497efb1c89c6ac2e999862d545bf62d1f79fc44","observation_id":"98d1f1e6-947e-45f9-8bd9-2e14b9a64f87","resolution":{"observed_at":"2026-08-06T22:12:01.443509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.097994Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech,","venue":null,"work_id":"14cf9a45-13ac-45ff-b09c-2776eecb4c87","year":2019},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.112002Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:34b1c45511b0959c0ad6b237c8e969af136638996ab4def26e21ee8972575051","observation_id":"660927e8-3baa-4905-bf20-2df453f72676","resolution":{"observed_at":"2026-08-06T22:12:01.166687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:00.940173Z","title":"DNSMOS P.835: A Non-Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors,","venue":null,"work_id":"fcacd06e-ae82-42cf-8005-574b56933b88","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.221210Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:680ed3c0bad2d3fb879ed6400702c0efcbdd7aff14b7cd7b8db692bc8162dd71","observation_id":"bc7abb8f-32a5-404e-a102-33693344d727","resolution":{"observed_at":"2026-08-06T22:12:01.013883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:00.758110Z","title":"Method for the subjective assessment of intermediate quality level of audio systems,","venue":null,"work_id":"887b9f9f-27cf-4831-8ddd-953e84b73d64","year":2014},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.325633Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:f21b924fbe0e25645052403fd406cbaa25ce0a2c2d4b9392ebdc9a27de0471ab","observation_id":"941ab650-d1d2-4991-8545-9bba2435104b","resolution":{"observed_at":"2026-08-06T22:12:00.848285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:00.395703Z","title":"From Slow Bidirectional to Fast Autoregressive Video Diffusion Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.395703Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:a8fada90d46a065975b32ec7d27bc40277d41ea24df70f90abe372e0abf11bad","observation_id":"5ef30e46-e58e-47f3-97e6-20c11c41a23b","resolution":{"observed_at":"2026-08-06T22:12:00.395703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T22:03:20.630448Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.22362."}