{"as_of":"2026-08-06T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ec2c47a806b5625319067509373cc8034889bb3cf4b650e6ea7dc9583817dda","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:10:56.287904Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:10:55.955561Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:37:06.833872Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05835","snapshot_observed_at":"2026-08-05T23:10:55.955561Z","title":"These technologies have been central to fields such as audio transmission and commu- nication [1, 2]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:55.955561Z"},"links":{"cited_paper":"/paper/2508.05835","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:686395d2173a1c4599965191ea059739efda1fb6f01785d2923264d0f9afb63b","observation_id":"afbe7124-0d3e-4167-9392-d6f72758aec9","resolution":{"observed_at":"2026-08-05T23:10:55.955561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.05835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05835","snapshot_observed_at":"2026-07-02T15:37:06.833872Z","title":"Nanocodec: Towards high-quality ultra fast speech llm inference,","venue":null,"work_id":"528ed2fe-b764-4210-925d-6414ac6e3b72","year":2025},"citing_paper":{"arxiv_id":"2606.06559","last_updated":"2026-06-04T12:39:44Z","snapshot_observed_at":"2026-08-02T15:33:37.373792Z","submitted_at":"2026-06-04T12:39:44Z","title":"IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T23:42:38.203116Z"},"links":{"cited_paper":"/paper/2508.05835","citing_paper":"/paper/2606.06559"},"observation_digest":"sha256:898c47b9478c541283c1bd6344e863314b3c7a775f187393fbe09efe60ab0586","observation_id":"c7f0061e-029f-431c-abeb-369b2b61afba","resolution":{"observed_at":"2026-07-02T15:37:06.835221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05835/citation-record","integrity":"/paper/2508.05835/integrity","json":"/paper/2508.05835/citation-record.json","paper":"/paper/2508.05835"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05835","snapshot_observed_at":"2026-08-05T23:10:55.955561Z","title":"These technologies have been central to fields such as audio transmission and commu- nication [1, 2]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:55.955561Z"},"links":{"cited_paper":"/paper/2508.05835","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:686395d2173a1c4599965191ea059739efda1fb6f01785d2923264d0f9afb63b","observation_id":"afbe7124-0d3e-4167-9392-d6f72758aec9","resolution":{"observed_at":"2026-08-05T23:10:55.955561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.683197Z","title":"The model consists of a fully convolutional generator network and three discriminators","venue":null,"work_id":"a4b01a91-26d0-4449-a88d-424748073827","year":2016},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.067955Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:cd313c7f72ffc50e6fba80cb3cb406c794f3b90b289a708cfc6ef8c954c33839","observation_id":"950b9b12-3f78-41ed-b821-de60d59ddb26","resolution":{"observed_at":"2026-08-05T23:10:56.685548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.676920Z","title":"Experiments setup To assess the performance of our codec in comparison to the LFSC and explore the effects of bitrate reduction, we adopted Koel-TTS [4], a SOTA LLM-based TTS model","venue":null,"work_id":"ece5304e-f00a-4475-9b3a-6a72becb0c9c","year":null},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.139531Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:f30a1b8911ebf3d53e7228ea2bb89add7be379e0ed620d1c0721782cd4f96d52","observation_id":"00d527d4-1350-40fd-9c23-cfa6c288af9a","resolution":{"observed_at":"2026-08-05T23:10:56.679227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.670171Z","title":"Ex- perimental results demonstrate that NanoCodec surpasses exist- ing approaches at the same bitrate, offering significantly higher intelligibility and speaker similarity","venue":null,"work_id":"a11d7656-cdc8-4fcb-a5c1-4bacd15c19ce","year":null},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.189328Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:86eba6dcc19c050a03234191b8755388ba50b2b4ca0b0d51dafb78f48fc224ce","observation_id":"1071ceec-89b6-4776-a3a9-4b234389f202","resolution":{"observed_at":"2026-08-05T23:10:56.672746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.194681Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.194681Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:3fa0920ebbcf309fb5b689cfe061fed5e4310d66792b05a529b4eeb9b1587528","observation_id":"da807057-629e-4b7a-94b7-262b0f5dec08","resolution":{"observed_at":"2026-08-05T23:10:56.194681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.662563Z","title":"Low frame-rate speech codec: a codec designed for fast high-quality speech llm training and in- ference,","venue":null,"work_id":"643527c5-6d10-4d4b-abf9-2e699da2a2b1","year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.206648Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:145808a4bc3671fe83300dcf2217700fa09165a9f8b09b8b929dad70735fe40a","observation_id":"041a70a0-4a23-48a0-99ff-73da461ceeda","resolution":{"observed_at":"2026-08-05T23:10:56.665414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T23:10:56.208858Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.208858Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:d166e3ed8f5866bb050f89d35be6b41f2a92e3d0774d6c1f1d46c284db5998b9","observation_id":"cdd5867a-8a93-41d2-8127-0046701c044a","resolution":{"observed_at":"2026-08-05T23:10:56.208858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05236","last_updated":"2025-07-22T21:32:13Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T06:47:11Z","title":"Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05236","snapshot_observed_at":"2026-08-05T23:10:56.211282Z","title":"Koel- tts: Enhancing llm based speech generation with preference alignment and classifier free guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.211282Z"},"links":{"cited_paper":"/paper/2502.05236","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:6085b5a9983615e818ff1f8e32bd157c1c4cf9f80fabba1d91153dcb3d58dd8a","observation_id":"cb8e12ee-b1fe-442a-829c-e1dedd053d87","resolution":{"observed_at":"2026-08-05T23:10:56.211282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.655936Z","title":"Textless direct speech-to-speech translation with discrete speech representation,","venue":null,"work_id":"d6ebee52-c8ab-4459-a706-a6eb63638322","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.215402Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:05cb668901c26f90b570ca56b05261f2fafbac72d68b00880dfac7b4b7f65c60","observation_id":"eb2b600d-3793-4d62-885d-b5c9278f1c04","resolution":{"observed_at":"2026-08-05T23:10:56.658223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01831","last_updated":"2024-08-18T19:30:30Z","snapshot_observed_at":"2026-07-06T16:02:10.990236Z","submitted_at":"2023-08-03T15:47:04Z","title":"Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation","version":2},"cited_work":{"arxiv_id":"2308.01831","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.01831","snapshot_observed_at":"2026-08-05T23:10:56.408520Z","title":"Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation","venue":"cs.CL","work_id":"b2d94207-4917-4365-8751-b7679a56d9de","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.217391Z"},"links":{"cited_paper":"/paper/2308.01831","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:16aeff0c204fdbbe44546e79ebdc0f17df784f450ea25c0b571d9fb8b4bba4e3","observation_id":"382689a3-48e7-4480-a2a2-89ac25cc526a","resolution":{"observed_at":"2026-08-05T23:10:56.411058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.220079Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.220079Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:40eae4056b046540346312e5496cb2e4f0bbaf6957ec5d6c0f5749bf0d251c67","observation_id":"7dc6b11d-0f94-4ca5-ab33-6a4a53bb0b60","resolution":{"observed_at":"2026-08-05T23:10:56.220079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T23:10:56.222307Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.222307Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:6c20e06e78a6567eee57a073b384c40086270d2f9b3f75b11112880b1aeccfbd","observation_id":"af937a02-c454-42b9-975e-0e3e05475f9b","resolution":{"observed_at":"2026-08-05T23:10:56.222307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05298","last_updated":"2025-06-04T16:25:54Z","snapshot_observed_at":"2026-07-06T18:27:24.526210Z","submitted_at":"2024-06-07T23:47:51Z","title":"Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05298","snapshot_observed_at":"2026-08-05T23:10:56.224674Z","title":"Spectral codecs: Spectrogram-based audio codecs for high quality speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.224674Z"},"links":{"cited_paper":"/paper/2406.05298","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:2279012af3e6bc339d3c7294e53be36c5428c360847d2661b975e7717520af79","observation_id":"08f35b59-de99-4771-8b28-d71248dd34db","resolution":{"observed_at":"2026-08-05T23:10:56.224674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.644727Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"72a29edf-aefa-46fe-9f16-51b1c089d759","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.227519Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:81bcffb96a848e0f9371afa2bfa77cdf9c5393745c15ec7846e6ce6a565e409b","observation_id":"98dd2d26-f5d8-442b-94b8-d74a8a45555b","resolution":{"observed_at":"2026-08-05T23:10:56.647619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.638527Z","title":"A review of vector quantization tech- niques,","venue":null,"work_id":"d54d73bb-796c-46bc-adad-7ef8367145d1","year":2006},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.229337Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:96ce61f8927e18c57a1538c4377dcda9274d7ff159fa62e13916d99f97f9b730","observation_id":"b8db2c80-77b2-4d36-8c80-3fa3b8123f85","resolution":{"observed_at":"2026-08-05T23:10:56.640927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04947","last_updated":"2024-06-07T07:03:30Z","snapshot_observed_at":"2026-07-06T17:56:44.412445Z","submitted_at":"2024-04-07T12:57:46Z","title":"Gull: A Generative Multifunctional Audio Codec","version":2},"cited_work":{"arxiv_id":"2404.04947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04947","snapshot_observed_at":"2026-08-05T23:10:56.385800Z","title":"Gull: A Generative Multifunctional Audio Codec","venue":"eess.AS","work_id":"94bf9f3c-15be-412c-9a45-5551a96676af","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.231159Z"},"links":{"cited_paper":"/paper/2404.04947","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:0841d48935af98a2f152ead4691417a2eeb841404b5cdaeac70638b7bcad673f","observation_id":"0d1a7139-afcd-4cd2-b250-22d6d087fde8","resolution":{"observed_at":"2026-08-05T23:10:56.388140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-05T23:10:56.233173Z","title":"Fi- nite scalar quantization: Vq-vae made simple,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.233173Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:fe7a12451853872f16531a596c630d03ee6bf20c47636b41568147c7777ae1b0","observation_id":"b73d46e2-9f29-439a-baa1-99d6ee3c5405","resolution":{"observed_at":"2026-08-05T23:10:56.233173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01271","last_updated":"2024-02-02T09:55:15Z","snapshot_observed_at":"2026-07-06T17:24:12.659911Z","submitted_at":"2024-02-02T09:55:15Z","title":"An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec","version":1},"cited_work":{"arxiv_id":"2402.01271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01271","snapshot_observed_at":"2026-08-05T23:10:56.371999Z","title":"An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec","venue":"eess.AS","work_id":"494fc8a4-f771-4814-b7b3-5d89a6d84e4c","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.235309Z"},"links":{"cited_paper":"/paper/2402.01271","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:8c0ef67118459d2d2bf825c8e5310b1c8ba0f4b3b8deb31f12feae378d0c55c6","observation_id":"f2c4ada4-b184-455f-a5e6-262eccd6eb1a","resolution":{"observed_at":"2026-08-05T23:10:56.374626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.631827Z","title":"Lightcodec: A high fidelity neural audio codec with low computation complexity,","venue":null,"work_id":"71d77b08-df98-4a3d-b758-eb43b1bcbcf2","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.238212Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:2290a230072a90486e8f811cb7ee49f11e326092491652cfd1c5e7931393b137","observation_id":"6b674d29-0816-4322-a2d0-533578fbaf82","resolution":{"observed_at":"2026-08-05T23:10:56.634342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-07-06T19:07:37.761860Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-05T23:10:56.240257Z","title":"Wavtokenizer: an efficient acous- tic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.240257Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:85f1ae105dfca600d121878315d98bfd5faba41b9362d28c0a1ebafb032e51d9","observation_id":"512474a8-203f-478d-a365-a76c09d1c7a8","resolution":{"observed_at":"2026-08-05T23:10:56.240257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-07-06T19:59:01.756640Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-05T23:10:56.242612Z","title":"Scaling transformers for low-bitrate high-quality speech coding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.242612Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:b06408e6c2b686d7f0cb01044481c046e33bba08ddef545057cd94f8e4e85138","observation_id":"455d23af-0459-42ad-a8ba-04e35a6f588a","resolution":{"observed_at":"2026-08-05T23:10:56.242612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-07-06T19:58:18.076549Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T23:10:56.245021Z","title":"Ts3-codec: Transformer-based simple streaming single codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.245021Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:25417072b630af5cc7158414e59769edb7befe45cb17e2c924d770946960591f","observation_id":"57bf441b-e926-4c19-b4de-a6a7246a0672","resolution":{"observed_at":"2026-08-05T23:10:56.245021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T23:10:56.247368Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.247368Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:8db0656f57016e0b41a0d07f74186f99a5ac15e1c31e3028fb582966230d50ad","observation_id":"bd81f46b-8c0e-4f37-a382-a856d0f0ee25","resolution":{"observed_at":"2026-08-05T23:10:56.247368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.624738Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"8ce67312-1139-45d3-8a3b-ff686f00cd65","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.250042Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:17625de69bb7ca4fa7ea547178306b9c56f716b408b434459a615c8cc0d759f7","observation_id":"29b9e15f-b0e8-4e70-bd45-72558da1b789","resolution":{"observed_at":"2026-08-05T23:10:56.627122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-05T23:10:56.252891Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.252891Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:47d3932e74717a5837a4f120eddf384ff569e6d8ea84a034cdffdefbbb180454","observation_id":"1df455ea-20ce-4795-9461-174ffa8818ab","resolution":{"observed_at":"2026-08-05T23:10:56.252891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.618735Z","title":"Neural networks fail to learn periodic functions and how to fix it,","venue":null,"work_id":"6752b7d8-c176-4a6e-ad33-ef7dcaae1d14","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.254974Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:5f2e89d829628e3c11ca457c78efd787dae801ee815c0032a57fdd19f048702e","observation_id":"4ea94944-4489-48f0-ab34-9ca420020909","resolution":{"observed_at":"2026-08-05T23:10:56.620984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.611736Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":"2911c13d-3d09-4130-8fab-a364dd5519d9","year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.256910Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:802109f7cc41c9e6ecb651c54570ac6ea667b89718a6ce0a84829f87a24fb538","observation_id":"cea6704d-f41a-46f7-8b31-a4168a2226cd","resolution":{"observed_at":"2026-08-05T23:10:56.614682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14153","last_updated":"2020-09-29T16:55:25Z","snapshot_observed_at":"2026-07-06T09:59:53.503386Z","submitted_at":"2020-09-29T16:55:25Z","title":"Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020","version":1},"cited_work":{"arxiv_id":"2009.14153","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.14153","snapshot_observed_at":"2026-08-05T23:10:56.330596Z","title":"Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020","venue":"eess.AS","work_id":"4011d01d-9404-46d7-bc5f-fef98c7f60a4","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.258791Z"},"links":{"cited_paper":"/paper/2009.14153","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:84bd34a0a16647a41b551c593954322ef52509e882d7eb9392816066111b9c98","observation_id":"912a39d0-ea31-4003-acb5-997a139fb7f2","resolution":{"observed_at":"2026-08-05T23:10:56.334788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.605359Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":"8e92be31-e2d4-446d-aee4-2c0ddf395033","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.261856Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:94dc0ba49ef6833daf3f862332ec5bc56d241d51d093534eb3206bf237c04421","observation_id":"9335ac55-5526-457e-9425-ac90053154d3","resolution":{"observed_at":"2026-08-05T23:10:56.607413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T23:10:56.264700Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.264700Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:7804c8d15a1436b34b3a9dfa3233ff69b8154fa58467e5e803b8f8b95e5920c9","observation_id":"ff21f246-be34-40a2-b339-0ee3f54b5f07","resolution":{"observed_at":"2026-08-05T23:10:56.264700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.598512Z","title":"Torchaudio-squim: Reference-less speech quality and intelligibility measures in torchaudio,","venue":null,"work_id":"cd35e613-b3b8-4e4a-8dff-a36f93fe0cc4","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.266976Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:f0d5e52b049af15024372c18555c32d2e38753672afe0c97b16d174a04590052","observation_id":"5a4923fe-b2a9-459b-8a89-88c0e246b249","resolution":{"observed_at":"2026-08-05T23:10:56.601009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.268724Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.268724Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:3b23daa3ecb544a7109a8d7097f3c325723237ec847cf80b97139c5f4be2664c","observation_id":"b090c511-9542-4e1e-a2e8-729a4a897822","resolution":{"observed_at":"2026-08-05T23:10:56.268724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.587571Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"363dd265-8c11-499c-9a36-829d9275f13c","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.271336Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:6dc3992a5597317049a287f15c8670333fd97c92cdb2f4f4f5b79505eb161404","observation_id":"658ec4c7-6634-45e4-ac4e-9885b6aeb717","resolution":{"observed_at":"2026-08-05T23:10:56.590353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08342","last_updated":"2024-01-16T13:17:39Z","snapshot_observed_at":"2026-07-06T17:16:08.962172Z","submitted_at":"2024-01-16T13:17:39Z","title":"ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings","version":1},"cited_work":{"arxiv_id":"2401.08342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08342","snapshot_observed_at":"2026-08-05T23:10:56.307604Z","title":"ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings","venue":"eess.AS","work_id":"0c597f97-4b41-4f39-93ff-0bf9a81548c9","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.273816Z"},"links":{"cited_paper":"/paper/2401.08342","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:7cb63649070c6e8f0d9f10bc13c3aab299ef86a1e614d6de77346d92c5504485","observation_id":"22a2993b-9a5a-4372-af1a-dc1c1044f70f","resolution":{"observed_at":"2026-08-05T23:10:56.312611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.581140Z","title":"Roach, A little encyclopaedia of phonetics","venue":null,"work_id":"316ccee2-f615-4267-99f3-d6b6d96652ba","year":2002},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.276404Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:d7fbb8cc9e397432f1c755d7ccf2ffefc51c6b443e21d06e42aa28d378ec9cdc","observation_id":"bb215012-18e3-4741-80c6-34cf59db1d03","resolution":{"observed_at":"2026-08-05T23:10:56.583466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.571523Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"edcf7d8c-5557-4665-9baa-9e5246b1202d","year":2019},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.278728Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:e3f98bba015f711a669ee87bd09e78750442da1f9a360b1844fad304d6e6fbb8","observation_id":"0c728253-c6ff-47dd-a180-3c67174b4682","resolution":{"observed_at":"2026-08-05T23:10:56.574765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.563091Z","title":"Hi-Fi Multi-Speaker English TTS Dataset,","venue":null,"work_id":"57c3b7c2-9a15-4c72-a25a-228d8a58bda2","year":2021},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.281453Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:f2f2672555112eeb52838bf96458b2ac5ebfdb7163c5d572dd1dc5ec5f277f76","observation_id":"3dd725f1-d2eb-469c-a2ba-3e2c21c24f34","resolution":{"observed_at":"2026-08-05T23:10:56.565836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.555005Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":"09b0abea-8242-4473-9adf-234d07116fb2","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.283718Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:1d11dbf5103dae0cd93ea8d6508210ce03c8e0b1d5093fe4f52bf7f60c91cbc4","observation_id":"5ee77d5e-84ef-498c-86ad-35a7632a363d","resolution":{"observed_at":"2026-08-05T23:10:56.557346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.548206Z","title":"Efficient sequence transduction by jointly predicting tokens and durations,","venue":null,"work_id":"5aecaba4-6923-4343-98b8-0d35bf142796","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.285766Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:2b4658bbcaefffbefe207b2741eebb1ed619e1e50b21dfa722928e0201b0f993","observation_id":"68de79d5-32d1-43a4-9482-35954a840aba","resolution":{"observed_at":"2026-08-05T23:10:56.550562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.539998Z","title":"Titanet: Neural model for speaker representation with 1d depth-wise separable convo- lutions and global context,","venue":null,"work_id":"9b67a80e-768c-481e-93dd-cf63256cfec9","year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.287904Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:b063c66a57a06407b386da30479f0be72ce1d68caa2f1bdf4989e4389679904f","observation_id":"a634319a-4e6c-45dd-bc1b-94800e445918","resolution":{"observed_at":"2026-08-05T23:10:56.542874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2508.05835."}