{"as_of":"2026-08-08T18:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa1d658f0d6c952448d93772082dd1377980fe68bf992da055895820b21e1643","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:54:58.755219Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:54:58.525812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T19:54:59.403728Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"cited_work":{"arxiv_id":"2508.11598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11598","snapshot_observed_at":"2026-08-05T19:54:59.403728Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","venue":"cs.CL","work_id":"2a609e57-18c8-4257-ac58-ccb739543d35","year":2025},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.525812Z"},"links":{"cited_paper":"/paper/2508.11598","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:13ab2df04b857eb15d38575f100f4e6e5a23cca02a972ecec33b91d63eee790e","observation_id":"c87c66bf-5d6a-4851-91b1-d73aff9c5ccf","resolution":{"observed_at":"2026-08-05T19:54:59.463829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11598/citation-record","integrity":"/paper/2508.11598/integrity","json":"/paper/2508.11598/citation-record.json","paper":"/paper/2508.11598"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"cited_work":{"arxiv_id":"2508.11598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11598","snapshot_observed_at":"2026-08-05T19:54:59.403728Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","venue":"cs.CL","work_id":"2a609e57-18c8-4257-ac58-ccb739543d35","year":2025},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.525812Z"},"links":{"cited_paper":"/paper/2508.11598","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:13ab2df04b857eb15d38575f100f4e6e5a23cca02a972ecec33b91d63eee790e","observation_id":"c87c66bf-5d6a-4851-91b1-d73aff9c5ccf","resolution":{"observed_at":"2026-08-05T19:54:59.463829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.619970Z","title":"water” and “river","venue":null,"work_id":"6fa9afe5-0f08-4bec-b6cc-a1fe8176ebd1","year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.530279Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:8f63621053ccc3af3847ea8be7148c9639f80c3998368fd185d673cff5fba0dd","observation_id":"e70517cc-c426-43e4-b519-7ec9eba9316d","resolution":{"observed_at":"2026-08-05T19:55:03.623324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.610349Z","title":"er” was often confused with “r","venue":null,"work_id":"445e88be-3644-4ff0-991a-5589ec66dc28","year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.534959Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:466e506262942cc879b0c50280fa0e77f01528aae32019e0adc54966b5e1052a","observation_id":"1dbc760f-0472-4349-bb5c-34037b0f7723","resolution":{"observed_at":"2026-08-05T19:55:03.613327Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.601049Z","title":"Transformation Imitation","venue":null,"work_id":"c3e17c33-15bb-4242-95ca-0587990e5652","year":null},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.538930Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:bee0d81e88d3f874d8530d3af0bcb67c609b40ea47993fa8831a5e310280069c","observation_id":"8418ae8c-cc49-47e6-8870-8f8d089400a8","resolution":{"observed_at":"2026-08-05T19:55:03.603935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.590810Z","title":"acknowledges support from The K","venue":null,"work_id":"3f3f9c92-b221-47b5-bbae-80c70341ed7a","year":null},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.542617Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:d481094d2b5af805ffd675890f92fce4fa94feb0698de2088048af576ccb4488","observation_id":"87b8727c-cc16-4faa-a61c-702bb755647c","resolution":{"observed_at":"2026-08-05T19:55:03.594277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:54:58.546041Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.546041Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:1c55f33149e21ea563c656a51f73d4e487462332206490c8caa718441813988e","observation_id":"d35525ca-2a30-43d0-9329-ae571f573311","resolution":{"observed_at":"2026-08-05T19:54:58.546041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14085","last_updated":"2024-09-21T09:39:36Z","snapshot_observed_at":"2026-08-07T23:24:25.987192Z","submitted_at":"2024-09-21T09:39:36Z","title":"Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models","version":1},"cited_work":{"arxiv_id":"2409.14085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.14085","snapshot_observed_at":"2026-08-05T19:54:59.262046Z","title":"Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models","venue":"eess.AS","work_id":"daa8a225-f4d8-4b11-87da-2e4ebe634d70","year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.550290Z"},"links":{"cited_paper":"/paper/2409.14085","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:71182080d87aaf9175a1dd396bed623c2428daa4ea6a76a0150173a0d1b91d55","observation_id":"7257bd88-eb8c-483a-84c1-1faded21bf78","resolution":{"observed_at":"2026-08-05T19:54:59.341956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00359","last_updated":"2023-05-30T05:17:15Z","snapshot_observed_at":"2026-07-06T15:21:35.186250Z","submitted_at":"2023-04-30T00:17:42Z","title":"A Review of Deep Learning Techniques for Speech Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00359","snapshot_observed_at":"2026-08-05T19:54:58.553897Z","title":"A review of deep learning techniques for speech processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.553897Z"},"links":{"cited_paper":"/paper/2305.00359","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:844e710eeaf58aa618d46fcdcfb456bfd44e0c1953afc177519f25ea174719c2","observation_id":"ba6f1da7-8ec5-4af4-a722-1c40c19dfc80","resolution":{"observed_at":"2026-08-05T19:54:58.553897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.558742Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.558742Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:2570edd82c94ceba1166e2687db554d2822a520af51750619be5a685441116e2","observation_id":"86bff55e-0e93-4447-aa6c-b3938d7f5878","resolution":{"observed_at":"2026-08-05T19:54:58.558742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T19:54:58.561899Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.561899Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:7ab1d3761c6bf61db3d55f456ed2d870cf80ac384c4c2b5398907ad52e42d373","observation_id":"587e6140-14f7-4998-a625-0c5aa2904316","resolution":{"observed_at":"2026-08-05T19:54:58.561899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-05T19:54:58.565677Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.565677Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:9c5fdd0ecbde68e70ee1a3899819a48a9b0d5263adf5f68944bd68d72917173d","observation_id":"f225f353-cfd7-4e63-b6bc-70213e002bb5","resolution":{"observed_at":"2026-08-05T19:54:58.565677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.574024Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"c1e35fab-af0f-4788-a2c2-8fd9f8b795c0","year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.569242Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:e13f3b8941552e2bc7e7ce3ba40400c0317831003cb5c3bd4bab69b952dbac46","observation_id":"4075519f-d176-4b8a-bce3-882d355bb389","resolution":{"observed_at":"2026-08-05T19:55:03.577698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12208","last_updated":"2025-06-04T05:50:15Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:12:12Z","title":"Language-Codec: Bridging Discrete Codec Representations and Speech Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12208","snapshot_observed_at":"2026-08-05T19:54:58.572361Z","title":"Language-codec: Reducing the gaps between discrete codec representation and speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.572361Z"},"links":{"cited_paper":"/paper/2402.12208","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:3e5ddf6256977962317c9a62cd65bb790a3d74d41ba3eeafb9e735812e40231b","observation_id":"b43b3d0a-1d76-4908-9c67-cf1874151514","resolution":{"observed_at":"2026-08-05T19:54:58.572361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.561940Z","title":"Speechtok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"c9ba50bb-9003-492c-8d4a-406702414439","year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.575845Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:ab56784ecb1bc476766739427329949c0d9e9ee529357b15d5698e2c393c3aa0","observation_id":"3f67f68b-b935-425c-86b6-f24317671d3e","resolution":{"observed_at":"2026-08-05T19:55:03.566990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02781","last_updated":"2024-04-03T14:52:20Z","snapshot_observed_at":"2026-08-08T17:43:45.925408Z","submitted_at":"2024-04-03T14:52:20Z","title":"CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02781","snapshot_observed_at":"2026-08-05T19:54:58.579073Z","title":"Clam-tts: Improving neural codec language model for zero-shot text-to-speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.579073Z"},"links":{"cited_paper":"/paper/2404.02781","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:73ba761f7899364e4e286f0420f8d2d87be9409491c1988dde097156fc2d0b37","observation_id":"61224e10-6883-4e89-a553-dd944a8b051c","resolution":{"observed_at":"2026-08-05T19:54:58.579073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05298","last_updated":"2025-06-04T16:25:54Z","snapshot_observed_at":"2026-07-06T18:27:24.526210Z","submitted_at":"2024-06-07T23:47:51Z","title":"Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05298","snapshot_observed_at":"2026-08-05T19:54:58.582582Z","title":"Spectral codecs: Spectrogram-based audio codecs for high quality speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.582582Z"},"links":{"cited_paper":"/paper/2406.05298","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:f0bb1116a21adcdfb1048b1206f2f6abb7bb001361e9c2804b7adaf9ec78bed1","observation_id":"1886f8f4-88fc-4818-9a5b-9a573165cfbb","resolution":{"observed_at":"2026-08-05T19:54:58.582582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T19:54:58.586186Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.586186Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:84cdd961182846e521683b29569ed1f6c1e8d781c59c0aa839106a2ed52be96b","observation_id":"7f87b3e5-0f62-484c-a2bf-6ee9e158b49b","resolution":{"observed_at":"2026-08-05T19:54:58.586186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.371637Z","title":"Hierarchical organization of hu- man auditory cortex: evidence from acoustic invariance in the re- sponse to intelligible speech,","venue":null,"work_id":"ccea8dc4-935e-436d-adc8-0122bb50d76e","year":1991},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.589508Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:fb003798037df4f44438aed4cd0dadcd8f8d296938df6798e126a337c8cfe56a","observation_id":"e7744f64-4ab0-4588-a3cc-55690244c93e","resolution":{"observed_at":"2026-08-05T19:55:03.462945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.217465Z","title":"Intonational speech prosody encoding in the human auditory cortex,","venue":null,"work_id":"53b5bea4-6ce9-4456-84bf-666b1c25fbc3","year":2017},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.592847Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:067fd77f9c8301a7b90b2b835d3ea2f27e10fbc2482aff2dd9d7827881a84c48","observation_id":"5d4cc089-2728-4852-b9a9-0427f40f18a8","resolution":{"observed_at":"2026-08-05T19:55:03.286871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.595978Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.595978Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:fa89201b913a20ab6b2d95cfdd1d95fecd4cefb8c70d276577c0ff6264b4f737","observation_id":"8464c6ed-1479-49e3-b937-6b7d393d173a","resolution":{"observed_at":"2026-08-05T19:54:58.595978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06209","last_updated":"2021-09-13T18:29:12Z","snapshot_observed_at":"2026-07-06T11:38:05.465038Z","submitted_at":"2021-08-07T06:29:36Z","title":"W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06209","snapshot_observed_at":"2026-08-05T19:54:58.599394Z","title":"W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.599394Z"},"links":{"cited_paper":"/paper/2108.06209","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:85b85b91e4ec98d937ca973c7956a655a52cfd097dee3a40e86e01a28dd3576a","observation_id":"9516fb69-478a-4798-bfa4-95e9d6cda6bf","resolution":{"observed_at":"2026-08-05T19:54:58.599394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.602756Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.602756Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:ee495031155a05d1c7f951b653fdcdff9718d273fb18f24c5e1cf4e268e42fad","observation_id":"43f76c7d-ebb6-4dc9-9aa6-e9fbefa6023f","resolution":{"observed_at":"2026-08-05T19:54:58.602756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.00508","last_updated":"2017-05-27T04:01:13Z","snapshot_observed_at":"2026-07-06T05:05:37.668295Z","submitted_at":"2016-08-01T17:51:03Z","title":"Blind phoneme segmentation with temporal prediction errors","version":2},"cited_work":{"arxiv_id":"1608.00508","doi":null,"metadata_source":"pith","pith_arxiv_id":"1608.00508","snapshot_observed_at":"2026-08-05T19:54:59.156336Z","title":"Blind phoneme segmentation with temporal prediction errors","venue":"cs.CL","work_id":"b690bc14-fa1e-480b-adb8-d59592d8afe2","year":2016},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.605940Z"},"links":{"cited_paper":"/paper/1608.00508","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:8cb1ee2ac68e0c6c0a7f5b10bc84fde14779dea0b67d9a4f188092c1ba684f3f","observation_id":"ed71dc35-6842-4fef-9545-5fdea44e45e5","resolution":{"observed_at":"2026-08-05T19:54:59.172535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03240","last_updated":"2019-06-19T03:27:39Z","snapshot_observed_at":"2026-08-04T14:17:33.504498Z","submitted_at":"2019-04-05T19:04:19Z","title":"An Unsupervised Autoregressive Model for Speech Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03240","snapshot_observed_at":"2026-08-05T19:54:58.609844Z","title":"An unsupervised autoregressive model for speech representation learning,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.609844Z"},"links":{"cited_paper":"/paper/1904.03240","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:d4d88d1678b2e93f0a0b99ce9af2fcc135743a097a802459801e34daa8998aef","observation_id":"b177be0e-b3b8-4219-b791-7006268441cc","resolution":{"observed_at":"2026-08-05T19:54:58.609844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:03.064398Z","title":"Acquiring language from speech by learning to remember and predict,","venue":null,"work_id":"7ac1fc8c-29b0-418c-b375-57e5009959c8","year":2020},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.613387Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:5a1303afcf78e4715770c786f06727f79772587a02c9b0e12d09125b75a7fb3b","observation_id":"73d39a96-2ea6-41e1-881d-0a986ab7417b","resolution":{"observed_at":"2026-08-05T19:55:03.113543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08392","last_updated":"2020-05-17T23:06:09Z","snapshot_observed_at":"2026-08-05T10:40:45.992290Z","submitted_at":"2020-05-17T23:06:09Z","title":"Vector-Quantized Autoregressive Predictive Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08392","snapshot_observed_at":"2026-08-05T19:54:58.616637Z","title":"Vector-quantized autoregres- sive predictive coding,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.616637Z"},"links":{"cited_paper":"/paper/2005.08392","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:9d28b7f75a06519a32e5040044b7eaab5a9244689b35d26d0690bb446df48d65","observation_id":"04458adf-6e74-495f-ae62-26106e634722","resolution":{"observed_at":"2026-08-05T19:54:58.616637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.934263Z","title":"Audio albert: A lite bert for self-supervised learning of audio representation,","venue":null,"work_id":"11b56ec1-464b-4703-b92a-bcc0692821be","year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.621129Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:4ded708b0b96c0d806a5e7704b050dcb49e1c8bf8ed2c4b9e9f3fbfe97838e26","observation_id":"4125ea9c-5623-4cdf-97da-333987beef75","resolution":{"observed_at":"2026-08-05T19:55:02.985774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.804506Z","title":"On generative spoken language modeling from raw au- dio,","venue":null,"work_id":"a0165116-620d-41d0-a337-9679057a31aa","year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.624665Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:985d10044015cf99a51a5359d3a5ffe6a0aca05fcac566e85ee2081336e90a61","observation_id":"6774d475-e580-4647-9742-715858ad99a6","resolution":{"observed_at":"2026-08-05T19:55:02.859177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.628627Z","title":"Audiolm: a language modeling approach to audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.628627Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:e71ce58a0506d440aa3321bbff0d889f527b37262b9cfce1728f5e01f53c2896","observation_id":"c35d794d-6ba2-43a0-a662-565838525c7c","resolution":{"observed_at":"2026-08-05T19:54:58.628627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18096","last_updated":"2023-07-08T07:25:14Z","snapshot_observed_at":"2026-07-06T15:34:44.280483Z","submitted_at":"2023-05-29T14:00:24Z","title":"Improving Textless Spoken Language Understanding with Discrete Units as Intermediate Target","version":2},"cited_work":{"arxiv_id":"2305.18096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18096","snapshot_observed_at":"2026-08-05T19:54:59.103141Z","title":"Improving Textless Spoken Language Understanding with Discrete Units as Intermediate Target","venue":"cs.CL","work_id":"58be03ee-5757-4bb5-beed-7398840f0b68","year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.632070Z"},"links":{"cited_paper":"/paper/2305.18096","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:f755ff65ec707d113cc83c75e770c748bcde9783d608ab20496acb638b36b9ea","observation_id":"4a55b06c-d015-495f-a306-39f267076dbf","resolution":{"observed_at":"2026-08-05T19:54:59.113274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.675767Z","title":"BERT: Pre- training of Deep Bidirectional Transformers for Language Under- standing,","venue":null,"work_id":"34774217-737c-42f3-8331-1c76d07ec3b2","year":2019},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.635519Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:12ed7e6c9daab269b8ed1d2fb6909a2cd96ec923c40415138a9535d3d4628fa7","observation_id":"4eb29282-33de-4d8d-b2ac-40aa568d4df9","resolution":{"observed_at":"2026-08-05T19:55:02.733522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T19:54:58.639389Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.639389Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:80580c6d114e61f8ef71356b1b3d53dfd4afb2c3491cca1d1e0dc2793811608b","observation_id":"54f7547d-408e-47fd-b58f-3c2612a5e04e","resolution":{"observed_at":"2026-08-05T19:54:58.639389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.541068Z","title":"Wav2vec 2.0: a framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"43591663-ad8d-4715-bdd4-10d7f2066ba8","year":2020},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.642906Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:263de24d52564bcdd421121b4eb3dd63c274f8fd856750810dc61bbb6363ef2c","observation_id":"05670626-1df8-47d1-a877-7bccc75d583d","resolution":{"observed_at":"2026-08-05T19:55:02.595018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.430249Z","title":"Contrastive learning of general-purpose audio representations,","venue":null,"work_id":"631d8c35-15e6-4cf6-8ca3-d6fcb2721041","year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.647061Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:ee321d2a8e2aa6d19f00d8524c180a5ff4fe24e886b312804685ab701a70d0b5","observation_id":"d0ea69db-a483-47df-a0f9-960dc3ab132b","resolution":{"observed_at":"2026-08-05T19:55:02.473345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.270723Z","title":"Unsupervised speech segmentation and variable rate repre- sentation learning using segmental contrastive predictive coding,","venue":null,"work_id":"b38ff930-c0f1-417f-9b06-33a518c95a8e","year":2002},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.650700Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:4b3809af18d5ddaf6514b27c34f376ee87f55f133f23dc331450ad3663556207","observation_id":"c036ce17-2c66-4ac3-a5f0-bec0c25cf112","resolution":{"observed_at":"2026-08-05T19:55:02.333859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.175663Z","title":"Self-normalization and noise- robustness in early auditory representations,","venue":null,"work_id":"bf8e49ad-f38b-4b46-939e-715faa992197","year":1994},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.653998Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:c7989ca23a1d35bbfccaddc0807b9211f734958235b260f79430a4b9a440a42b","observation_id":"d8f38926-fe18-4bef-b40f-325195474c9d","resolution":{"observed_at":"2026-08-05T19:55:02.231236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.657328Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.657328Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:689a903aeefa51e48961f01d5ac972e5bea493a009038a0a9b70835275fab7ae","observation_id":"a5178f83-656d-412d-a88b-be14c90d6f35","resolution":{"observed_at":"2026-08-05T19:54:58.657328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:02.036783Z","title":"Multiresolution spectrotem- poral analysis of complex sounds,","venue":null,"work_id":"a06b1458-7eb8-4176-813b-4009baeefd23","year":2005},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.660417Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:c2c7590a895eeabec61d21f0d349731756e61422a8f6dfff84015e6900c47c5e","observation_id":"764197d2-608a-47ea-a155-1fae0d4a3019","resolution":{"observed_at":"2026-08-05T19:55:02.100079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.919442Z","title":"Model metamers reveal divergent invariances between biological and ar- tificial neural networks,","venue":null,"work_id":"b43b479e-5a8e-4814-b8f4-acadc56726d2","year":2017},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.663600Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:e864c197564c61e19d3610de9f3f400d81b6a9cbe2f00caba2c976549b2a45e8","observation_id":"7dfd53ae-2f9a-4016-9a9a-a5fa14fbd665","resolution":{"observed_at":"2026-08-05T19:55:01.976683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"pii/0378595","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.971347Z","title":"Derivation of auditory filter shapes from notched-noise data,","venue":null,"work_id":"cf0dc010-52a2-41b7-a351-6b147866f352","year":1990},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.666884Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:a9607eabd87ed9da429e8937f4dd515dff7187e8b0f399d600e2ab16b5de3338","observation_id":"6a985c03-b404-43b8-903e-93fc23763d3c","resolution":{"observed_at":"2026-08-05T19:54:58.998024Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.805954Z","title":"Sound texture perception via statistics of the auditory periphery: evidence from sound syn- thesis,","venue":null,"work_id":"df90fccc-74b3-4a5d-b151-6c1cd791d679","year":2011},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.670026Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:5dd9cad21af67a2fc754c901de5a4f81e37a7579e756d1252d8d257fbfafe2f6","observation_id":"71303311-fc97-4f31-aa77-67021373af4d","resolution":{"observed_at":"2026-08-05T19:55:01.847895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T19:54:58.673271Z","title":"Language model beats diffusion – tokenizer is key to visual generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.673271Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:3acb2f1e3caa6eac147abba9f396c3ee77ba9f699d3e302b9714f22b838f492e","observation_id":"c0098db9-3dc5-4551-b07b-e52f6010aaf4","resolution":{"observed_at":"2026-08-05T19:54:58.673271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:58.677108Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.677108Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:b79ddf061cf11fc98dd40124370c410fc9313224d5eb44b6d4eb8c421e5e4a7b","observation_id":"2b59ce30-34e4-413c-8261-07bcdeafbaef","resolution":{"observed_at":"2026-08-05T19:54:58.677108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.657803Z","title":"Improving language understanding by generative pre-training,","venue":null,"work_id":"f5c353d1-055b-451c-b6f2-b60b8152dc35","year":2018},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.680937Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:da42263783b1746e3b5c677a08e193d4820d7d204644e95d0c82a856045579fa","observation_id":"653e79ba-084b-461e-be72-dbbf8515a5e7","resolution":{"observed_at":"2026-08-05T19:55:01.721880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T19:54:58.684181Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.684181Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:75d0d49ff0f6972bde8e50b683ba5da176266b681650a14ad51cb71379e04f82","observation_id":"f5858c51-8ec3-42f6-899c-28e3d76aa871","resolution":{"observed_at":"2026-08-05T19:54:58.684181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-08-08T08:22:25.110228Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-05T19:54:58.688240Z","title":"Root mean square layer nor- malization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.688240Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:c9de211211df20aecc3fe7b77f86fb96eae2dab3134c27224a3f12a7ae375954","observation_id":"1e70758c-5b26-475c-ab84-35265a244a88","resolution":{"observed_at":"2026-08-05T19:54:58.688240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.546602Z","title":"Libri-light: A benchmark for asr with limited or no supervision,","venue":null,"work_id":"108b8ce1-e90c-4c3f-8ca2-ef4f3b96dd54","year":2020},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.691750Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:c35e941eb603b117e9cbd465300c23db0c8d5cb9f4a7d4db893fa105c38cb234","observation_id":"3d165a1c-5b8b-4e06-a373-0f6b2f87e3a8","resolution":{"observed_at":"2026-08-05T19:55:01.611021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.388445Z","title":"Timit acoustic phonetic continuous speech cor- pus,","venue":null,"work_id":"4d5580aa-1b70-4f2d-a958-1ecbdd237eae","year":1993},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.695205Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:a052de1f41f22287c1f63c3bc49e3d181ece0fda4a78e953f57ccb9c87e46a53","observation_id":"e2c0c792-4af0-45a9-a891-87aa239c8340","resolution":{"observed_at":"2026-08-05T19:55:01.458253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.200752Z","title":"Speaker-independent phone recogni- tion using hidden markov models,","venue":null,"work_id":"83629d1f-44ab-4894-b5d0-9d01981f3c3e","year":1989},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.699082Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:98d504922e17540dcd25ae34fcd2c984fa7dfd97d0b77cadfe181af45daf6c7a","observation_id":"98d1da4f-be71-4a68-852d-3bc94bbb395d","resolution":{"observed_at":"2026-08-05T19:55:01.279439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:01.092305Z","title":"Scikit-learn: Machine Learning in Python,","venue":null,"work_id":"e519570d-fa35-4012-9d79-dabc8936b145","year":2011},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.703299Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:33838650137de8ce5e355d230373896fd5637b6b72f8511df80f182a4d474c15","observation_id":"eb7042ec-1ac7-468a-b583-3db817e346b2","resolution":{"observed_at":"2026-08-05T19:55:01.140934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11588","last_updated":"2020-12-01T15:53:57Z","snapshot_observed_at":"2026-08-01T21:31:01.785578Z","submitted_at":"2020-11-23T18:01:37Z","title":"The Zero Resource Speech Benchmark 2021: Metrics and baselines for unsupervised spoken language modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.11588","snapshot_observed_at":"2026-08-05T19:54:58.706814Z","title":"The zero resource speech benchmark 2021: Metrics and baselines for unsupervised spoken language modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.706814Z"},"links":{"cited_paper":"/paper/2011.11588","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:feb333a7b0badd660c7148f3cffd30fa8d8c0c4f9001bc1151b475409052f8d3","observation_id":"a2d0db29-082a-4ab4-8bf5-da843b7777f7","resolution":{"observed_at":"2026-08-05T19:54:58.706814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.951754Z","title":"Over-reliance on english hinders cognitive science,","venue":null,"work_id":"309c0b59-e64b-4f4d-ab43-903502bfad3e","year":2022},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.710255Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:987d55dceac5b324d9a3ae07da9f618f93304a895008cbc343da4abd12e2a4a5","observation_id":"38b04a89-0a8f-4ecd-b6ce-a817b2096755","resolution":{"observed_at":"2026-08-05T19:55:01.002185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.826722Z","title":"To- wards inclusive automatic speech recognition,","venue":null,"work_id":"9b921e63-a72c-4fd1-abae-5d827fa59d8f","year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.713597Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:6578c8f89c497b2d435010e7538f9d6cd4e8f5c8bb3a78c0bd44f0cc1ca63ccb","observation_id":"099f2fd0-5e9a-45d3-8cef-f1ff9189d8b0","resolution":{"observed_at":"2026-08-05T19:55:00.891669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.713859Z","title":"Say- cam: A large, longitudinal audiovisual dataset recorded from the infant’s perspective,","venue":null,"work_id":"ccf25ec9-1050-4344-aa04-bf4bb39b81f9","year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.716758Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:79b37f2025771447b0cc87a0a9cf542658ee90248373a18f6ede3b6ebcd1d5bb","observation_id":"3aaeb462-9d71-4e5c-ba65-82b91e492f2a","resolution":{"observed_at":"2026-08-05T19:55:00.778519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11796","last_updated":"2023-01-27T15:52:50Z","snapshot_observed_at":"2026-08-07T04:06:34.838867Z","submitted_at":"2023-01-27T15:52:50Z","title":"Call for Papers -- The BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11796","snapshot_observed_at":"2026-08-05T19:54:58.720381Z","title":"Call for Papers – The BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.720381Z"},"links":{"cited_paper":"/paper/2301.11796","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:0a426e8a91028ce408e9ad9e3d62f27df1f982b283fb3a475466813b2a97cc8c","observation_id":"071b6908-1925-49bf-b58e-757b99b7b746","resolution":{"observed_at":"2026-08-05T19:54:58.720381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.595873Z","title":"A task-optimized neural network repli- cates human auditory behavior, predicts brain responses, and re- veals a cortical processing hierarchy,","venue":null,"work_id":"cd67eebe-5067-4fee-9a60-27a20498a3a4","year":2018},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.723735Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:9d45319c18b3408820e21377c3223f6e36e0b4d6d3d3224409cdf135b6b2f6ca","observation_id":"19b671da-5252-4497-9d4b-a0caffead11c","resolution":{"observed_at":"2026-08-05T19:55:00.644771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.497771Z","title":"Toward a realistic model of speech processing in the brain with self-supervised learning,","venue":null,"work_id":"98bc9860-e3f0-4487-9f6c-3990dd360504","year":2022},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.727007Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:a3bfc5b11061a6d432bdac3320945dd32d4263052f3226f3294a60c2c2e9cc10","observation_id":"d7f67bdb-df30-48c7-bf43-d124bd131507","resolution":{"observed_at":"2026-08-05T19:55:00.557865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.359887Z","title":"Dissecting neural computations of the human auditory pathway using deep neural networks for speech,","venue":null,"work_id":"083cb330-e99b-402c-82fc-a8cbe79bd797","year":2022},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.730190Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:29c8246293f33f9f6520f22564fea0bbfeeabbde2d49c832f41c120190eae1e5","observation_id":"02a3ce6b-c9d5-4b31-b65d-c42660187c23","resolution":{"observed_at":"2026-08-05T19:55:00.429799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.239543Z","title":"Many but not all deep neural network audio models capture brain responses and exhibit correspondence between model stages and brain regions,","venue":null,"work_id":"e4b3b3e0-a833-4a3b-8548-68570a3d24c3","year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.733488Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:d884af3dc3b325df81cb574ed93e802eda00d16fe516687b24f5a58bd18395e8","observation_id":"aee78f11-cfe0-443e-8813-2da3653d8bce","resolution":{"observed_at":"2026-08-05T19:55:00.297487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.127030Z","title":"Speech taskonomy: Which speech tasks are the most predictive of fmri brain activity?","venue":null,"work_id":"736aca17-8f7b-46b2-bf7e-a26e5876950b","year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.736777Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:3da797010cae2de0f7318f63504afed6409aa66e67e7eecb9cac70a2bf37a2c3","observation_id":"91f4b4e3-66e6-4218-ac8c-0418f1508ccb","resolution":{"observed_at":"2026-08-05T19:55:00.192596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:55:00.008090Z","title":"Language in brains, minds, and machines,","venue":null,"work_id":"3b8dc37b-e33c-454b-8173-bb8d250a3a12","year":2024},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.741001Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:f0cb849ee31e7687ea7c9776f6e52ff8d9c557331cc618977c25bfaed4a4d2b7","observation_id":"3aff2a49-132d-4df5-803b-27c0a1a5079a","resolution":{"observed_at":"2026-08-05T19:55:00.058048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03832","last_updated":"2025-06-04T10:59:11Z","snapshot_observed_at":"2026-08-07T10:52:04.552965Z","submitted_at":"2025-06-04T10:59:11Z","title":"Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03832","snapshot_observed_at":"2026-08-05T19:54:58.744160Z","title":"Brain-tuned speech models bet- ter reflect speech processing stages in the brain,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.744160Z"},"links":{"cited_paper":"/paper/2506.03832","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:763319343ff2c6f3c0452693b73ae11ce2b450bca21832869663fe8bfece98cc","observation_id":"0264a1d7-45ec-4d1d-a2b8-29e6e9f2387a","resolution":{"observed_at":"2026-08-05T19:54:58.744160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:59.851698Z","title":"An algorithm for the machine calculation of complex fourier series,","venue":null,"work_id":"f282e61f-65a9-4341-bda1-28d02b86614b","year":1965},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.747668Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:6308532e51071af15745aee42964e7ba2aeb089c1d1e69ab227e88678fa61058","observation_id":"c3849522-5e98-42e5-b262-13da0475a8e1","resolution":{"observed_at":"2026-08-05T19:54:59.936362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:59.650232Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"332d1d97-2496-46f2-9d3b-4ab20303c1d6","year":2015},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.751677Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:b86e2a64417929e68b7165fe6f6ad31868ec7f0c5830231dd3f774aff395c073","observation_id":"13352801-f597-4a72-8ac0-fc4301aedecb","resolution":{"observed_at":"2026-08-05T19:54:59.764253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:54:59.532862Z","title":"codebook usage","venue":null,"work_id":"4c43a844-b071-4554-82aa-2074fa3b4127","year":null},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.755219Z"},"links":{"citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:b1cd22a26bffaa04e2328cc00ce382b431b65343288077e02ce40ec4fdb69fb9","observation_id":"ec17cb52-6a2a-46f9-a014-6dc96e011ce3","resolution":{"observed_at":"2026-08-05T19:54:59.574844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":35},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2508.11598."}