{"as_of":"2026-08-06T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e9ea133bb4affd97925d9718aa3fe55bbd16ec91af3f078aa74bfe21944788c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:10:56.208858Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:53:55.714650Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:2369b4d52b7d155da0c04d478524f474bfc863e7e2d912126dd051e58bf894c3","observation_id":"21e2559e-71e2-448e-bb54-2fb2d8744e75","resolution":{"observed_at":"2026-05-16T06:06:41.567125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:4793225bc3886d57d54aa95dc4f81fbed4fc258ddf5431ef10ecfeaf96d99ea8","observation_id":"2e2cc775-94ec-4211-bae6-f0d509600162","resolution":{"observed_at":"2026-05-16T05:59:51.122199Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T23:10:56.208858Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-05T23:10:55.644082Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.208858Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:d166e3ed8f5866bb050f89d35be6b41f2a92e3d0774d6c1f1d46c284db5998b9","observation_id":"cdd5867a-8a93-41d2-8127-0046701c044a","resolution":{"observed_at":"2026-08-05T23:10:56.208858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T17:56:56.866060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-05T17:56:48.234778Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:56.866060Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:256aeb4b8bffb5c41c54beb16176809443bde19d98c92549ab8ad873c0126cd4","observation_id":"684daa38-e47c-4732-a064-d44c3ff5fe60","resolution":{"observed_at":"2026-08-05T17:56:56.866060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T16:46:49.276513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-05T16:46:32.517360Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.276513Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:32377be841b5d3406c6f7a501c526cff2df65444e8205952e202dcda25941f29","observation_id":"e89c1e01-398a-4a9b-9a5f-14c3a259b39d","resolution":{"observed_at":"2026-08-05T16:46:49.276513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T15:00:14.164561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.164561Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:acc45bc59d59978b1b3cce1b2ffea1c80e82fa05c742a017eb49a47469de87f1","observation_id":"93203482-b7d1-49f0-8ed7-7fd2812cbe20","resolution":{"observed_at":"2026-08-05T15:00:14.164561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T13:36:07.188114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-05T13:36:02.819866Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.188114Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:a47a488c11e346fb204b618c1b3a6405198aa3e633ba8b86f4b3ab19440550c6","observation_id":"a03d558c-6c2f-4275-ae38-8bca8cd10ad5","resolution":{"observed_at":"2026-08-05T13:36:07.188114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T12:00:45.385843Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-05T12:00:44.845727Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:45.385843Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.02020"},"observation_digest":"sha256:bad00b82fbc13fc53878b1e798a9711f1bfa3009938ecb937ddfc579ce4d0ec7","observation_id":"b986fc34-f565-4f28-9bb0-aabbcd94cffc","resolution":{"observed_at":"2026-08-05T12:00:45.385843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T11:41:03.627960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-05T11:40:56.040966Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:03.627960Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:aeaf054dba895dfebcc25c9a5163c942bc475ce40d25fdbcf6978522e42c43fd","observation_id":"6177a395-c42e-4f7b-b2fb-c50277146890","resolution":{"observed_at":"2026-08-05T11:41:03.627960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-04T19:37:52.109011Z","title":"Speechtokenizer: Unified speech tok- enizer for speech large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-04T19:37:49.795866Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.109011Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:f19b947d5b70d2fa77681c6dcb5bd751a7e6427f1f9b309ef6f2b747328d6376","observation_id":"9d390e1d-3709-4354-a1b9-ec425eae07b5","resolution":{"observed_at":"2026-08-04T19:37:52.109011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:7ae1cc70409de7029c1df5fd490244fd747dc939624013e9efd3e5533496d050","observation_id":"ecdb9f2c-8b5f-49f5-bbe0-5e3761476c3c","resolution":{"observed_at":"2026-05-18T13:01:24.368802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2510.06201","last_updated":"2026-05-04T15:09:53Z","snapshot_observed_at":"2026-08-02T09:35:55.499787Z","submitted_at":"2025-10-07T17:54:12Z","title":"TokenChain: A Discrete Speech Chain via Semantic Token Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T09:14:58.542628Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2510.06201"},"observation_digest":"sha256:4ad4f17f6b7c19d849e2ffb409476be70033528b9b512a37d511c6e262f9b1a5","observation_id":"2bb80f16-9c37-465a-99cd-ffcb0690091c","resolution":{"observed_at":"2026-05-18T09:16:09.512778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:7189698e3b3049dfff788ea067ecbf1c34330397a817a36099bf88d66291d892","observation_id":"f011e8c3-3f3c-4f07-ba68-6169a9ff7206","resolution":{"observed_at":"2026-05-21T18:20:29.255424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-02T22:52:23.470401Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15491","last_updated":"2026-07-27T12:16:11Z","snapshot_observed_at":"2026-08-02T22:52:18.663317Z","submitted_at":"2026-02-17T10:59:33Z","title":"The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:52:23.470401Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2602.15491"},"observation_digest":"sha256:250ecef7921a67f544a8a5427fcc7f9319b6e204b14b83708a1df04ab266b42a","observation_id":"d8ad6aef-1f0e-4aa5-884c-4211e7627d5a","resolution":{"observed_at":"2026-08-02T22:52:23.470401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2604.08125","last_updated":"2026-04-10T10:48:12Z","snapshot_observed_at":"2026-07-31T09:02:47.778850Z","submitted_at":"2026-04-09T11:46:14Z","title":"PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:26.910105Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2604.08125"},"observation_digest":"sha256:5d5bc3d9d6c2c3bd79ed57ac55fb69175196658805db7eade40c331927f45756","observation_id":"e4018985-962f-4df1-b8a7-6b4f0df66bfe","resolution":{"observed_at":"2026-05-11T00:30:54.807546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:a5bf230a489b827be58945a21f3e7f742fdfccfdcb1f5b525d303a9d44ca5733","observation_id":"975d0b7c-3b6e-4e31-82c1-c4cbdca5aa29","resolution":{"observed_at":"2026-05-11T19:16:08.551547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:f60536e32fd9bf8b13679a53590bc3ed86b09e587f472e19603cf1bded948721","observation_id":"3564f7f5-83ee-4660-b759-e14212cc3e07","resolution":{"observed_at":"2026-06-30T23:15:07.805858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T06:43:52.735211Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:3d8582fbe721c71843657ee771c972c54d70b87c14bae0660446b7bff7079686","observation_id":"60910e39-7b60-4175-b555-72b61816971e","resolution":{"observed_at":"2026-05-21T06:44:00.768635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:46.831360Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:f6224eb00648449409d54b86b2095626121dbfc381060479904baa58d9228c64","observation_id":"c8bbad41-00b6-47b5-964b-2cba9831453e","resolution":{"observed_at":"2026-05-25T05:45:23.760085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:ce6417efb9afce7a40d824e9929b31c89d17d373d42d332ab097a7899cdb4888","observation_id":"c02b7ec1-3b85-4b62-a36a-ec76c0345d7d","resolution":{"observed_at":"2026-07-02T00:56:25.032216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-02T19:31:55.030656Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T08:38:51.371500Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.11611"},"observation_digest":"sha256:df54b7db41bf8d020138c6317cb75cbe885dd1ee6bef260e996989edbcb1a1d2","observation_id":"eff99e53-30ad-4c4e-878f-8128b51cdd53","resolution":{"observed_at":"2026-07-03T12:58:08.349544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-07-06T23:51:07.629939Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:fe176ff449489b0a1d9eba0d4dabb20c20b72e0601bd009affce6b975b8d8386","observation_id":"42b92062-9349-4acb-b6c3-969097fda026","resolution":{"observed_at":"2026-07-03T13:18:12.788140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:e7895ba36971ade9ed907df9114b28d52911322c04abca138163ce9a7628eafd","observation_id":"b17b94d4-8972-4347-89f2-5dd1c4b9e824","resolution":{"observed_at":"2026-07-03T16:08:37.515597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.20993","last_updated":"2026-06-18T23:50:54Z","snapshot_observed_at":"2026-08-05T09:19:18.829577Z","submitted_at":"2026-06-18T23:50:54Z","title":"Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-26T16:53:25.556222Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.20993"},"observation_digest":"sha256:177684c51ce676bc8642bd45d811a3f4791dcb018b80f382bb37421d411ce429","observation_id":"01ed80dd-013b-4107-b3ea-114674aa9bb4","resolution":{"observed_at":"2026-07-04T04:39:34.594685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.26824","last_updated":"2026-06-25T10:04:35Z","snapshot_observed_at":"2026-08-04T03:38:31.867526Z","submitted_at":"2026-06-25T10:04:35Z","title":"wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T02:49:35.819155Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.26824"},"observation_digest":"sha256:007f2da808d44579591dab426f9b064266275e4e453d46565afe876d14b02116","observation_id":"6a9700a0-a430-4ac4-9502-98329c5e74fd","resolution":{"observed_at":"2026-07-04T14:39:58.366769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:a83218096fa2f547ebb7c120b30258c7482a7a630f9d53efe353f0d956eff39d","observation_id":"28b4c19e-f21e-4c70-9bc7-ab4db1393272","resolution":{"observed_at":"2026-07-01T11:45:47.146929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-02T09:53:17.632449Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:b8a81168615700fef531101bc971ed9e2c47a3be9176ad376b9d9ef4231d7ae6","observation_id":"e6451e05-4307-47ec-9477-f9e7730f820b","resolution":{"observed_at":"2026-07-07T14:53:55.721428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-01T22:28:21.964747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15755","last_updated":"2026-07-31T04:37:11Z","snapshot_observed_at":"2026-08-05T23:11:00.580713Z","submitted_at":"2026-07-17T08:47:58Z","title":"AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T22:28:21.964747Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.15755"},"observation_digest":"sha256:a1854d0d11531e5f90c445e52b1e7c90105a52fafa2be7302942fb5c4a6528b7","observation_id":"706dcea2-3cce-4293-8aa2-6facee4b7f77","resolution":{"observed_at":"2026-08-01T22:28:21.964747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-03T01:58:26.210946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15755","last_updated":"2026-07-31T04:37:11Z","snapshot_observed_at":"2026-08-05T23:11:00.580713Z","submitted_at":"2026-07-17T08:47:58Z","title":"AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T01:58:26.210946Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.15755"},"observation_digest":"sha256:4cded9ee8056db91954fabeb668f9c953b78ca2701fa0da4a1585d37e948794d","observation_id":"704dae48-2532-4840-ace5-216e89f6dfbc","resolution":{"observed_at":"2026-08-03T01:58:26.210946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-01T20:22:47.787655Z","title":"SpeechTok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16657","last_updated":"2026-07-18T06:24:59Z","snapshot_observed_at":"2026-08-05T17:53:32.656351Z","submitted_at":"2026-07-18T06:24:59Z","title":"HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:22:47.787655Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.16657"},"observation_digest":"sha256:d00ef75f45d7c567786d0d26f42269cd9a4192746a64ea7765207591dd531cc3","observation_id":"dac67f1b-7032-41fc-801a-e19e4c436218","resolution":{"observed_at":"2026-08-01T20:22:47.787655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-01T08:25:27.411588Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21132","last_updated":"2026-07-23T10:12:36Z","snapshot_observed_at":"2026-08-01T08:25:26.569483Z","submitted_at":"2026-07-23T10:12:36Z","title":"Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:25:27.411588Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.21132"},"observation_digest":"sha256:8240bb7b873cf7a9c63ae8ee226dbb4de0e35cc90f192171acad7322724b72b9","observation_id":"5ae0cf21-b0fb-4649-bef0-5810607e3b1c","resolution":{"observed_at":"2026-08-01T08:25:27.411588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-30T10:34:57.884102Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T23:14:44.484082Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T10:34:57.884102Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:b40491ad095b71c2f9363fb94ea2ffac33424087c6336f0f0df3a257993aa53f","observation_id":"a54b8c01-8f04-4c63-8591-12d3120f4b7f","resolution":{"observed_at":"2026-07-30T10:34:57.884102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-03T01:50:57.207168Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T23:14:44.484082Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.207168Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:9243bee7a9ddc2d983d1228bca91bad7d41cd4f092a4870435c014ae4774c130","observation_id":"184be546-ffba-4adf-86ec-b83c1e6b6403","resolution":{"observed_at":"2026-08-03T01:50:57.207168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.16692/citation-record","integrity":"/paper/2308.16692/integrity","json":"/paper/2308.16692/citation-record.json","paper":"/paper/2308.16692"},"outbound":[],"paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2308.16692."}