{"as_of":"2026-08-06T07:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c32904c269c5bdb896e3d39d867230d895c725d971382a1fff98b162a0b9ea11","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:00:14.179533Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20660/citation-record","integrity":"/paper/2508.20660/integrity","json":"/paper/2508.20660/citation-record.json","paper":"/paper/2508.20660"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.017016Z","title":"Sdr–half-baked or well done? In ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"acb14320-125d-4201-8be8-4b0b494694f9","year":2019},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.014177Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:0fea9ac2ddc282f73f4e323ea48a917060d54e97c7dddb4bfbcecc71dfc711e2","observation_id":"e9045120-c6bd-4e02-a8ef-0072e4086007","resolution":{"observed_at":"2026-08-05T15:00:15.022586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.878159Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":"a66a6ccb-37dc-4463-9188-6a11c618fd5f","year":2015},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.032179Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:beaa94f494bd0f32ad3f7828f463cdbffa90cde05744bfbbfeed4f7995f080a9","observation_id":"0c97b505-afe9-45f2-9ef1-596b508117c7","resolution":{"observed_at":"2026-08-05T15:00:14.924421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-07-06T07:06:12.726165Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-05T15:00:14.045603Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.045603Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:f925268af215cab25fc27c132a5099e76f10fa669d2f02354ff9b7a15475fd68","observation_id":"8f3a2d7c-3c5c-4a82-ad09-b6f4e4ee3e4e","resolution":{"observed_at":"2026-08-05T15:00:14.045603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.761156Z","title":"A short-time objective intelligibility measure for time-frequency weighted noisy speech","venue":null,"work_id":"b1fd5509-2dff-44d9-b7e2-36eda9be88f1","year":2010},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.064215Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:8b410ac3e41079686f1c053f3bf3bc348ae5b7cfdc37f2573e84d7783af686c8","observation_id":"49e0a2e3-dd50-461a-a6b3-fc6499b242ff","resolution":{"observed_at":"2026-08-05T15:00:14.812907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T15:00:14.073906Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.073906Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:e6ebfa2b9f1eba006f65f922257598f1a10dd03eeeabbd3661c12177dca0c0f8","observation_id":"92059eaf-e1d3-4fd6-a32d-58e5de8d0d8c","resolution":{"observed_at":"2026-08-05T15:00:14.073906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T15:00:14.080956Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.080956Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:550625f2bc67ae9580879bfb622f505d69acbcb8df127685ccd1da2ee82e2857","observation_id":"cd815554-0fb7-4877-a0b9-f2406c475e7b","resolution":{"observed_at":"2026-08-05T15:00:14.080956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01485","last_updated":"2025-03-03T12:49:09Z","snapshot_observed_at":"2026-08-04T04:25:05.713463Z","submitted_at":"2025-03-03T12:49:09Z","title":"FlowDec: A flow-based full-band general audio codec with high perceptual quality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01485","snapshot_observed_at":"2026-08-05T15:00:14.089389Z","title":"Flowdec: A flow-based full-band general audio codec with high perceptual quality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.089389Z"},"links":{"cited_paper":"/paper/2503.01485","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:b6305be991248eee46c5dead376d5ae67f7315013c23d0f1d0b2ad8e0d391fb0","observation_id":"379d0d46-c6e6-48b0-b389-e657e0d22e09","resolution":{"observed_at":"2026-08-05T15:00:14.089389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13071","last_updated":"2024-09-18T12:02:47Z","snapshot_observed_at":"2026-07-06T17:32:52.500465Z","submitted_at":"2024-02-20T15:13:38Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13071","snapshot_observed_at":"2026-08-05T15:00:14.103442Z","title":"Codec-superb: An in-depth analysis of sound codec models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.103442Z"},"links":{"cited_paper":"/paper/2402.13071","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:fe68ae7d3313f3ec446ed2e989b70307e0b13d2e7bc1b18cfcf0dc3efe766a10","observation_id":"dd009f05-b7c0-49a8-bca3-cdaa2670d4a1","resolution":{"observed_at":"2026-08-05T15:00:14.103442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12442","last_updated":"2023-05-26T13:17:11Z","snapshot_observed_at":"2026-08-04T06:41:22.315218Z","submitted_at":"2023-05-21T12:25:25Z","title":"Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus","version":2},"cited_work":{"arxiv_id":"2305.12442","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12442","snapshot_observed_at":"2026-08-05T15:00:14.374742Z","title":"Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus","venue":"cs.SD","work_id":"58c82df7-700d-4575-88e4-54dc35b4d9e4","year":2023},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.116555Z"},"links":{"cited_paper":"/paper/2305.12442","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:2ab2898951655839e410bc824407c840c7cce87bca44574e675465e52c7ab718","observation_id":"ef9e0fda-ef88-4633-b2cc-8b8da6e8ec72","resolution":{"observed_at":"2026-08-05T15:00:14.381991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-05T15:00:14.133170Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.133170Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:528af5f96912e395abb06af2069131cf1f13f17ed2081cfaeafa36111ab14846","observation_id":"d06df0a6-9d79-4011-803e-22139be9f85e","resolution":{"observed_at":"2026-08-05T15:00:14.133170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T15:00:14.143419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.143419Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:b39baa6e03659a768698716b061638223849520682ee223cf64128d360909165","observation_id":"ccf870b0-a18d-4c93-abe1-94eff0dcee0c","resolution":{"observed_at":"2026-08-05T15:00:14.143419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T15:00:14.150027Z","title":"Aohan Zeng, Zhengxiao Du, Mingdao Liu, Kedong Wang, Shengmin Jiang, Lei Zhao, Yuxiao Dong, and Jie Tang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.150027Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:bf993a92098b8b92b1ae09660ccf95890bb5c0eaed76db4728d9721e5da69ccb","observation_id":"31ade6f1-8007-4a2f-84af-848fe68826cc","resolution":{"observed_at":"2026-08-05T15:00:14.150027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T15:00:14.159489Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.159489Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:b45bdf21119c03ce6f7e5c3ff2e3b8048645059b50daf88e27eb9c28eb41f0da","observation_id":"c53f719a-b5e5-4271-b8d6-e98932066d8e","resolution":{"observed_at":"2026-08-05T15:00:14.159489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T15:00:14.164561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.164561Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:acc45bc59d59978b1b3cce1b2ffea1c80e82fa05c742a017eb49a47469de87f1","observation_id":"93203482-b7d1-49f0-8ed7-7fd2812cbe20","resolution":{"observed_at":"2026-08-05T15:00:14.164561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.693389Z","title":"The clips within this dataset are manually selected from public field recordings compiled by the Freesound.org project","venue":null,"work_id":"0c4ecf33-4580-4a75-90dd-15aa00423040","year":2000},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.173358Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:2fdfe1f8cc77984c2aba69e318153286fb51a689e07514accf207bcc58b8ce3d","observation_id":"5e2992c9-eb93-4c69-8f52-ea94bc1765ae","resolution":{"observed_at":"2026-08-05T15:00:14.706512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.662656Z","title":null,"venue":null,"work_id":"e4e7acfa-d8ac-4d19-be12-e549b37115c3","year":1991},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.179533Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:716542bae02b370adeab329de2be0dead3948fede1192fa4b0b6dcdafeb8e70b","observation_id":"5445decb-3782-43f6-ab4d-934660afc49d","resolution":{"observed_at":"2026-08-05T15:00:14.675893Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-04T18:12:22.604177Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-05T15:00:14.058277Z","title":"Versa: A versatile evaluation toolkit for speech, audio, and music","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.058277Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:358ae309f4c09be950d5fc81c460806a8d5146c7c78bc36eac9ef481ac71a0d0","observation_id":"2fb3cf35-e48e-468f-83b3-8bc50d89a366","resolution":{"observed_at":"2026-08-05T15:00:14.058277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.071512Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"5533f681-0796-40cc-8138-3166df8b24be","year":2017},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.991843Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:71961586e3024af4fd44a57e48442b6f97ee1afa8cdd6eb284ed256ef5d1b265","observation_id":"71afe80c-116d-42cc-b965-6cffa81d88dc","resolution":{"observed_at":"2026-08-05T15:00:15.077517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.092989Z","title":"Visqol v3: An open source production ready objective speech and audio metric","venue":null,"work_id":"6de8c2e8-8745-40c8-be53-d7e9ab86af09","year":2020},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.973695Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:fccbe4e3c9df62ecbd3200193ea3dbafa019bd509814d60cf13e0e0c0091925a","observation_id":"e4178831-f504-4363-8fbf-12f1d8439c64","resolution":{"observed_at":"2026-08-05T15:00:15.100047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-07-06T19:59:01.756640Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-05T15:00:14.039324Z","title":"Scaling transformers for low-bitrate high-quality speech coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.039324Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:ccc8d6a62afb5b4ad9a50be124df51a4a1347b4cde6b21fe5e66bb354ccdd43f","observation_id":"a1fb8b1a-4fd4-46d0-a271-3b7e7aeec344","resolution":{"observed_at":"2026-08-05T15:00:14.039324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.727793Z","title":"1632–1636,","venue":null,"work_id":"a88ff572-2205-4674-9d74-61ca44bdb383","year":2016},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.069461Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:79df5419dae613e0eca6afa1bdc5eb8e21e78aac719e8a41b56dae7b20e8b826","observation_id":"3190eddb-5666-4dde-8754-2cc8bf56d42b","resolution":{"observed_at":"2026-08-05T15:00:14.741535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.053966Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition","venue":null,"work_id":"e71bdf6c-b1fb-440c-be94-5212e9db19cd","year":2022},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.999297Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:5693ec7350214847f857d73cdab054c3b72eecd41ac52caae1cff361f844d007","observation_id":"ef66f28f-a91b-48ba-9091-de9ec5c49eb6","resolution":{"observed_at":"2026-08-05T15:00:15.059689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-07-06T20:41:42.199592Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T15:00:14.020393Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.020393Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:2525db0740c8647a26bab8d51f0fc7ca1411f35351b6ba2b859f6a36bd83dd98","observation_id":"40b1610e-2ed8-40ec-b53c-be989790466a","resolution":{"observed_at":"2026-08-05T15:00:14.020393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-05T15:00:13.980353Z","title":"Librimix: An open-source dataset for generalizable speech separation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.980353Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:33fd54070967355c173f84d44ff9f90cf3daff44eadee57f04b4788255a7a3b2","observation_id":"9db2a1b1-70dc-40ce-a056-72781458b97b","resolution":{"observed_at":"2026-08-05T15:00:13.980353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T15:00:14.052024Z","title":"Antony W Rix, John G Beerends, Michael P Hollier, and Andries P Hekstra","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.052024Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:ab398ddafc3c7340b1f2063cb87923b5aaba64d472a43ed246708bcbab1099ff","observation_id":"69c6417a-e655-405f-ad0b-77ab70ec46da","resolution":{"observed_at":"2026-08-05T15:00:14.052024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.035422Z","title":"Benchmarking representations for speech, music, and acoustic events","venue":null,"work_id":"f47f4deb-6723-41e5-b675-e50d9f3c11c4","year":2024},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.008369Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:a3422bbc18acbc33f46a0d618b55c0cb4e5885b5ad4edecc6dd159263f54ff6d","observation_id":"05f7c0ff-f8eb-47aa-8c09-462361b66ef4","resolution":{"observed_at":"2026-08-05T15:00:15.040602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T15:00:13.986387Z","title":"Accessed: 2024- 10-01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.986387Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:c6c6beeb76059172bddbeeda953d4900fd6adc64713b6df6f6cf73e8b40eac77","observation_id":"d8fd45dc-73ae-4d33-b7fc-36a93b950a4c","resolution":{"observed_at":"2026-08-05T15:00:13.986387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.993370Z","title":"Clotho- aqa: A crowdsourced dataset for audio question answering","venue":null,"work_id":"ed9f9594-82ca-47c0-b17a-12ca83c433db","year":2022},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.026878Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:b55c95127efdb4396e13308e41c88e06e18d6d7141f692c817275554a8d7ac49","observation_id":"c2a2d476-99a5-47f2-b5ce-84675ebd4f29","resolution":{"observed_at":"2026-08-05T15:00:15.001969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T15:00:13.435123Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2508.20660."}