{"as_of":"2026-08-11T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b6712a8680c28015cdae64a9e6f66a94d368933b417943c739e207521223f9d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:27:27.254326Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:5befe6b8384ebc9ef09bc1143120309b1319b570ef3fdad1c272bf319c44f667","observation_id":"b1a9b804-2953-4666-8849-742c3f602ebf","resolution":{"observed_at":"2026-05-17T00:50:14.018476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-11T14:27:27.254326Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-11T14:20:21.679613Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.254326Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:42c4a9d6273323a709e7eae7d97838a50ce4ebe5c12d0a6f10b373022095beec","observation_id":"6b5f935f-5e54-4c99-b575-ea8ef3f15a60","resolution":{"observed_at":"2026-08-11T14:27:27.254326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T22:40:25.563518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01034","last_updated":"2025-01-11T03:47:08Z","snapshot_observed_at":"2026-08-11T15:23:11.820554Z","submitted_at":"2025-01-02T03:28:52Z","title":"Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:25.563518Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.01034"},"observation_digest":"sha256:6d709baa97e52de1b327a446c52b5fd7949b283873e425d1ce67694dd9fad6b0","observation_id":"b22e8a33-f036-4fe4-bb3f-4b9bd2faa5a3","resolution":{"observed_at":"2026-08-10T22:40:25.563518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T21:24:18.256256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04962","last_updated":"2025-05-27T16:14:30Z","snapshot_observed_at":"2026-08-11T15:34:43.632483Z","submitted_at":"2025-01-09T04:30:12Z","title":"VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:24:18.256256Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.04962"},"observation_digest":"sha256:f265db1dc2f1d533fe092889570b63b093cee35056b2f8a5984f06d07d47cb2a","observation_id":"e87f1a87-d1f4-4327-82aa-c7ad876f3b05","resolution":{"observed_at":"2026-08-10T21:24:18.256256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T14:36:19.925145Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-10T17:21:32.264725Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.925145Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:ef9f6d00ece75b523f08b03beb0d034a5fd1e7ec55cd2de4b63364b9e1736fc7","observation_id":"ac52300f-da3f-4ae7-a13e-246550a4259a","resolution":{"observed_at":"2026-08-10T14:36:19.925145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T12:30:52.122984Z","title":"Dimension-based quality modeling of transmitted speech","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-08-10T22:41:16.294643Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-10T12:30:52.122984Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.17202"},"observation_digest":"sha256:d3410ea0f76b736d021e4c19fb0f3285a04afa56cae9fb7be551a394ede00bd2","observation_id":"cbe61ebe-1ea8-4841-a900-d20a5fa16e6f","resolution":{"observed_at":"2026-08-10T12:30:52.122984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-09T19:24:20.433964Z","title":"Audiobench: A universal benchmark for audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00358","last_updated":"2025-02-20T22:37:12Z","snapshot_observed_at":"2026-08-10T19:20:27.419561Z","submitted_at":"2025-02-01T07:40:29Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:20.433964Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2502.00358"},"observation_digest":"sha256:0768c0cc077a611ed75f6386383e48add11a18f338db98c63de63885ab7ad782","observation_id":"6d0e6881-6005-4f12-aecb-dac4844dd551","resolution":{"observed_at":"2026-08-09T19:24:20.433964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:76e86431cdd569de09d6f124f73ec7706b6606158fb157d0dfba6ec0498e408a","observation_id":"2d19c0f1-da05-420b-90a0-6e611388aff7","resolution":{"observed_at":"2026-05-22T20:45:08.211361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T14:07:23.503947Z","title":"Wu, J., Gaur, Y ., Chen, Z., Zhou, L., Zhu, Y ., Wang, T., Li, J., Liu, S., Ren, B., Liu, L., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.503947Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:87efd36e6742931b8250e5addf342828c8deb36c0fd29a2ceefa81ed808022a7","observation_id":"20831a34-18e7-4c68-9a0e-3efe59b7320f","resolution":{"observed_at":"2026-08-07T14:07:23.503947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T11:28:59.437281Z","title":"Audiobench: A universal benchmark for audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T15:38:03.456563Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.437281Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:16ff914ee7d0cc03629a587be5c3ffbcfb912b184a3a21325379d50d2f5b52e7","observation_id":"29ce5b87-dae4-464e-bda0-2ea07661c841","resolution":{"observed_at":"2026-08-07T11:28:59.437281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T11:26:23.203188Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02457","last_updated":"2025-06-03T05:21:51Z","snapshot_observed_at":"2026-08-10T06:54:09.759058Z","submitted_at":"2025-06-03T05:21:51Z","title":"SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:23.203188Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.02457"},"observation_digest":"sha256:0afaf794da63a7a1e9361ecdf3bbcae63a1f741d8dc6eb003ba45f244bf7270d","observation_id":"0db694d5-841a-41cf-99e1-1c9efe1a8c85","resolution":{"observed_at":"2026-08-07T11:26:23.203188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T00:59:48.715523Z","title":"Audiobench: A univer- sal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.715523Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:209b12f1a81a623d04b203a702c3cc4f3d67313ed8bb543f65a6a8ed803745ab","observation_id":"6512d42e-079e-4ed9-8525-b66be04faeb0","resolution":{"observed_at":"2026-08-07T00:59:48.715523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-06T23:41:49.687916Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-11T07:46:06.032681Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.687916Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:25f0ebd468b7de64b121e4038fa0eef17b3f381e08f05e817f44eee63c84820d","observation_id":"68ba51d8-c7cb-41db-bfb0-5262436c9773","resolution":{"observed_at":"2026-08-06T23:41:49.687916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:1128a64f9115f0bc0e7a5e7e30888725fea1bc6589459ab02157442cc9bea85a","observation_id":"c0e91432-1f42-4e51-96d7-0148ee36ad85","resolution":{"observed_at":"2026-05-18T05:45:56.145885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-08-11T15:54:23.640357Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:9aa462c75c6d30857665b7d5049e37807c2bfd12ca20d050dfc9efa77a212913","observation_id":"3d039abb-ea5e-429e-ae52-6d05891267e9","resolution":{"observed_at":"2026-05-11T23:16:36.090825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2605.26176","last_updated":"2026-05-25T05:37:15Z","snapshot_observed_at":"2026-08-11T15:28:56.329656Z","submitted_at":"2026-05-25T05:37:15Z","title":"PitchBench: Measuring Pitch Hearing in Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T21:05:59.172850Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2605.26176"},"observation_digest":"sha256:fba358e9a3ef69a27fcef95a8f0cdb3efe093405187558da6c6063539222e212","observation_id":"8c1f157e-598f-42d7-b795-c58e8df79f59","resolution":{"observed_at":"2026-06-29T22:44:02.190822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-02T20:27:06.280658Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T19:51:59.265579Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2606.08194"},"observation_digest":"sha256:5d360c6cb38f494fe8a35eb8f35a1babaaaa32ab56b614053d0764c69cedf7ec","observation_id":"bf6034b7-fcef-4acd-9d12-1857c9035139","resolution":{"observed_at":"2026-07-02T21:17:24.545637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:729693915a12304ce5a49419d48b3fc1acfd96bc3b1e20380bb1bc1e18636124","observation_id":"d81f3354-8dc4-4430-bafe-563f94290b38","resolution":{"observed_at":"2026-06-30T22:15:05.582467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-03T03:09:40.573819Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-07T14:52:35.127533Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:dd574251e9fbf27de1641d3b7f08553c5a1baf5c8aca5e3844713930a9eabb93","observation_id":"8bff6c29-2a2f-4479-a0c5-a5c03635bc2e","resolution":{"observed_at":"2026-07-07T14:53:55.866469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-02T08:34:05.324498Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-03T03:09:40.573819Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T08:34:05.324498Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:84d5f65dc1ca2797fd380d33969de99838d781fab685afb200a816555e45c2d5","observation_id":"7b4e7f6d-8971-441e-87c9-1faa15b3e281","resolution":{"observed_at":"2026-08-02T08:34:05.324498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-01T07:12:15.816142Z","title":"arXiv preprint arXiv:2406.16020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.816142Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d6c83a360c6792aa44ba8fe12bdd6435b2f5f00e34762186e64bf462f241ec2a","observation_id":"e5c0c47f-6b82-4139-b0e8-2c95d94bf9d0","resolution":{"observed_at":"2026-08-01T07:12:15.816142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16020/citation-record","integrity":"/paper/2406.16020/integrity","json":"/paper/2406.16020/citation-record.json","paper":"/paper/2406.16020"},"outbound":[],"paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","latest_version":5,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2406.16020."}