{"as_of":"2026-08-04T15:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac153d613169601f0d4fd6d36df24d5d9c8efc5487994d207c48f4f56db28f0b","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:30:25.084605Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:30:23.235399Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04584","snapshot_observed_at":"2026-08-04T11:30:23.235399Z","title":"Following the rapid advancement of multimodal large language models (MLLMs), the field of large audio language models (LALMs) has emerged quickly","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.235399Z"},"links":{"cited_paper":"/paper/2510.04584","citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:2b2e5eb398562d53d971b6b1e20db3f80dfd2fac0c2d9f2529fd9843fc188b76","observation_id":"3e852a07-5a27-4c41-9fa7-ef95095a0aaa","resolution":{"observed_at":"2026-08-04T11:30:23.235399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"cited_work":{"arxiv_id":"2510.04584","doi":"10.48550/arxiv.2510.04584","metadata_source":"pith","pith_arxiv_id":"2510.04584","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","venue":"cs.CL","work_id":"63b4a48a-8dff-4e0b-8d8f-47905c8b637b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2510.04584","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:3bafcf158657002a586365bc55e5b5392fb08c62bc8939ab8f21876b814c5127","observation_id":"49bb2e9d-88ae-4555-8360-4846a9139db7","resolution":{"observed_at":"2026-06-25T02:18:11.179848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"cited_work":{"arxiv_id":"2510.04584","doi":"10.48550/arxiv.2510.04584","metadata_source":"pith","pith_arxiv_id":"2510.04584","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","venue":"cs.CL","work_id":"63b4a48a-8dff-4e0b-8d8f-47905c8b637b","year":2025},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2510.04584","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:057467e579629b2496e2165d2f89eeead76b9f8ddd0b177a2b181dc71f7692bc","observation_id":"af7227b8-3b48-4510-864f-4cd11dc8a227","resolution":{"observed_at":"2026-07-03T01:37:30.595468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"cited_work":{"arxiv_id":"2510.04584","doi":"10.48550/arxiv.2510.04584","metadata_source":"pith","pith_arxiv_id":"2510.04584","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","venue":"cs.CL","work_id":"63b4a48a-8dff-4e0b-8d8f-47905c8b637b","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-03T04:36:58.884789Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2510.04584","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:cbee09efefeb9505f35bcd20495ecec02f667fa038b4779860ed59b9458f654b","observation_id":"470046cb-a9c4-465c-8e1c-8c850675b5d9","resolution":{"observed_at":"2026-06-30T22:15:05.646311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.04584/citation-record","integrity":"/paper/2510.04584/integrity","json":"/paper/2510.04584/citation-record.json","paper":"/paper/2510.04584"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04584","snapshot_observed_at":"2026-08-04T11:30:23.235399Z","title":"Following the rapid advancement of multimodal large language models (MLLMs), the field of large audio language models (LALMs) has emerged quickly","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.235399Z"},"links":{"cited_paper":"/paper/2510.04584","citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:2b2e5eb398562d53d971b6b1e20db3f80dfd2fac0c2d9f2529fd9843fc188b76","observation_id":"3e852a07-5a27-4c41-9fa7-ef95095a0aaa","resolution":{"observed_at":"2026-08-04T11:30:23.235399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.304577Z","title":"These perturba- tions are designed to preserve the original semantic meaning of the questions and choices, offering alternative representa- tions of the same information","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.304577Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:1cb26ae657a9c23bca6077314f7f78aea8ae608eeeccba57c27e67899df2a91e","observation_id":"302abdee-bd4b-4cd4-865e-602e07c180ff","resolution":{"observed_at":"2026-08-04T11:30:23.304577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.392039Z","title":"For the choice-ordering permutation, the original text length is pre- served","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.392039Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:065e7a3c175f02cbf7a890e3a6673f9fc0f1fe45bfd39724ed7e3fcb69fece7e","observation_id":"51a42afd-aec3-45f5-8c5a-95cc6a719008","resolution":{"observed_at":"2026-08-04T11:30:23.392039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.477336Z","title":"This setup respects the original order of answer choices and phrasing of questions, ground truth answers, and distractors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.477336Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:5b2f0b6c93316b5c905bcb22abf27e20873462bc575fc55ffd359bcfe8a6f117","observation_id":"f3ee7b69-fd8a-44cd-9bca-bb061b026c11","resolution":{"observed_at":"2026-08-04T11:30:23.477336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.538218Z","title":"Our findings show that LALMs are highly sensi- tive to minor perturbations in MCQA, with distractor rephras- ings causing the largest performance drops","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.538218Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:94da68a998eac7c909beaedb3417d31d6ba54ad0cafe295e103e584599773ef1","observation_id":"a5233d40-6004-45b9-b5ae-4619374d9c12","resolution":{"observed_at":"2026-08-04T11:30:23.538218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.615681Z","title":"Linguistics, Artificial Intelligence and Language and Speech Technologies: from Research to Applications","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.615681Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:954f9e3de0fd7326148ef32bcd6ba0141c2e5ed7a5871d5f225ca56bc19c238a","observation_id":"5348dda0-0f75-4968-8063-f4d2aeef9e66","resolution":{"observed_at":"2026-08-04T11:30:23.615681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.677251Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.677251Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:e00e287ad062545a2061ec5b90709f8bbbe15e420dc979d056a67db43032d3c6","observation_id":"3cdb177e-5471-4044-948f-7c98ffec934d","resolution":{"observed_at":"2026-08-04T11:30:23.677251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.737574Z","title":"video- salmonn: Speech-enhanced audio-visual large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.737574Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:695d416a4ef6b253adb588f208eb95392fe3645d343e3d62dd2f598eee9435ae","observation_id":"3d753db5-cd62-402e-8259-afb4866509c3","resolution":{"observed_at":"2026-08-04T11:30:23.737574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.790508Z","title":"GAMA: A large audio-language model with ad- vanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.790508Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:5a20fdf40901cd01f98482f9347fdede1e418c1950b10ea7b0b5f235f2bb9dab","observation_id":"923d57c3-9cd7-4dd2-a534-d8266cdd3fb5","resolution":{"observed_at":"2026-08-04T11:30:23.790508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.856256Z","title":"Au- dio Flamingo 2: An Audio-Language Model with Long-Audio Under- standing and Expert Reasoning Abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.856256Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:69edbc2de8fb34db923700081b57a23e954bb6bf1ff219b8c2f3336888bd9259","observation_id":"550571ec-c918-4b8d-a03d-a928a6f27c30","resolution":{"observed_at":"2026-08-04T11:30:23.856256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T11:30:23.933110Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.933110Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:1e548c0fd4c0e0665db9e797bf74a383079eb91dd2f51f81badf24c35b7e7c40","observation_id":"531bb640-cec9-4b54-8024-0be576a96c4e","resolution":{"observed_at":"2026-08-04T11:30:23.933110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:23.980127Z","title":"Audio-reasoner: Improving reasoning capability in large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:23.980127Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:9dc70f54bbffdd5362a7c8b4473b430e837c9f14844306672c4b73e010884439","observation_id":"71b16081-fcf1-40b4-b394-8a1449ea2130","resolution":{"observed_at":"2026-08-04T11:30:23.980127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-04T11:30:24.063390Z","title":"Kimi-audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.063390Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:3fb3af0b8e14eb9e218c16b91392daa5ed8e041bed5047b9736019572cd3c3eb","observation_id":"543471d7-be7d-4d45-a80f-b941742a301b","resolution":{"observed_at":"2026-08-04T11:30:24.063390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.120047Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.120047Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:e39d9dadf7a3980c48c0b7dc44b200c73e5ccbe4e3e193d0784ca653ce44a018","observation_id":"84916b07-3929-41c2-9924-bd98cd7b559d","resolution":{"observed_at":"2026-08-04T11:30:24.120047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.201281Z","title":"Dynamic-superb: Towards a dynamic, collab- orative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.201281Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:7b75e5f9e1d5e3c6ae29ccb1830e903b18da354feccb4c3fdd0be784b4bdf0aa","observation_id":"918cf2bc-ae51-4a9e-8da7-beae995831bd","resolution":{"observed_at":"2026-08-04T11:30:24.201281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.259551Z","title":"Air-bench: Benchmarking large audio-language models via genera- tive comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.259551Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:9f06f9371d111d28395d78e77cc39d49a0509335568c059ef76cb2db3c289158","observation_id":"9becbd5a-047f-419d-ae9b-c32eb247ec7f","resolution":{"observed_at":"2026-08-04T11:30:24.259551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.315864Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.315864Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:264d359e69ca2775e8fc5e7c3988c0009f3c0ed8b1a0aeb5ae4d132d87a45695","observation_id":"c30e5c98-47cf-4324-a09a-0cf86fc4ae18","resolution":{"observed_at":"2026-08-04T11:30:24.315864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.402318Z","title":"Dynamic-superb phase-2: A collaboratively ex- panding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.402318Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:ee770db5a90681e7101e04c6c21247098be7c54edcdb6e97dce4b0eca5e319b9","observation_id":"fb534195-33ff-45a7-b837-0a850d4cdea6","resolution":{"observed_at":"2026-08-04T11:30:24.402318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.468073Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.468073Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:13b2af3bc30a8626a51438d23d7c5201e1806460dd1ab77519bb48087168985c","observation_id":"20852075-0bb4-4ca2-a18c-9a5abd7a7a80","resolution":{"observed_at":"2026-08-04T11:30:24.468073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-02T08:58:30.438344Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-04T11:30:24.529386Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.529386Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:62bdd999a8309fb59dd9389afd08a1e91cf15057716946bf07911b1de3b882da","observation_id":"aa23bad6-c2cb-4114-9261-b27d6cec8f14","resolution":{"observed_at":"2026-08-04T11:30:24.529386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.583067Z","title":"SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.583067Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:e11401bbb5c85f8cf97604367b0da47470e219e71e8ec04e17d1b4e071c16a7c","observation_id":"0081dd8e-8523-4613-a63e-8b86ceaa15cd","resolution":{"observed_at":"2026-08-04T11:30:24.583067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-04T11:30:24.643677Z","title":"MMSU: A Massive Multi- task Spoken Language Understanding and Reasoning Benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.643677Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:db98aeb343651d5fa1b0ce7c7573f1ce864bf31c0a0764a0c7c4c150f887f894","observation_id":"3e995a40-ed19-4385-b032-1121d77dc2f3","resolution":{"observed_at":"2026-08-04T11:30:24.643677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.700317Z","title":"Large Language Models are not Robust Multiple Choice Selectors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.700317Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:592c65874414dab9e3368f586b0d81b08dea639101de94406d80da3a27cdf328","observation_id":"6d01e8eb-0828-42b6-989c-fd5b674c38df","resolution":{"observed_at":"2026-08-04T11:30:24.700317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.802096Z","title":"Measuring massive mul- titask language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.802096Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:f31272ab6c14732e6ac75cb87cf295a6c1406c7899cb632555bce3f31dbd346a","observation_id":"fbce7601-448a-4283-8ef7-9531dff5df8a","resolution":{"observed_at":"2026-08-04T11:30:24.802096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.884481Z","title":"Hellaswag: Can a machine really finish your sentence?,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.884481Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:2b14c96bb3346d05323a6348e3c877ed8a1cae7d4a6dff7d7d518444e13e3fd1","observation_id":"232d0a9d-b02d-41a9-aa07-9154694fd44c","resolution":{"observed_at":"2026-08-04T11:30:24.884481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:24.942414Z","title":"MMLU-pro: A more robust and challenging multi-task language understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:24.942414Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:fe127f8869e05236b69e89ed688891870a316d834656123890ee10990a4615f2","observation_id":"928b5ccc-70ac-4990-a940-c6bf97c4a469","resolution":{"observed_at":"2026-08-04T11:30:24.942414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:25.014278Z","title":"Which of these best describes multiple choice evaluation with LLMs? a) forced B) flawed C) fixable D) all of the above,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:25.014278Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:031bb852042d94c0e96faf0bb09620bd1f18a947eaecdbd4a74dcd3452662275","observation_id":"5b1d35b6-1be3-4b4f-b436-3b2df6a8ada3","resolution":{"observed_at":"2026-08-04T11:30:25.014278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:30:25.084605Z","title":"SCORE: Systematic COnsistency and robustness evaluation for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T11:30:25.084605Z"},"links":{"citing_paper":"/paper/2510.04584"},"observation_digest":"sha256:b01693f2d2f7964481682979600fb880fae75c6ba5a98e37293f5544784ada77","observation_id":"d14146b7-6855-4750-837a-659f35624923","resolution":{"observed_at":"2026-08-04T11:30:25.084605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.04584","last_updated":"2026-06-24T15:08:01Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T11:30:22.923124Z","submitted_at":"2025-10-06T08:36:17Z","title":"Robustness assessment of large audio language models in multiple-choice evaluation"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 4 inbound Pith citation observations for arXiv:2510.04584."}