{"as_of":"2026-08-06T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e115caaba18a85f8fedce8a68993889ad7dde5adcc74a532003cb9592bf42a54","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T16:50:28.996341Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.27667/citation-record","integrity":"/paper/2603.27667/integrity","json":"/paper/2603.27667/citation-record.json","paper":"/paper/2603.27667"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-04T09:31:21.793179Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"arXiv preprint arXiv:2506.01111","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:82185bf8ebf669a877a788d42b76c9d7e76e8ab8c1ce57e9e4d58b3898f0d3c5","observation_id":"27bde799-b3b5-4866-86e4-ecf1e2a11ab2","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Arushi Goel, Sreyan Ghosh, Jaehyeon Kim, Sonal Ku- mar, Zhifeng Kong, Sang gil Lee, Chao-Han Huck Yang, Ramani Duraiswami, Dinesh Manocha, Rafael Valle, and Bryan Catanzaro","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:56b18d7b769a25f904cfb644c55fe9fae3c000541c17ccb2a8568060ed9958b7","observation_id":"807caf8f-a394-43e0-8e96-8cd188daff0d","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02289","last_updated":"2022-11-04T07:01:16Z","snapshot_observed_at":"2026-07-06T14:14:23.751937Z","submitted_at":"2022-11-04T07:01:16Z","title":"CochlScene: Acquisition of acoustic scene data using crowdsourcing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.02289","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Il-Young Jeong and Jeongsoo Park","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2211.02289","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:8b7008964cdc0a3c8e8de2d00848a25c068436da8407210a498cc3910a205be5","observation_id":"0a0c47a3-3ba3-41f2-8bb2-793b3fdfb835","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Luoyi Sun, Xuenan Xu, Mengyue Wu, and Weidi Xie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:7a77b4dac5d5e14524c10d8bcb394bc368256962d48f5e785f8d3c99930eb497","observation_id":"5ede861f-5073-428c-90f0-0bfd6a8481af","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"dog bark- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:c5c86a93f4a08974a97184d06a4bf5be114fc7bbe6b0c6b7f8388ae29e7da842","observation_id":"92adc893-b4b7-4b3b-9e1e-08235a0165ac","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Give priority to audio tags","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:5f4ef6267fa448d8e5df20846a6a5c4ab0d249c5aa4da29cc6f6b5a9d1aeeb54","observation_id":"e322eaa1-e4a3-4615-b8fc-0a1086b297a2","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"plane), multiple possible sources, or common perceptual misinterpretations.Never include visual-based ambiguities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:72d29daa94870a4a6edc13862b890fbdee55c8ba23106cac05fc54a35d971077","observation_id":"f9015651-3c7b-4e08-9118-7f6ea8f479ea","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"sounds like","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:b8a78b4b599aa3b480fa74cdf36bbe5305fe3cb405b601419e76c9f69fe7150b","observation_id":"cd77ba0a-0745-4e62-b1e1-8b0fbaa86c65","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Do not invent facts beyond what the description supports","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:746f6b7a2ef54b01aeeead3695557a0c3bd3c6aba8753edbb93c7c0d8f18597f","observation_id":"3ecccdbe-ee46-4ad4-ba6f-25e6908e0751","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Each line is one JSON object","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:04b245154e3dd661114113e31e9bbef376c242430e8f047fc144c099194e0a8e","observation_id":"fa1b98dc-e537-4d73-a69a-f28a31786b15","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"No trailing commas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:136a17e94414534e5b2192b735fbe8df21b7e05fd6f1b6555fa7823bdc945bf0","observation_id":"ea85cc09-b45f-4b78-814d-7b46395fb80d","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:8526c0a032edd44e73f064f4aadf681b6369d90842a8d0df16cce12b8af83ad7","observation_id":"933f0ce4-b1b2-465b-afaa-f148f4fb996d","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Provide exact words/phrases taken from the description that justify the answer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:0680616117e544430b92b9a3cc5f69017cd2d76d61c44de8a9d4be8586101a89","observation_id":"3f2ab78d-a599-48ef-8f66-7f52d31bf4ca","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Set it to trueonlyfor the most difficult items in the batch; otherwise false","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:b03c2c164afbb3b59b1dd860ba137244ced4af5fc2ad5a93e3c3224656b05105","observation_id":"e13bbce6-1349-4198-9ea7-68efd2c49ce4","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"caption/description/text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:e6d1302334597741236d8b81a6bb92af0cfdb5293080e01b88deeabe716e1ffa","observation_id":"4c36dee1-09fa-4d64-858e-80d15018b0e3","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2603.27667."}