{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:U47DZTEFN423QUJ5ZMPC5LT3LD","short_pith_number":"pith:U47DZTEF","schema_version":"1.0","canonical_sha256":"a73e3ccc856f35b8513dcb1e2eae7b58e9a4428ab27aa745a58a532bd4581e35","source":{"kind":"arxiv","id":"2508.07470","version":2},"attestation_state":"computed","paper":{"title":"AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ramani Duraiswami, Rishie Raj, Sanjoy Chowdhury, Sayan Nag, Siminfar Samakoush Galougah","submitted_at":"2025-08-10T20:06:42Z","abstract_excerpt":"Current audio-visual (AV) benchmarks focus on final answer accuracy, overlooking the underlying reasoning process. This makes it difficult to distinguish genuine comprehension from correct answers derived through flawed reasoning or hallucinations. To address this, we introduce AURA (Audio-visual Understanding and Reasoning Assessment), a benchmark for evaluating the cross-modal reasoning capabilities of Audio-Visual Large Language Models (AV-LLMs) and Omni-modal Language Models (OLMs). AURA includes questions across six challenging cognitive domains, such as causality, timbre and pitch, tempo"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.07470","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-08-10T20:06:42Z","cross_cats_sorted":[],"title_canon_sha256":"9499e94d8568d1c764c106595340b15033c677baea67724decac97d3c0549ff3","abstract_canon_sha256":"72319636e9e79b28a54fde65f7b4485f2196a11e1f356bc56291f8b7e8d168f5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:57:00.888611Z","signature_b64":"X3m5R56UurRFjT8JxDKSImYA0W5RcTgYJ1joyWKDNj+Edgl6y6msSNcogc15gcdSWtVzThkGVTMtb2XlcHirDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a73e3ccc856f35b8513dcb1e2eae7b58e9a4428ab27aa745a58a532bd4581e35","last_reissued_at":"2026-07-05T11:57:00.888137Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:57:00.888137Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ramani Duraiswami, Rishie Raj, Sanjoy Chowdhury, Sayan Nag, Siminfar Samakoush Galougah","submitted_at":"2025-08-10T20:06:42Z","abstract_excerpt":"Current audio-visual (AV) benchmarks focus on final answer accuracy, overlooking the underlying reasoning process. This makes it difficult to distinguish genuine comprehension from correct answers derived through flawed reasoning or hallucinations. To address this, we introduce AURA (Audio-visual Understanding and Reasoning Assessment), a benchmark for evaluating the cross-modal reasoning capabilities of Audio-Visual Large Language Models (AV-LLMs) and Omni-modal Language Models (OLMs). AURA includes questions across six challenging cognitive domains, such as causality, timbre and pitch, tempo"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.07470","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.07470/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.07470","created_at":"2026-07-05T11:57:00.888197+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.07470v2","created_at":"2026-07-05T11:57:00.888197+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.07470","created_at":"2026-07-05T11:57:00.888197+00:00"},{"alias_kind":"pith_short_12","alias_value":"U47DZTEFN423","created_at":"2026-07-05T11:57:00.888197+00:00"},{"alias_kind":"pith_short_16","alias_value":"U47DZTEFN423QUJ5","created_at":"2026-07-05T11:57:00.888197+00:00"},{"alias_kind":"pith_short_8","alias_value":"U47DZTEF","created_at":"2026-07-05T11:57:00.888197+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.14358","citing_title":"Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces","ref_index":79,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD","json":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD.json","graph_json":"https://pith.science/api/pith-number/U47DZTEFN423QUJ5ZMPC5LT3LD/graph.json","events_json":"https://pith.science/api/pith-number/U47DZTEFN423QUJ5ZMPC5LT3LD/events.json","paper":"https://pith.science/paper/U47DZTEF"},"agent_actions":{"view_html":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD","download_json":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD.json","view_paper":"https://pith.science/paper/U47DZTEF","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.07470&json=true","fetch_graph":"https://pith.science/api/pith-number/U47DZTEFN423QUJ5ZMPC5LT3LD/graph.json","fetch_events":"https://pith.science/api/pith-number/U47DZTEFN423QUJ5ZMPC5LT3LD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD/action/storage_attestation","attest_author":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD/action/author_attestation","sign_citation":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD/action/citation_signature","submit_replication":"https://pith.science/pith/U47DZTEFN423QUJ5ZMPC5LT3LD/action/replication_record"}},"created_at":"2026-07-05T11:57:00.888197+00:00","updated_at":"2026-07-05T11:57:00.888197+00:00"}