{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:XQQAGQOERYBLD6JHVXRBM2NC2L","short_pith_number":"pith:XQQAGQOE","schema_version":"1.0","canonical_sha256":"bc200341c48e02b1f927ade21669a2d2c48908438f29af271f91c239c438fd33","source":{"kind":"arxiv","id":"2503.19707","version":1},"attestation_state":"computed","paper":{"title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Ilias Stogiannidis, Sotirios A. Tsaftaris, Steven McDonagh","submitted_at":"2025-03-25T14:34:06Z","abstract_excerpt":"Vision-Language Models (VLMs) have recently emerged as powerful tools, excelling in tasks that integrate visual and textual comprehension, such as image captioning, visual question answering, and image-text retrieval. However, existing benchmarks for VLMs include spatial components, which often fail to isolate spatial reasoning from related tasks such as object detection or semantic comprehension. In this paper, we address these deficiencies with a multi-faceted approach towards understanding spatial reasoning. Informed by the diverse and multi-dimensional nature of human spatial reasoning abi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.19707","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-03-25T14:34:06Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"7527ad2302863734d44440fbc596b6474def68e870cd0e887ee62bc70903995f","abstract_canon_sha256":"d0fd3437689c0deb822cf7e32519857ec77d100d8e1a75f154952b933c1067f4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:39:00.119483Z","signature_b64":"HXSmb+IBBB887HAFAaliiy7VpkoDuL6OdKhrXb7570xiavHP263+OmziQTh78e7e2FubHbsOw7ZasMxZ4a74Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bc200341c48e02b1f927ade21669a2d2c48908438f29af271f91c239c438fd33","last_reissued_at":"2026-07-05T10:39:00.118977Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:39:00.118977Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Ilias Stogiannidis, Sotirios A. Tsaftaris, Steven McDonagh","submitted_at":"2025-03-25T14:34:06Z","abstract_excerpt":"Vision-Language Models (VLMs) have recently emerged as powerful tools, excelling in tasks that integrate visual and textual comprehension, such as image captioning, visual question answering, and image-text retrieval. However, existing benchmarks for VLMs include spatial components, which often fail to isolate spatial reasoning from related tasks such as object detection or semantic comprehension. In this paper, we address these deficiencies with a multi-faceted approach towards understanding spatial reasoning. Informed by the diverse and multi-dimensional nature of human spatial reasoning abi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.19707","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.19707/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.19707","created_at":"2026-07-05T10:39:00.119049+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.19707v1","created_at":"2026-07-05T10:39:00.119049+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.19707","created_at":"2026-07-05T10:39:00.119049+00:00"},{"alias_kind":"pith_short_12","alias_value":"XQQAGQOERYBL","created_at":"2026-07-05T10:39:00.119049+00:00"},{"alias_kind":"pith_short_16","alias_value":"XQQAGQOERYBLD6JH","created_at":"2026-07-05T10:39:00.119049+00:00"},{"alias_kind":"pith_short_8","alias_value":"XQQAGQOE","created_at":"2026-07-05T10:39:00.119049+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08317","citing_title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"2606.11918","citing_title":"The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07641","citing_title":"Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31467","citing_title":"AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20448","citing_title":"Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23176","citing_title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30378","citing_title":"OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30557","citing_title":"Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23141","citing_title":"VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23176","citing_title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23771","citing_title":"PhotoFlow: Agentic 3D Virtual Photography Missions","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2505.17012","citing_title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20448","citing_title":"Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13169","citing_title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2602.11635","citing_title":"Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13169","citing_title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26614","citing_title":"State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09449","citing_title":"SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09693","citing_title":"Do multimodal models imagine electric sheep?","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15184","citing_title":"Agent-Aided Design for Dynamic CAD Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16022","citing_title":"SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems","ref_index":32,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L","json":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L.json","graph_json":"https://pith.science/api/pith-number/XQQAGQOERYBLD6JHVXRBM2NC2L/graph.json","events_json":"https://pith.science/api/pith-number/XQQAGQOERYBLD6JHVXRBM2NC2L/events.json","paper":"https://pith.science/paper/XQQAGQOE"},"agent_actions":{"view_html":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L","download_json":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L.json","view_paper":"https://pith.science/paper/XQQAGQOE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.19707&json=true","fetch_graph":"https://pith.science/api/pith-number/XQQAGQOERYBLD6JHVXRBM2NC2L/graph.json","fetch_events":"https://pith.science/api/pith-number/XQQAGQOERYBLD6JHVXRBM2NC2L/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L/action/storage_attestation","attest_author":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L/action/author_attestation","sign_citation":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L/action/citation_signature","submit_replication":"https://pith.science/pith/XQQAGQOERYBLD6JHVXRBM2NC2L/action/replication_record"}},"created_at":"2026-07-05T10:39:00.119049+00:00","updated_at":"2026-07-05T10:39:00.119049+00:00"}