{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NWHPQEQQADX362QNENQHIHMSFJ","short_pith_number":"pith:NWHPQEQQ","schema_version":"1.0","canonical_sha256":"6d8ef8121000efbf6a0d2360741d922a5cbd029a8da2136a1a6e4f2ec0835c1f","source":{"kind":"arxiv","id":"2508.11058","version":1},"attestation_state":"computed","paper":{"title":"Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.MM"],"primary_cat":"cs.CV","authors_text":"Qingchao Chen, Siyuan Huang, Wentao Mo, Yang Liu, Yuxin Peng","submitted_at":"2025-08-14T20:35:59Z","abstract_excerpt":"The advancement of 3D vision-language (3D VL) learning is hindered by several limitations in existing 3D VL datasets: they rarely necessitate reasoning beyond a close range of objects in single viewpoint, and annotations often link instructions to single objects, missing richer contextual alignments between multiple objects. This significantly curtails the development of models capable of deep, multi-view 3D scene understanding over distant objects. To address these challenges, we introduce MV-ScanQA, a novel 3D question answering dataset where 68% of questions explicitly require integrating i"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.11058","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-08-14T20:35:59Z","cross_cats_sorted":["cs.MM"],"title_canon_sha256":"ecf1ab3d2aaf66cf016332e2c73dd84d5d4a2c98db6b0b41ca5ec8da17e96270","abstract_canon_sha256":"8f9060d95c8217d30c993a8ce338544b4fbd03560308094ae9063f33d96b352a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:54:17.621935Z","signature_b64":"TzaOh9POYjz6oaxmsd5Z5QXooReWfQVBUaBMsF0eh+YA63dKQpT302qlh0ci4j+povQN9+QGlMYYuRxLzxdWDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6d8ef8121000efbf6a0d2360741d922a5cbd029a8da2136a1a6e4f2ec0835c1f","last_reissued_at":"2026-07-05T11:54:17.621516Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:54:17.621516Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.MM"],"primary_cat":"cs.CV","authors_text":"Qingchao Chen, Siyuan Huang, Wentao Mo, Yang Liu, Yuxin Peng","submitted_at":"2025-08-14T20:35:59Z","abstract_excerpt":"The advancement of 3D vision-language (3D VL) learning is hindered by several limitations in existing 3D VL datasets: they rarely necessitate reasoning beyond a close range of objects in single viewpoint, and annotations often link instructions to single objects, missing richer contextual alignments between multiple objects. This significantly curtails the development of models capable of deep, multi-view 3D scene understanding over distant objects. To address these challenges, we introduce MV-ScanQA, a novel 3D question answering dataset where 68% of questions explicitly require integrating i"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.11058","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.11058/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.11058","created_at":"2026-07-05T11:54:17.621573+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.11058v1","created_at":"2026-07-05T11:54:17.621573+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.11058","created_at":"2026-07-05T11:54:17.621573+00:00"},{"alias_kind":"pith_short_12","alias_value":"NWHPQEQQADX3","created_at":"2026-07-05T11:54:17.621573+00:00"},{"alias_kind":"pith_short_16","alias_value":"NWHPQEQQADX362QN","created_at":"2026-07-05T11:54:17.621573+00:00"},{"alias_kind":"pith_short_8","alias_value":"NWHPQEQQ","created_at":"2026-07-05T11:54:17.621573+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ","json":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ.json","graph_json":"https://pith.science/api/pith-number/NWHPQEQQADX362QNENQHIHMSFJ/graph.json","events_json":"https://pith.science/api/pith-number/NWHPQEQQADX362QNENQHIHMSFJ/events.json","paper":"https://pith.science/paper/NWHPQEQQ"},"agent_actions":{"view_html":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ","download_json":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ.json","view_paper":"https://pith.science/paper/NWHPQEQQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.11058&json=true","fetch_graph":"https://pith.science/api/pith-number/NWHPQEQQADX362QNENQHIHMSFJ/graph.json","fetch_events":"https://pith.science/api/pith-number/NWHPQEQQADX362QNENQHIHMSFJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ/action/storage_attestation","attest_author":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ/action/author_attestation","sign_citation":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ/action/citation_signature","submit_replication":"https://pith.science/pith/NWHPQEQQADX362QNENQHIHMSFJ/action/replication_record"}},"created_at":"2026-07-05T11:54:17.621573+00:00","updated_at":"2026-07-05T11:54:17.621573+00:00"}