{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:47MTXEIJCDPHVE3YJYRIMHTAT7","short_pith_number":"pith:47MTXEIJ","schema_version":"1.0","canonical_sha256":"e7d93b910910de7a93784e22861e609ff78a1354296fe2d1b9b6fc549c6bbbf8","source":{"kind":"arxiv","id":"2507.07781","version":1},"attestation_state":"computed","paper":{"title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.CV","authors_text":"Hanlve Zhang, Jiaxin Huang, Mingming Gong, Runnan Chen, Tongliang Liu, Wenping Wang, Xiao He, Yandong Guo, Ziwen Li","submitted_at":"2025-07-10T14:01:24Z","abstract_excerpt":"The integration of language and 3D perception is critical for embodied AI and robotic systems to perceive, understand, and interact with the physical world. Spatial reasoning, a key capability for understanding spatial relationships between objects, remains underexplored in current 3D vision-language research. Existing datasets often mix semantic cues (e.g., object name) with spatial context, leading models to rely on superficial shortcuts rather than genuinely interpreting spatial relationships. To address this gap, we introduce S\\textsc{urprise}3D, a novel dataset designed to evaluate langua"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.07781","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-07-10T14:01:24Z","cross_cats_sorted":["cs.RO"],"title_canon_sha256":"87dcbedb075b0194ff310d9a8122f0a78822397cebe5fe8f4e1df8885942a507","abstract_canon_sha256":"6456280d2795f55a7c01561436281908b900f1875ac822ae217c3bd2ad836ced"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:35:04.944465Z","signature_b64":"Q4X433eAKWOdBvRSUeIak/Ek0U0bmfM6U2Y4LgglZMPrbhBsQAliV/DUDDfUPu2d5UppF8wRxplEpNhoO+nnCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e7d93b910910de7a93784e22861e609ff78a1354296fe2d1b9b6fc549c6bbbf8","last_reissued_at":"2026-07-05T11:35:04.944010Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:35:04.944010Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.CV","authors_text":"Hanlve Zhang, Jiaxin Huang, Mingming Gong, Runnan Chen, Tongliang Liu, Wenping Wang, Xiao He, Yandong Guo, Ziwen Li","submitted_at":"2025-07-10T14:01:24Z","abstract_excerpt":"The integration of language and 3D perception is critical for embodied AI and robotic systems to perceive, understand, and interact with the physical world. Spatial reasoning, a key capability for understanding spatial relationships between objects, remains underexplored in current 3D vision-language research. Existing datasets often mix semantic cues (e.g., object name) with spatial context, leading models to rely on superficial shortcuts rather than genuinely interpreting spatial relationships. To address this gap, we introduce S\\textsc{urprise}3D, a novel dataset designed to evaluate langua"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.07781","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.07781/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.07781","created_at":"2026-07-05T11:35:04.944071+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.07781v1","created_at":"2026-07-05T11:35:04.944071+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.07781","created_at":"2026-07-05T11:35:04.944071+00:00"},{"alias_kind":"pith_short_12","alias_value":"47MTXEIJCDPH","created_at":"2026-07-05T11:35:04.944071+00:00"},{"alias_kind":"pith_short_16","alias_value":"47MTXEIJCDPHVE3Y","created_at":"2026-07-05T11:35:04.944071+00:00"},{"alias_kind":"pith_short_8","alias_value":"47MTXEIJ","created_at":"2026-07-05T11:35:04.944071+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.08952","citing_title":"AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2512.06774","citing_title":"RDSplat: Robust Watermarking for 3D Gaussian Splatting Against 2D and 3D Diffusion Editing","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7","json":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7.json","graph_json":"https://pith.science/api/pith-number/47MTXEIJCDPHVE3YJYRIMHTAT7/graph.json","events_json":"https://pith.science/api/pith-number/47MTXEIJCDPHVE3YJYRIMHTAT7/events.json","paper":"https://pith.science/paper/47MTXEIJ"},"agent_actions":{"view_html":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7","download_json":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7.json","view_paper":"https://pith.science/paper/47MTXEIJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.07781&json=true","fetch_graph":"https://pith.science/api/pith-number/47MTXEIJCDPHVE3YJYRIMHTAT7/graph.json","fetch_events":"https://pith.science/api/pith-number/47MTXEIJCDPHVE3YJYRIMHTAT7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7/action/storage_attestation","attest_author":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7/action/author_attestation","sign_citation":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7/action/citation_signature","submit_replication":"https://pith.science/pith/47MTXEIJCDPHVE3YJYRIMHTAT7/action/replication_record"}},"created_at":"2026-07-05T11:35:04.944071+00:00","updated_at":"2026-07-05T11:35:04.944071+00:00"}