{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ERF45AGUJUQMTWMCN7B5UJBAZM","short_pith_number":"pith:ERF45AGU","schema_version":"1.0","canonical_sha256":"244bce80d44d20c9d9826fc3da2420cb37bdf5797d0990708abd022c04b80b24","source":{"kind":"arxiv","id":"2507.23478","version":1},"attestation_state":"computed","paper":{"title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hao Tang, Ting Huang, Zeyu Zhang","submitted_at":"2025-07-31T11:59:06Z","abstract_excerpt":"Large vision-language models (VLMs) have made significant strides in 2D visual understanding tasks, sparking interest in extending these capabilities to 3D scene understanding. However, current 3D VLMs often struggle with robust reasoning and generalization due to limitations in high-quality spatial data and the static nature of viewpoint assumptions. To address these challenges, we propose 3D-R1, a foundation model that enhances the reasoning capabilities of 3D VLMs. Specifically, we first construct a high-quality synthetic dataset with CoT, named Scene-30K, leveraging existing 3D-VL datasets"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.23478","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-07-31T11:59:06Z","cross_cats_sorted":[],"title_canon_sha256":"bda120ea56ab32687c9b527647320b2248f3a91e165a04e06281a764ec7f844d","abstract_canon_sha256":"edab6cb967eeb878f8d22eb21bdc2a33c8dbc23a6a20f343275d909d390abfca"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:46:24.993891Z","signature_b64":"jwfkueFkKjv25deaNKUUXeHQcdwUBcwSMqtBLVUYed4oCxv+BFqQTAlKlOcpSBeWV0sisslY4XE06VF7X9/fCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"244bce80d44d20c9d9826fc3da2420cb37bdf5797d0990708abd022c04b80b24","last_reissued_at":"2026-07-05T11:46:24.993253Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:46:24.993253Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hao Tang, Ting Huang, Zeyu Zhang","submitted_at":"2025-07-31T11:59:06Z","abstract_excerpt":"Large vision-language models (VLMs) have made significant strides in 2D visual understanding tasks, sparking interest in extending these capabilities to 3D scene understanding. However, current 3D VLMs often struggle with robust reasoning and generalization due to limitations in high-quality spatial data and the static nature of viewpoint assumptions. To address these challenges, we propose 3D-R1, a foundation model that enhances the reasoning capabilities of 3D VLMs. Specifically, we first construct a high-quality synthetic dataset with CoT, named Scene-30K, leveraging existing 3D-VL datasets"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.23478","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.23478/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.23478","created_at":"2026-07-05T11:46:24.993327+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.23478v1","created_at":"2026-07-05T11:46:24.993327+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.23478","created_at":"2026-07-05T11:46:24.993327+00:00"},{"alias_kind":"pith_short_12","alias_value":"ERF45AGUJUQM","created_at":"2026-07-05T11:46:24.993327+00:00"},{"alias_kind":"pith_short_16","alias_value":"ERF45AGUJUQMTWMC","created_at":"2026-07-05T11:46:24.993327+00:00"},{"alias_kind":"pith_short_8","alias_value":"ERF45AGU","created_at":"2026-07-05T11:46:24.993327+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.06374","citing_title":"VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery","ref_index":10,"is_internal_anchor":true},{"citing_arxiv_id":"2604.18483","citing_title":"Steadily moving semi-infinite fracture in plane poroelasticity","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23557","citing_title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17362","citing_title":"DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01215","citing_title":"Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01215","citing_title":"Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30307","citing_title":"Grounded 3D-Aware Spatial Vision-Language Modeling","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2602.23058","citing_title":"GeoWorld: Geometric World Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19390","citing_title":"LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20165","citing_title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2509.08827","citing_title":"A Survey of Reinforcement Learning for Large Reasoning Models","ref_index":211,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02870","citing_title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26454","citing_title":"Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17472","citing_title":"UniMesh: Unifying 3D Mesh Understanding and Generation","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18484","citing_title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","ref_index":36,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM","json":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM.json","graph_json":"https://pith.science/api/pith-number/ERF45AGUJUQMTWMCN7B5UJBAZM/graph.json","events_json":"https://pith.science/api/pith-number/ERF45AGUJUQMTWMCN7B5UJBAZM/events.json","paper":"https://pith.science/paper/ERF45AGU"},"agent_actions":{"view_html":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM","download_json":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM.json","view_paper":"https://pith.science/paper/ERF45AGU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.23478&json=true","fetch_graph":"https://pith.science/api/pith-number/ERF45AGUJUQMTWMCN7B5UJBAZM/graph.json","fetch_events":"https://pith.science/api/pith-number/ERF45AGUJUQMTWMCN7B5UJBAZM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM/action/storage_attestation","attest_author":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM/action/author_attestation","sign_citation":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM/action/citation_signature","submit_replication":"https://pith.science/pith/ERF45AGUJUQMTWMCN7B5UJBAZM/action/replication_record"}},"created_at":"2026-07-05T11:46:24.993327+00:00","updated_at":"2026-07-05T11:46:24.993327+00:00"}