{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:BFNTWVMEO42UFA4QS32FTKH4RR","short_pith_number":"pith:BFNTWVME","schema_version":"1.0","canonical_sha256":"095b3b5584773542839096f459a8fc8c45bd05e2e3596b564e6e5d9b695f686b","source":{"kind":"arxiv","id":"2310.08586","version":4},"attestation_state":"computed","paper":{"title":"PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chunhua Shen, Di Huang, Haoyi Zhu, Hengshuang Zhao, Honghui Yang, Sha Zhang, Tong He, Wanli Ouyang, Xianglong He, Xiaoyang Wu, Yu Qiao","submitted_at":"2023-10-12T17:59:57Z","abstract_excerpt":"In contrast to numerous NLP and 2D vision foundational models, learning a 3D foundational model poses considerably greater challenges. This is primarily due to the inherent data variability and diversity of downstream tasks. In this paper, we introduce a novel universal 3D pre-training framework designed to facilitate the acquisition of efficient 3D representation, thereby establishing a pathway to 3D foundational models. Considering that informative 3D features should encode rich geometry and appearance cues that can be utilized to render realistic images, we propose to learn 3D representatio"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.08586","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2023-10-12T17:59:57Z","cross_cats_sorted":[],"title_canon_sha256":"e960c00ea99f6fd3418165ec154d1679775aef9f54413b8744adb8ed8db0cc39","abstract_canon_sha256":"bf414c73e83eeb1db2b4c2f98f077caf24e64e26fa0541f3e77abe7ffccc8d46"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:49:03.748409Z","signature_b64":"JTo0A0x/a2PZGrzG3AWsQ/CazKTrVymH8yNcwzHvscmpxB8fKVeLMkZeW5ydneVeNIulwAVxTqpWmHgqrYzEAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"095b3b5584773542839096f459a8fc8c45bd05e2e3596b564e6e5d9b695f686b","last_reissued_at":"2026-07-05T10:49:03.747853Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:49:03.747853Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chunhua Shen, Di Huang, Haoyi Zhu, Hengshuang Zhao, Honghui Yang, Sha Zhang, Tong He, Wanli Ouyang, Xianglong He, Xiaoyang Wu, Yu Qiao","submitted_at":"2023-10-12T17:59:57Z","abstract_excerpt":"In contrast to numerous NLP and 2D vision foundational models, learning a 3D foundational model poses considerably greater challenges. This is primarily due to the inherent data variability and diversity of downstream tasks. In this paper, we introduce a novel universal 3D pre-training framework designed to facilitate the acquisition of efficient 3D representation, thereby establishing a pathway to 3D foundational models. Considering that informative 3D features should encode rich geometry and appearance cues that can be utilized to render realistic images, we propose to learn 3D representatio"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.08586","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.08586/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.08586","created_at":"2026-07-05T10:49:03.747921+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.08586v4","created_at":"2026-07-05T10:49:03.747921+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.08586","created_at":"2026-07-05T10:49:03.747921+00:00"},{"alias_kind":"pith_short_12","alias_value":"BFNTWVMEO42U","created_at":"2026-07-05T10:49:03.747921+00:00"},{"alias_kind":"pith_short_16","alias_value":"BFNTWVMEO42UFA4Q","created_at":"2026-07-05T10:49:03.747921+00:00"},{"alias_kind":"pith_short_8","alias_value":"BFNTWVME","created_at":"2026-07-05T10:49:03.747921+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.02098","citing_title":"From Spherical to Gaussian: A Comparative Analysis of Point Cloud Cropping Strategies in Large-Scale 3D Environments","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21258","citing_title":"Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16899","citing_title":"LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10573","citing_title":"Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images","ref_index":90,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16848","citing_title":"TowerDataset: A Heterogeneous Benchmark for Transmission Corridor Segmentation with a Global-Local Fusion Framework","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02098","citing_title":"From Spherical to Gaussian: A Comparative Analysis of Point Cloud Cropping Strategies in Large-Scale 3D Environments","ref_index":54,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR","json":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR.json","graph_json":"https://pith.science/api/pith-number/BFNTWVMEO42UFA4QS32FTKH4RR/graph.json","events_json":"https://pith.science/api/pith-number/BFNTWVMEO42UFA4QS32FTKH4RR/events.json","paper":"https://pith.science/paper/BFNTWVME"},"agent_actions":{"view_html":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR","download_json":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR.json","view_paper":"https://pith.science/paper/BFNTWVME","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.08586&json=true","fetch_graph":"https://pith.science/api/pith-number/BFNTWVMEO42UFA4QS32FTKH4RR/graph.json","fetch_events":"https://pith.science/api/pith-number/BFNTWVMEO42UFA4QS32FTKH4RR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR/action/storage_attestation","attest_author":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR/action/author_attestation","sign_citation":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR/action/citation_signature","submit_replication":"https://pith.science/pith/BFNTWVMEO42UFA4QS32FTKH4RR/action/replication_record"}},"created_at":"2026-07-05T10:49:03.747921+00:00","updated_at":"2026-07-05T10:49:03.747921+00:00"}