{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ZO25EQSUFAQBGZ3FFEGDAYK3GP","short_pith_number":"pith:ZO25EQSU","schema_version":"1.0","canonical_sha256":"cbb5d242542820136765290c30615b33c50daac5f712f19d0cd8b3204fceafb6","source":{"kind":"arxiv","id":"2509.07996","version":4},"attestation_state":"computed","paper":{"title":"3D and 4D World Modeling: A Survey","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.CV","authors_text":"Ao Liang, Dekai Zhu, Dongyue Lu, Jianbiao Mei, Jianke Zhu, Junyuan Deng, Kaiwen Zhang, Liang Pan, Linfeng Li, Lingdong Kong, Mingkai Jia, Shenyuan Gao, Song Wang, Steven C. H. Hoi, Tianyi Yan, Wei Tsang Ooi, Wei Yin, Xiaotao Hu, Yang Wu, Yong Liu, Youquan Liu, Yu Yang, Ziwei Liu","submitted_at":"2025-09-04T17:59:58Z","abstract_excerpt":"World modeling has become a cornerstone in AI research, enabling agents to understand, represent, and predict the dynamic environments they inhabit. While prior work largely emphasizes generative methods for 2D image and video data, they overlook the rapidly growing body of work that leverages native 3D and 4D representations such as RGB-D imagery, occupancy grids, and LiDAR point clouds for large-scale scene modeling. At the same time, the absence of a standardized definition and taxonomy for \"world models\" has led to fragmented and sometimes inconsistent claims in the literature. This survey"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.07996","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-09-04T17:59:58Z","cross_cats_sorted":["cs.RO"],"title_canon_sha256":"f96e578e42d8307ed80e8058360f8fff485eb5376a54c8796121b680963b3d2f","abstract_canon_sha256":"85a39a76a166765e675c0907f0f4694ecad75414f76c9cdd18fa513d4eb7d390"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-21T02:22:24.165705Z","signature_b64":"XdHfPL2mOd1vLFc0h4Wwv5TbEUpoZjQB8eLcX0dMx9a5Eh8QsMBVa7RQLZkcsPPx4HJue55YBky1as3nMSzPCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"cbb5d242542820136765290c30615b33c50daac5f712f19d0cd8b3204fceafb6","last_reissued_at":"2026-07-21T02:22:24.164873Z","signature_status":"signed_v1","first_computed_at":"2026-07-21T02:22:24.164873Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"3D and 4D World Modeling: A Survey","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.CV","authors_text":"Ao Liang, Dekai Zhu, Dongyue Lu, Jianbiao Mei, Jianke Zhu, Junyuan Deng, Kaiwen Zhang, Liang Pan, Linfeng Li, Lingdong Kong, Mingkai Jia, Shenyuan Gao, Song Wang, Steven C. H. Hoi, Tianyi Yan, Wei Tsang Ooi, Wei Yin, Xiaotao Hu, Yang Wu, Yong Liu, Youquan Liu, Yu Yang, Ziwei Liu","submitted_at":"2025-09-04T17:59:58Z","abstract_excerpt":"World modeling has become a cornerstone in AI research, enabling agents to understand, represent, and predict the dynamic environments they inhabit. While prior work largely emphasizes generative methods for 2D image and video data, they overlook the rapidly growing body of work that leverages native 3D and 4D representations such as RGB-D imagery, occupancy grids, and LiDAR point clouds for large-scale scene modeling. At the same time, the absence of a standardized definition and taxonomy for \"world models\" has led to fragmented and sometimes inconsistent claims in the literature. This survey"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.07996","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.07996/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.07996","created_at":"2026-07-21T02:22:24.165294+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.07996v4","created_at":"2026-07-21T02:22:24.165294+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.07996","created_at":"2026-07-21T02:22:24.165294+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZO25EQSUFAQB","created_at":"2026-07-21T02:22:24.165294+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZO25EQSUFAQBGZ3F","created_at":"2026-07-21T02:22:24.165294+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZO25EQSU","created_at":"2026-07-21T02:22:24.165294+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":30,"internal_anchor_count":30,"sample":[{"citing_arxiv_id":"2607.05373","citing_title":"PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"2604.22748","citing_title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","ref_index":189,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21172","citing_title":"BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving","ref_index":37,"is_internal_anchor":true},{"citing_arxiv_id":"2606.19383","citing_title":"3D Scene Graphs: Open Challenges and Future Directions","ref_index":80,"is_internal_anchor":true},{"citing_arxiv_id":"2606.12783","citing_title":"A Tutorial on World Models and Physical AI","ref_index":28,"is_internal_anchor":true},{"citing_arxiv_id":"2606.05645","citing_title":"Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning","ref_index":37,"is_internal_anchor":true},{"citing_arxiv_id":"2606.03920","citing_title":"Benchmarking Visual State Tracking in Multimodal Video Understanding","ref_index":31,"is_internal_anchor":true},{"citing_arxiv_id":"2606.02510","citing_title":"Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2606.31388","citing_title":"One Video, One World: Turning Monocular Video into Physical 4D Scenes","ref_index":39,"is_internal_anchor":true},{"citing_arxiv_id":"2605.01799","citing_title":"Embody4D: A Generalist Data Engine for Embodied 4D World Modeling","ref_index":28,"is_internal_anchor":true},{"citing_arxiv_id":"2605.05092","citing_title":"Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2606.29020","citing_title":"Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis","ref_index":34,"is_internal_anchor":true},{"citing_arxiv_id":"2606.00133","citing_title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","ref_index":68,"is_internal_anchor":true},{"citing_arxiv_id":"2512.23180","citing_title":"GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation","ref_index":27,"is_internal_anchor":true},{"citing_arxiv_id":"2510.04978","citing_title":"Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI","ref_index":55,"is_internal_anchor":true},{"citing_arxiv_id":"2511.22039","citing_title":"SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model","ref_index":16,"is_internal_anchor":true},{"citing_arxiv_id":"2602.06949","citing_title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","ref_index":53,"is_internal_anchor":true},{"citing_arxiv_id":"2603.19675","citing_title":"DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving","ref_index":22,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12957","citing_title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","ref_index":13,"is_internal_anchor":true},{"citing_arxiv_id":"2605.13815","citing_title":"OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2604.18486","citing_title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","ref_index":56,"is_internal_anchor":true},{"citing_arxiv_id":"2605.10858","citing_title":"Is Your Driving World Model an All-Around Player?","ref_index":17,"is_internal_anchor":true},{"citing_arxiv_id":"2605.08712","citing_title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","ref_index":35,"is_internal_anchor":true},{"citing_arxiv_id":"2604.22748","citing_title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","ref_index":189,"is_internal_anchor":true},{"citing_arxiv_id":"2605.05092","citing_title":"Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout","ref_index":14,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP","json":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP.json","graph_json":"https://pith.science/api/pith-number/ZO25EQSUFAQBGZ3FFEGDAYK3GP/graph.json","events_json":"https://pith.science/api/pith-number/ZO25EQSUFAQBGZ3FFEGDAYK3GP/events.json","paper":"https://pith.science/paper/ZO25EQSU"},"agent_actions":{"view_html":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP","download_json":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP.json","view_paper":"https://pith.science/paper/ZO25EQSU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.07996&json=true","fetch_graph":"https://pith.science/api/pith-number/ZO25EQSUFAQBGZ3FFEGDAYK3GP/graph.json","fetch_events":"https://pith.science/api/pith-number/ZO25EQSUFAQBGZ3FFEGDAYK3GP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP/action/storage_attestation","attest_author":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP/action/author_attestation","sign_citation":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP/action/citation_signature","submit_replication":"https://pith.science/pith/ZO25EQSUFAQBGZ3FFEGDAYK3GP/action/replication_record"}},"created_at":"2026-07-21T02:22:24.165294+00:00","updated_at":"2026-07-21T02:22:24.165294+00:00"}