{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:I3Z6LLYSURDAW47SPVFFLHLTPU","short_pith_number":"pith:I3Z6LLYS","schema_version":"1.0","canonical_sha256":"46f3e5af12a4460b73f27d4a559d737d0e5fdfc718d36400e8340e993201713a","source":{"kind":"arxiv","id":"2506.01103","version":1},"attestation_state":"computed","paper":{"title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Haoyi Zhu, Jiangmiao Pang, Jianjun Zhou, Junyi Chen, Tong He, Wenzheng Chang, Xianglong He, Yang Zhou, Yifan Wang, Zhoujie Fu, Zizun Li","submitted_at":"2025-06-01T17:58:36Z","abstract_excerpt":"World models serve as essential building blocks toward Artificial General Intelligence (AGI), enabling intelligent agents to predict future states and plan actions by simulating complex physical interactions. However, existing interactive models primarily predict visual observations, thereby neglecting crucial hidden states like geometric structures and spatial coherence. This leads to rapid error accumulation and temporal inconsistency. To address these limitations, we introduce DeepVerse, a novel 4D interactive world model explicitly incorporating geometric predictions from previous timestep"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.01103","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-06-01T17:58:36Z","cross_cats_sorted":[],"title_canon_sha256":"8770dfe0973586b5a3542a2fffc3fa0cdcca9044e0d33a4437516fec18a9c67c","abstract_canon_sha256":"1aeaa694fbc451352491fc0a5817c07b5286653b14799f20f86f87528386614c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:13:46.457067Z","signature_b64":"9TB9VpPv1a8At6ctef/7kjzESL92GcttgkOty/1kpe3/wzil17hOOf+IvgRmZZFoRoU2ToyP181K/dsaIwvuCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"46f3e5af12a4460b73f27d4a559d737d0e5fdfc718d36400e8340e993201713a","last_reissued_at":"2026-07-05T11:13:46.456680Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:13:46.456680Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Haoyi Zhu, Jiangmiao Pang, Jianjun Zhou, Junyi Chen, Tong He, Wenzheng Chang, Xianglong He, Yang Zhou, Yifan Wang, Zhoujie Fu, Zizun Li","submitted_at":"2025-06-01T17:58:36Z","abstract_excerpt":"World models serve as essential building blocks toward Artificial General Intelligence (AGI), enabling intelligent agents to predict future states and plan actions by simulating complex physical interactions. However, existing interactive models primarily predict visual observations, thereby neglecting crucial hidden states like geometric structures and spatial coherence. This leads to rapid error accumulation and temporal inconsistency. To address these limitations, we introduce DeepVerse, a novel 4D interactive world model explicitly incorporating geometric predictions from previous timestep"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.01103","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.01103/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.01103","created_at":"2026-07-05T11:13:46.456738+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.01103v1","created_at":"2026-07-05T11:13:46.456738+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.01103","created_at":"2026-07-05T11:13:46.456738+00:00"},{"alias_kind":"pith_short_12","alias_value":"I3Z6LLYSURDA","created_at":"2026-07-05T11:13:46.456738+00:00"},{"alias_kind":"pith_short_16","alias_value":"I3Z6LLYSURDAW47S","created_at":"2026-07-05T11:13:46.456738+00:00"},{"alias_kind":"pith_short_8","alias_value":"I3Z6LLYS","created_at":"2026-07-05T11:13:46.456738+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09187","citing_title":"CP4D: Compositional Physics-aware 4D Scene Generation","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01896","citing_title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07967","citing_title":"DisCo: World Models with Discrete Camera Motion Control","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01315","citing_title":"DeblurNVS: Geometric Latent Diffusion for Novel View Synthesis from Sparse Motion-Blurred Images","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01164","citing_title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20961","citing_title":"Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware Conditioning","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2508.13009","citing_title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15178","citing_title":"SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01896","citing_title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08995","citing_title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU","json":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU.json","graph_json":"https://pith.science/api/pith-number/I3Z6LLYSURDAW47SPVFFLHLTPU/graph.json","events_json":"https://pith.science/api/pith-number/I3Z6LLYSURDAW47SPVFFLHLTPU/events.json","paper":"https://pith.science/paper/I3Z6LLYS"},"agent_actions":{"view_html":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU","download_json":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU.json","view_paper":"https://pith.science/paper/I3Z6LLYS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.01103&json=true","fetch_graph":"https://pith.science/api/pith-number/I3Z6LLYSURDAW47SPVFFLHLTPU/graph.json","fetch_events":"https://pith.science/api/pith-number/I3Z6LLYSURDAW47SPVFFLHLTPU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU/action/storage_attestation","attest_author":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU/action/author_attestation","sign_citation":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU/action/citation_signature","submit_replication":"https://pith.science/pith/I3Z6LLYSURDAW47SPVFFLHLTPU/action/replication_record"}},"created_at":"2026-07-05T11:13:46.456738+00:00","updated_at":"2026-07-05T11:13:46.456738+00:00"}