{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:DKDEQWLU3XVDM4PNDXWOM2QFI5","short_pith_number":"pith:DKDEQWLU","schema_version":"1.0","canonical_sha256":"1a86485974ddea3671ed1dece66a05477824e5a355d5486a3e3f058400b9c972","source":{"kind":"arxiv","id":"2506.04225","version":1},"attestation_state":"computed","paper":{"title":"Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chunchao Guo, Hui Li, Jie Jiang, Junta Wu, Rynson W.H. Lau, Tengfei Wang, Tianyu Huang, Wangguandong Zheng, Wangmeng Zuo, Yuhao Liu, Zhenwei Wang","submitted_at":"2025-06-04T17:59:04Z","abstract_excerpt":"Real-world applications like video gaming and virtual reality often demand the ability to model 3D scenes that users can explore along custom camera trajectories. While significant progress has been made in generating 3D objects from text or images, creating long-range, 3D-consistent, explorable 3D scenes remains a complex and challenging problem. In this work, we present Voyager, a novel video diffusion framework that generates world-consistent 3D point-cloud sequences from a single image with user-defined camera path. Unlike existing approaches, Voyager achieves end-to-end scene generation a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.04225","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-06-04T17:59:04Z","cross_cats_sorted":[],"title_canon_sha256":"bcdc48bec8438cf9d2324f3a8e579303522e5e1a60791fbf5157216ac5c92074","abstract_canon_sha256":"55865f63792f4894288274f9de955df57e33d5d583fc4af74eac82864354caee"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:15:59.244201Z","signature_b64":"/robOStw09msKRjTi8ffH0W44Yuix0SMCHEZE02s/U59ix5EEU7DSHiSSY3ef1ulvh3VDPDckxMDPf3B8nffAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1a86485974ddea3671ed1dece66a05477824e5a355d5486a3e3f058400b9c972","last_reissued_at":"2026-07-05T11:15:59.243700Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:15:59.243700Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chunchao Guo, Hui Li, Jie Jiang, Junta Wu, Rynson W.H. Lau, Tengfei Wang, Tianyu Huang, Wangguandong Zheng, Wangmeng Zuo, Yuhao Liu, Zhenwei Wang","submitted_at":"2025-06-04T17:59:04Z","abstract_excerpt":"Real-world applications like video gaming and virtual reality often demand the ability to model 3D scenes that users can explore along custom camera trajectories. While significant progress has been made in generating 3D objects from text or images, creating long-range, 3D-consistent, explorable 3D scenes remains a complex and challenging problem. In this work, we present Voyager, a novel video diffusion framework that generates world-consistent 3D point-cloud sequences from a single image with user-defined camera path. Unlike existing approaches, Voyager achieves end-to-end scene generation a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.04225","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.04225/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.04225","created_at":"2026-07-05T11:15:59.243763+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.04225v1","created_at":"2026-07-05T11:15:59.243763+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.04225","created_at":"2026-07-05T11:15:59.243763+00:00"},{"alias_kind":"pith_short_12","alias_value":"DKDEQWLU3XVD","created_at":"2026-07-05T11:15:59.243763+00:00"},{"alias_kind":"pith_short_16","alias_value":"DKDEQWLU3XVDM4PN","created_at":"2026-07-05T11:15:59.243763+00:00"},{"alias_kind":"pith_short_8","alias_value":"DKDEQWLU","created_at":"2026-07-05T11:15:59.243763+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09828","citing_title":"Latent Spatial Memory for Video World Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09187","citing_title":"CP4D: Compositional Physics-aware 4D Scene Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00321","citing_title":"CORGI: Consistency-Aware 3D Dog Reconstruction from a Single Image in the Wild","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02000","citing_title":"Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24764","citing_title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2601.18993","citing_title":"FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2602.04876","citing_title":"PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24764","citing_title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24764","citing_title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07990","citing_title":"SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16552","citing_title":"Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5","json":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5.json","graph_json":"https://pith.science/api/pith-number/DKDEQWLU3XVDM4PNDXWOM2QFI5/graph.json","events_json":"https://pith.science/api/pith-number/DKDEQWLU3XVDM4PNDXWOM2QFI5/events.json","paper":"https://pith.science/paper/DKDEQWLU"},"agent_actions":{"view_html":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5","download_json":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5.json","view_paper":"https://pith.science/paper/DKDEQWLU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.04225&json=true","fetch_graph":"https://pith.science/api/pith-number/DKDEQWLU3XVDM4PNDXWOM2QFI5/graph.json","fetch_events":"https://pith.science/api/pith-number/DKDEQWLU3XVDM4PNDXWOM2QFI5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5/action/storage_attestation","attest_author":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5/action/author_attestation","sign_citation":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5/action/citation_signature","submit_replication":"https://pith.science/pith/DKDEQWLU3XVDM4PNDXWOM2QFI5/action/replication_record"}},"created_at":"2026-07-05T11:15:59.243763+00:00","updated_at":"2026-07-05T11:15:59.243763+00:00"}