{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:RXWRTLYPD6GRD6QWK3UKXUOVSF","short_pith_number":"pith:RXWRTLYP","schema_version":"1.0","canonical_sha256":"8ded19af0f1f8d11fa1656e8abd1d5917743d932cdafde58ae317c493c14010a","source":{"kind":"arxiv","id":"2407.17470","version":2},"attestation_state":"computed","paper":{"title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chun-Han Yao, Huaizu Jiang, Varun Jampani, Vikram Voleti, Yiming Xie","submitted_at":"2024-07-24T17:59:43Z","abstract_excerpt":"We present Stable Video 4D (SV4D), a latent video diffusion model for multi-frame and multi-view consistent dynamic 3D content generation. Unlike previous methods that rely on separately trained generative models for video generation and novel view synthesis, we design a unified diffusion model to generate novel view videos of dynamic 3D objects. Specifically, given a monocular reference video, SV4D generates novel views for each video frame that are temporally consistent. We then use the generated novel view videos to optimize an implicit 4D representation (dynamic NeRF) efficiently, without "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.17470","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-07-24T17:59:43Z","cross_cats_sorted":[],"title_canon_sha256":"e4728c9826555ecbd4397a93c960d7f868d87af133ff13f192e4ad4b9c22a4e0","abstract_canon_sha256":"d43cdc38c1b193cbc33c7525bf21517fdeae0e2f430ae12f77f8d5976e7e1af6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:21:21.904450Z","signature_b64":"MJj4Z2i7xaU05wyNG+jIwt6PdpTTSS6lXFO5gz6u9kknOLOQ9jRofZ4WjYfaJR6MuSZdN1BrmGcZHKjdVDB3AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8ded19af0f1f8d11fa1656e8abd1d5917743d932cdafde58ae317c493c14010a","last_reissued_at":"2026-07-05T10:21:21.903937Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:21:21.903937Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chun-Han Yao, Huaizu Jiang, Varun Jampani, Vikram Voleti, Yiming Xie","submitted_at":"2024-07-24T17:59:43Z","abstract_excerpt":"We present Stable Video 4D (SV4D), a latent video diffusion model for multi-frame and multi-view consistent dynamic 3D content generation. Unlike previous methods that rely on separately trained generative models for video generation and novel view synthesis, we design a unified diffusion model to generate novel view videos of dynamic 3D objects. Specifically, given a monocular reference video, SV4D generates novel views for each video frame that are temporally consistent. We then use the generated novel view videos to optimize an implicit 4D representation (dynamic NeRF) efficiently, without "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.17470","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.17470/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.17470","created_at":"2026-07-05T10:21:21.903997+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.17470v2","created_at":"2026-07-05T10:21:21.903997+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.17470","created_at":"2026-07-05T10:21:21.903997+00:00"},{"alias_kind":"pith_short_12","alias_value":"RXWRTLYPD6GR","created_at":"2026-07-05T10:21:21.903997+00:00"},{"alias_kind":"pith_short_16","alias_value":"RXWRTLYPD6GRD6QW","created_at":"2026-07-05T10:21:21.903997+00:00"},{"alias_kind":"pith_short_8","alias_value":"RXWRTLYP","created_at":"2026-07-05T10:21:21.903997+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":26,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05376","citing_title":"MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing","ref_index":38,"is_internal_anchor":true},{"citing_arxiv_id":"2606.20774","citing_title":"TriMotion: Modality-Agnostic Camera Control for Video Generation","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18375","citing_title":"PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13655","citing_title":"Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01766","citing_title":"SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09187","citing_title":"CP4D: Compositional Physics-aware 4D Scene Generation","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07508","citing_title":"Streaming Video Generation with Streaming Force Control","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01518","citing_title":"SkelMo: Universal Skeletal Motion Generation for 3D Rigged Shapes","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28215","citing_title":"HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01799","citing_title":"Embody4D: A Generalist Data Engine for Embodied 4D World Modeling","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14815","citing_title":"Probing into Camera Control of Video Models","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01518","citing_title":"SkelMo: Universal Skeletal Motion Generation for 3D Rigged Shapes","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26316","citing_title":"E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2412.13111","citing_title":"Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations","ref_index":81,"is_internal_anchor":false},{"citing_arxiv_id":"2507.01099","citing_title":"Geometry-aware 4D Video Generation for Robot Manipulation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18052","citing_title":"Efficient 3D Content Reconstruction and Generation","ref_index":286,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19786","citing_title":"Fast 4D Mesh Generation by Spatio-Temporal Attention Chains","ref_index":85,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16937","citing_title":"DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16813","citing_title":"QuadLink: Autoregressive Quad-Dominant Mesh Generation via Point-Relation Learning","ref_index":111,"is_internal_anchor":false},{"citing_arxiv_id":"2511.00503","citing_title":"Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models","ref_index":89,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04527","citing_title":"Velox: Learning Representations of 4D Geometry and Appearance","ref_index":105,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21915","citing_title":"Vista4D: Video Reshooting with 4D Point Clouds","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12270","citing_title":"DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06168","citing_title":"Action Images: End-to-End Policy Learning via Multiview Video Generation","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06010","citing_title":"OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control","ref_index":35,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF","json":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF.json","graph_json":"https://pith.science/api/pith-number/RXWRTLYPD6GRD6QWK3UKXUOVSF/graph.json","events_json":"https://pith.science/api/pith-number/RXWRTLYPD6GRD6QWK3UKXUOVSF/events.json","paper":"https://pith.science/paper/RXWRTLYP"},"agent_actions":{"view_html":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF","download_json":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF.json","view_paper":"https://pith.science/paper/RXWRTLYP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.17470&json=true","fetch_graph":"https://pith.science/api/pith-number/RXWRTLYPD6GRD6QWK3UKXUOVSF/graph.json","fetch_events":"https://pith.science/api/pith-number/RXWRTLYPD6GRD6QWK3UKXUOVSF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF/action/storage_attestation","attest_author":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF/action/author_attestation","sign_citation":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF/action/citation_signature","submit_replication":"https://pith.science/pith/RXWRTLYPD6GRD6QWK3UKXUOVSF/action/replication_record"}},"created_at":"2026-07-05T10:21:21.903997+00:00","updated_at":"2026-07-05T10:21:21.903997+00:00"}