{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NWZYA6QESPBXESCLI6C3YPPYBG","short_pith_number":"pith:NWZYA6QE","schema_version":"1.0","canonical_sha256":"6db3807a0493c372484b4785bc3df809918c116492ca8b25d511fe077e13167e","source":{"kind":"arxiv","id":"2503.14489","version":2},"attestation_state":"computed","paper":{"title":"Stable Virtual Camera: Generative View Synthesis with Diffusion Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Aaryaman Vasishta, Christian Rupprecht, Chun-Han Yao, Hang Gao, Jensen Zhou, Mark Boss, Philip Torr, Varun Jampani, Vikram Voleti","submitted_at":"2025-03-18T17:57:22Z","abstract_excerpt":"We present Stable Virtual Camera (Seva), a generalist diffusion model that creates novel views of a scene, given any number of input views and target cameras. Existing works struggle to generate either large viewpoint changes or temporally smooth samples, while relying on specific task configurations. Our approach overcomes these limitations through simple model design, optimized training recipe, and flexible sampling strategy that generalize across view synthesis tasks at test time. As a result, our samples maintain high consistency without requiring additional 3D representation-based distill"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.14489","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-03-18T17:57:22Z","cross_cats_sorted":[],"title_canon_sha256":"1626e3c6d783affcfc23cb9bb0c4761aa64a209ab523d71e8096183d501f7604","abstract_canon_sha256":"e8372a4b51992baa21bad8c06256773f5554d18d884e870ac9cfa53be29d0972"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:43:05.926763Z","signature_b64":"ZFHBnH2SGA1mpIr9k0rF9U88aDVLQQ6ap5SOKv5/iEDfysHTHWyXDbP46CoPwU/9g/my1KhFCNoWks5fR3kmAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6db3807a0493c372484b4785bc3df809918c116492ca8b25d511fe077e13167e","last_reissued_at":"2026-07-05T10:43:05.926234Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:43:05.926234Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Stable Virtual Camera: Generative View Synthesis with Diffusion Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Aaryaman Vasishta, Christian Rupprecht, Chun-Han Yao, Hang Gao, Jensen Zhou, Mark Boss, Philip Torr, Varun Jampani, Vikram Voleti","submitted_at":"2025-03-18T17:57:22Z","abstract_excerpt":"We present Stable Virtual Camera (Seva), a generalist diffusion model that creates novel views of a scene, given any number of input views and target cameras. Existing works struggle to generate either large viewpoint changes or temporally smooth samples, while relying on specific task configurations. Our approach overcomes these limitations through simple model design, optimized training recipe, and flexible sampling strategy that generalize across view synthesis tasks at test time. As a result, our samples maintain high consistency without requiring additional 3D representation-based distill"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.14489","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.14489/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.14489","created_at":"2026-07-05T10:43:05.926304+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.14489v2","created_at":"2026-07-05T10:43:05.926304+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.14489","created_at":"2026-07-05T10:43:05.926304+00:00"},{"alias_kind":"pith_short_12","alias_value":"NWZYA6QESPBX","created_at":"2026-07-05T10:43:05.926304+00:00"},{"alias_kind":"pith_short_16","alias_value":"NWZYA6QESPBXESCL","created_at":"2026-07-05T10:43:05.926304+00:00"},{"alias_kind":"pith_short_8","alias_value":"NWZYA6QE","created_at":"2026-07-05T10:43:05.926304+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09828","citing_title":"Latent Spatial Memory for Video World Models","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02479","citing_title":"Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24321","citing_title":"Unified 3D Scene Understanding Through Physical World Modeling","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25266","citing_title":"DeltaCam: Differential Intrinsic Camera Modeling for Video Generation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30045","citing_title":"Walking in the Implicit: Interactive World Exploration via Neural Scene Representation","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27659","citing_title":"GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31466","citing_title":"VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching","ref_index":98,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31535","citing_title":"RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22481","citing_title":"Lighting-Consistent Object Transfer Across Radiance Fields","ref_index":238,"is_internal_anchor":false},{"citing_arxiv_id":"2602.04876","citing_title":"PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18599","citing_title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18754","citing_title":"Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19656","citing_title":"Cross-View Splatter: Feed-Forward View Synthesis with Georeferenced Images","ref_index":104,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10959","citing_title":"StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to-End Diffusion in a Canonical Space","ref_index":109,"is_internal_anchor":false},{"citing_arxiv_id":"2508.10934","citing_title":"ViPE: Video Pose Engine for 3D Geometric Perception","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2512.14614","citing_title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11367","citing_title":"3D-Belief: Embodied Belief Inference via Generative 3D World Modeling","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21915","citing_title":"Vista4D: Video Reshooting with 4D Point Clouds","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19954","citing_title":"Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14302","citing_title":"Geometrically Consistent Multi-View Scene Generation from Freehand Sketches","ref_index":60,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG","json":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG.json","graph_json":"https://pith.science/api/pith-number/NWZYA6QESPBXESCLI6C3YPPYBG/graph.json","events_json":"https://pith.science/api/pith-number/NWZYA6QESPBXESCLI6C3YPPYBG/events.json","paper":"https://pith.science/paper/NWZYA6QE"},"agent_actions":{"view_html":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG","download_json":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG.json","view_paper":"https://pith.science/paper/NWZYA6QE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.14489&json=true","fetch_graph":"https://pith.science/api/pith-number/NWZYA6QESPBXESCLI6C3YPPYBG/graph.json","fetch_events":"https://pith.science/api/pith-number/NWZYA6QESPBXESCLI6C3YPPYBG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG/action/storage_attestation","attest_author":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG/action/author_attestation","sign_citation":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG/action/citation_signature","submit_replication":"https://pith.science/pith/NWZYA6QESPBXESCLI6C3YPPYBG/action/replication_record"}},"created_at":"2026-07-05T10:43:05.926304+00:00","updated_at":"2026-07-05T10:43:05.926304+00:00"}