{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:55L4SHDZXK62MBSAV5HLVMBIBE","short_pith_number":"pith:55L4SHDZ","schema_version":"1.0","canonical_sha256":"ef57c91c79babda60640af4ebab02809332b5f0f27256aff64117be9f6fed331","source":{"kind":"arxiv","id":"2503.11651","version":1},"attestation_state":"computed","paper":{"title":"VGGT: Visual Geometry Grounded Transformer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Andrea Vedaldi, Christian Rupprecht, David Novotny, Jianyuan Wang, Minghao Chen, Nikita Karaev","submitted_at":"2025-03-14T17:59:47Z","abstract_excerpt":"We present VGGT, a feed-forward neural network that directly infers all key 3D attributes of a scene, including camera parameters, point maps, depth maps, and 3D point tracks, from one, a few, or hundreds of its views. This approach is a step forward in 3D computer vision, where models have typically been constrained to and specialized for single tasks. It is also simple and efficient, reconstructing images in under one second, and still outperforming alternatives that require post-processing with visual geometry optimization techniques. The network achieves state-of-the-art results in multipl"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.11651","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-03-14T17:59:47Z","cross_cats_sorted":[],"title_canon_sha256":"264f9365f6603cfb348167cdb861a824d52008a178c5de0c7b5c7b30600e1819","abstract_canon_sha256":"0e2f88e859b7aee41e362364e1a0051a42e25e4e346a0fbaee57e84b1fd5f205"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:31:36.799919Z","signature_b64":"A3Tt6DrqiftzdQYedUNoLl0HcN/VPkiQEhP56ZeZlJuv+OZECFnm0eBlu+Kq9t7gbC7tWoTde2lRcD/Blk5xAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ef57c91c79babda60640af4ebab02809332b5f0f27256aff64117be9f6fed331","last_reissued_at":"2026-07-05T10:31:36.799339Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:31:36.799339Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VGGT: Visual Geometry Grounded Transformer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Andrea Vedaldi, Christian Rupprecht, David Novotny, Jianyuan Wang, Minghao Chen, Nikita Karaev","submitted_at":"2025-03-14T17:59:47Z","abstract_excerpt":"We present VGGT, a feed-forward neural network that directly infers all key 3D attributes of a scene, including camera parameters, point maps, depth maps, and 3D point tracks, from one, a few, or hundreds of its views. This approach is a step forward in 3D computer vision, where models have typically been constrained to and specialized for single tasks. It is also simple and efficient, reconstructing images in under one second, and still outperforming alternatives that require post-processing with visual geometry optimization techniques. The network achieves state-of-the-art results in multipl"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.11651","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.11651/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.11651","created_at":"2026-07-05T10:31:36.799406+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.11651v1","created_at":"2026-07-05T10:31:36.799406+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.11651","created_at":"2026-07-05T10:31:36.799406+00:00"},{"alias_kind":"pith_short_12","alias_value":"55L4SHDZXK62","created_at":"2026-07-05T10:31:36.799406+00:00"},{"alias_kind":"pith_short_16","alias_value":"55L4SHDZXK62MBSA","created_at":"2026-07-05T10:31:36.799406+00:00"},{"alias_kind":"pith_short_8","alias_value":"55L4SHDZ","created_at":"2026-07-05T10:31:36.799406+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27354","citing_title":"Error-Conditioned Neural Solvers","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20515","citing_title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02075","citing_title":"HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05491","citing_title":"Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21472","citing_title":"Stream3D: Sequential Multi-View 3D Generation via Evidential Memory","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24642","citing_title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20515","citing_title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25308","citing_title":"Stabilizing Streaming Video Geometry via Dynamic Feature Normalization","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26115","citing_title":"TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28101","citing_title":"EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22481","citing_title":"Lighting-Consistent Object Transfer Across Radiance Fields","ref_index":299,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23888","citing_title":"GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22190","citing_title":"No Pose, No Problem in 4D: Feed-Forward Dynamic Gaussians from Unposed Multi-View Videos","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21121","citing_title":"ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21472","citing_title":"Stream3D: Sequential Multi-View 3D Generation via Evidential Memory","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2505.12549","citing_title":"VGGT-SLAM: Dense RGB SLAM Optimized on the SL(4) Manifold","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2505.20279","citing_title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2511.00503","citing_title":"Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12938","citing_title":"CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2507.13347","citing_title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06481","citing_title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","ref_index":77,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12309","citing_title":"Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10809","citing_title":"WARPED: Wrist-Aligned Rendering for Robot Policy Learning from Egocentric Human Demonstrations","ref_index":104,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14025","citing_title":"Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE","json":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE.json","graph_json":"https://pith.science/api/pith-number/55L4SHDZXK62MBSAV5HLVMBIBE/graph.json","events_json":"https://pith.science/api/pith-number/55L4SHDZXK62MBSAV5HLVMBIBE/events.json","paper":"https://pith.science/paper/55L4SHDZ"},"agent_actions":{"view_html":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE","download_json":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE.json","view_paper":"https://pith.science/paper/55L4SHDZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.11651&json=true","fetch_graph":"https://pith.science/api/pith-number/55L4SHDZXK62MBSAV5HLVMBIBE/graph.json","fetch_events":"https://pith.science/api/pith-number/55L4SHDZXK62MBSAV5HLVMBIBE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE/action/storage_attestation","attest_author":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE/action/author_attestation","sign_citation":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE/action/citation_signature","submit_replication":"https://pith.science/pith/55L4SHDZXK62MBSAV5HLVMBIBE/action/replication_record"}},"created_at":"2026-07-05T10:31:36.799406+00:00","updated_at":"2026-07-05T10:31:36.799406+00:00"}