{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:D6JPYILM56S23USW7KNU55VKPZ","short_pith_number":"pith:D6JPYILM","schema_version":"1.0","canonical_sha256":"1f92fc216cefa5add256fa9b4ef6aa7e6fc121c1ed6f94841fe6af386d80fe5f","source":{"kind":"arxiv","id":"2306.14846","version":2},"attestation_state":"computed","paper":{"title":"ViNT: A Foundation Model for Visual Navigation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Ajay Sridhar, Dhruv Shah, Kevin Black, Kyle Stachowicz, Nitish Dashora, Noriaki Hirose, Sergey Levine","submitted_at":"2023-06-26T16:57:03Z","abstract_excerpt":"General-purpose pre-trained models (\"foundation models\") have enabled practitioners to produce generalizable solutions for individual machine learning problems with datasets that are significantly smaller than those required for learning from scratch. Such models are typically trained on large and diverse datasets with weak supervision, consuming much more training data than is available for any individual downstream application. In this paper, we describe the Visual Navigation Transformer (ViNT), a foundation model that aims to bring the success of general-purpose pre-trained models to vision"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2306.14846","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2023-06-26T16:57:03Z","cross_cats_sorted":["cs.CV","cs.LG"],"title_canon_sha256":"02c80b93f60816dd52bd12569d40004720edd144434e9137b60b2dddfdfdca47","abstract_canon_sha256":"0e340c37cd4d3ae45d85cb3ad1fb8b3a313ff33daedc946db1ed72a009c02f36"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:04:17.493924Z","signature_b64":"wooFZbwnL0hQ0N0w6cReg+T0s8ImcxknCytXHIRg9SnEj0H6JxVoJNCRPYsguzpfmJbLgLVEhiPcPcC0Hhe/BA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1f92fc216cefa5add256fa9b4ef6aa7e6fc121c1ed6f94841fe6af386d80fe5f","last_reissued_at":"2026-07-05T07:04:17.493423Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:04:17.493423Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ViNT: A Foundation Model for Visual Navigation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Ajay Sridhar, Dhruv Shah, Kevin Black, Kyle Stachowicz, Nitish Dashora, Noriaki Hirose, Sergey Levine","submitted_at":"2023-06-26T16:57:03Z","abstract_excerpt":"General-purpose pre-trained models (\"foundation models\") have enabled practitioners to produce generalizable solutions for individual machine learning problems with datasets that are significantly smaller than those required for learning from scratch. Such models are typically trained on large and diverse datasets with weak supervision, consuming much more training data than is available for any individual downstream application. In this paper, we describe the Visual Navigation Transformer (ViNT), a foundation model that aims to bring the success of general-purpose pre-trained models to vision"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2306.14846","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2306.14846/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2306.14846","created_at":"2026-07-05T07:04:17.493485+00:00"},{"alias_kind":"arxiv_version","alias_value":"2306.14846v2","created_at":"2026-07-05T07:04:17.493485+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2306.14846","created_at":"2026-07-05T07:04:17.493485+00:00"},{"alias_kind":"pith_short_12","alias_value":"D6JPYILM56S2","created_at":"2026-07-05T07:04:17.493485+00:00"},{"alias_kind":"pith_short_16","alias_value":"D6JPYILM56S23USW","created_at":"2026-07-05T07:04:17.493485+00:00"},{"alias_kind":"pith_short_8","alias_value":"D6JPYILM","created_at":"2026-07-05T07:04:17.493485+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":30,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26047","citing_title":"Learning Robot Visual Navigation in Crowds via Intention-Aware Scene Representations","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24101","citing_title":"NavWM: A Unified Navigation World Model for Foresight-Driven Planning","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20458","citing_title":"Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13494","citing_title":"NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12603","citing_title":"From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10495","citing_title":"Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10371","citing_title":"Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01621","citing_title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24578","citing_title":"World Models as Group Actions","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24761","citing_title":"Drift-Resistant Navigation World Model with Anchored Epipolar Guidance","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26239","citing_title":"Sentinel: Embodied Cooperative Spatial Reasoning and Planning","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26710","citing_title":"Look Further: Socially-Compliant Navigation System in Residential Buildings","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28237","citing_title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23165","citing_title":"Autonomous Frontier-Based Exploration with VLM Guidance","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2501.14377","citing_title":"Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2504.16054","citing_title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15559","citing_title":"NavRL++: A System-Level Framework for Improving Sim-to-Real Transfer in Reinforcement Learning-Based Robot Navigation","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18324","citing_title":"Improved Baselines with Representation Autoencoders","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2511.11931","citing_title":"MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2511.18525","citing_title":"Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2512.02535","citing_title":"AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2310.06114","citing_title":"Learning Interactive Real-World Simulators","ref_index":166,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02829","citing_title":"STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11762","citing_title":"NavOL: Navigation Policy with Online Imitation Learning","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2403.12945","citing_title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","ref_index":50,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ","json":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ.json","graph_json":"https://pith.science/api/pith-number/D6JPYILM56S23USW7KNU55VKPZ/graph.json","events_json":"https://pith.science/api/pith-number/D6JPYILM56S23USW7KNU55VKPZ/events.json","paper":"https://pith.science/paper/D6JPYILM"},"agent_actions":{"view_html":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ","download_json":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ.json","view_paper":"https://pith.science/paper/D6JPYILM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2306.14846&json=true","fetch_graph":"https://pith.science/api/pith-number/D6JPYILM56S23USW7KNU55VKPZ/graph.json","fetch_events":"https://pith.science/api/pith-number/D6JPYILM56S23USW7KNU55VKPZ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ/action/storage_attestation","attest_author":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ/action/author_attestation","sign_citation":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ/action/citation_signature","submit_replication":"https://pith.science/pith/D6JPYILM56S23USW7KNU55VKPZ/action/replication_record"}},"created_at":"2026-07-05T07:04:17.493485+00:00","updated_at":"2026-07-05T07:04:17.493485+00:00"}