{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:IN6MR7VHSVMP2P3LVR4ZSZ3DDJ","short_pith_number":"pith:IN6MR7VH","schema_version":"1.0","canonical_sha256":"437cc8fea79558fd3f6bac799967631a4db3d5c85fc1831d47c8f1ff7e4c64ed","source":{"kind":"arxiv","id":"2303.18240","version":2},"attestation_state":"computed","paper":{"title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.RO"],"primary_cat":"cs.CV","authors_text":"Aravind Rajeswaran, Arjun Majumdar, Aryan Jain, Claire Chen, Dhruv Batra, Franziska Meier, Jitendra Malik, Karmesh Yadav, Oleksandr Maksymets, Pieter Abbeel, Sergio Arnaud, Sneha Silwal, Vincent-Pierre Berges, Yecheng Jason Ma, Yixin Lin","submitted_at":"2023-03-31T17:56:33Z","abstract_excerpt":"We present the largest and most comprehensive empirical study of pre-trained visual representations (PVRs) or visual 'foundation models' for Embodied AI. First, we curate CortexBench, consisting of 17 different tasks spanning locomotion, navigation, dexterous, and mobile manipulation. Next, we systematically evaluate existing PVRs and find that none are universally dominant. To study the effect of pre-training data size and diversity, we combine over 4,000 hours of egocentric videos from 7 different sources (over 4.3M images) and ImageNet to train different-sized vision transformers using Mask"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2303.18240","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2023-03-31T17:56:33Z","cross_cats_sorted":["cs.AI","cs.LG","cs.RO"],"title_canon_sha256":"b09364c9a82d2bbee6c9b70590753e1e75f057afaaa4d843f9e880de7cb1f8e6","abstract_canon_sha256":"37b6e7f6fd91921d2c595e7fcb5c1235d31c8a22cf1b7409a8eaa859b214f757"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:40:20.951578Z","signature_b64":"7hUpCrfVnnksvGzhIHN4oSQGFGLetRXlRV0LYyx8SNaO/Xc0VLn47gNXETWOQGCF7N9w+Q2yDZgkCXU28HyoCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"437cc8fea79558fd3f6bac799967631a4db3d5c85fc1831d47c8f1ff7e4c64ed","last_reissued_at":"2026-07-05T07:40:20.951038Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:40:20.951038Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.RO"],"primary_cat":"cs.CV","authors_text":"Aravind Rajeswaran, Arjun Majumdar, Aryan Jain, Claire Chen, Dhruv Batra, Franziska Meier, Jitendra Malik, Karmesh Yadav, Oleksandr Maksymets, Pieter Abbeel, Sergio Arnaud, Sneha Silwal, Vincent-Pierre Berges, Yecheng Jason Ma, Yixin Lin","submitted_at":"2023-03-31T17:56:33Z","abstract_excerpt":"We present the largest and most comprehensive empirical study of pre-trained visual representations (PVRs) or visual 'foundation models' for Embodied AI. First, we curate CortexBench, consisting of 17 different tasks spanning locomotion, navigation, dexterous, and mobile manipulation. Next, we systematically evaluate existing PVRs and find that none are universally dominant. To study the effect of pre-training data size and diversity, we combine over 4,000 hours of egocentric videos from 7 different sources (over 4.3M images) and ImageNet to train different-sized vision transformers using Mask"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2303.18240","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2303.18240/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2303.18240","created_at":"2026-07-05T07:40:20.951096+00:00"},{"alias_kind":"arxiv_version","alias_value":"2303.18240v2","created_at":"2026-07-05T07:40:20.951096+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.18240","created_at":"2026-07-05T07:40:20.951096+00:00"},{"alias_kind":"pith_short_12","alias_value":"IN6MR7VHSVMP","created_at":"2026-07-05T07:40:20.951096+00:00"},{"alias_kind":"pith_short_16","alias_value":"IN6MR7VHSVMP2P3L","created_at":"2026-07-05T07:40:20.951096+00:00"},{"alias_kind":"pith_short_8","alias_value":"IN6MR7VH","created_at":"2026-07-05T07:40:20.951096+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17256","citing_title":"Contrastive Action-Image Pre-training for Visuomotor Control","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10614","citing_title":"Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2310.02635","citing_title":"Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2506.10137","citing_title":"Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2511.14427","citing_title":"Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2409.16283","citing_title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2310.08864","citing_title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10809","citing_title":"WARPED: Wrist-Aligned Rendering for Robot Policy Learning from Egocentric Human Demonstrations","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2405.12213","citing_title":"Octo: An Open-Source Generalist Robot Policy","ref_index":58,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ","json":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ.json","graph_json":"https://pith.science/api/pith-number/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/graph.json","events_json":"https://pith.science/api/pith-number/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/events.json","paper":"https://pith.science/paper/IN6MR7VH"},"agent_actions":{"view_html":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ","download_json":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ.json","view_paper":"https://pith.science/paper/IN6MR7VH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2303.18240&json=true","fetch_graph":"https://pith.science/api/pith-number/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/graph.json","fetch_events":"https://pith.science/api/pith-number/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/action/storage_attestation","attest_author":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/action/author_attestation","sign_citation":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/action/citation_signature","submit_replication":"https://pith.science/pith/IN6MR7VHSVMP2P3LVR4ZSZ3DDJ/action/replication_record"}},"created_at":"2026-07-05T07:40:20.951096+00:00","updated_at":"2026-07-05T07:40:20.951096+00:00"}