{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:XW44HDW5H4RCIA2Z7SKMJKTWDM","short_pith_number":"pith:XW44HDW5","schema_version":"1.0","canonical_sha256":"bdb9c38edd3f22240359fc94c4aa761b390aaa337a136c77eb5a814c70ef8505","source":{"kind":"arxiv","id":"2312.07843","version":1},"attestation_state":"computed","paper":{"title":"Foundation Models in Robotics: Applications, Challenges, and the Future","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Anirudha Majumdar, Ashish Kapoor, Brian Ichter, Cewu Lu, Danny Driess, Jiajun Wu, Jiankai Sun, Johnathan Tucker, Karol Hausman, Mac Schwager, Roya Firoozi, Shuran Song, Stephen Tian, Weiyu Liu, Yuke Zhu","submitted_at":"2023-12-13T02:20:42Z","abstract_excerpt":"We survey applications of pretrained foundation models in robotics. Traditional deep learning models in robotics are trained on small datasets tailored for specific tasks, which limits their adaptability across diverse applications. In contrast, foundation models pretrained on internet-scale data appear to have superior generalization capabilities, and in some instances display an emergent ability to find zero-shot solutions to problems that are not present in the training data. Foundation models may hold the potential to enhance various components of the robot autonomy stack, from perception "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.07843","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2023-12-13T02:20:42Z","cross_cats_sorted":[],"title_canon_sha256":"75d83f16835f50d517013504a73683a00316907cd3324a1309f499185ceeb887","abstract_canon_sha256":"66df5810dc25c56664d9c4dd914c63e649c79432e67dee143ab31f45fe8ec7a4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:23:38.070177Z","signature_b64":"8WANC2jb7GvNdTI7qXYTEYQfTuWI9qHSn1pDR4vs+stYE858Rm9QXBiCH3eAxvVtvyK1x894oa+BQpB1HmhvDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bdb9c38edd3f22240359fc94c4aa761b390aaa337a136c77eb5a814c70ef8505","last_reissued_at":"2026-07-05T07:23:38.069577Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:23:38.069577Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Foundation Models in Robotics: Applications, Challenges, and the Future","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Anirudha Majumdar, Ashish Kapoor, Brian Ichter, Cewu Lu, Danny Driess, Jiajun Wu, Jiankai Sun, Johnathan Tucker, Karol Hausman, Mac Schwager, Roya Firoozi, Shuran Song, Stephen Tian, Weiyu Liu, Yuke Zhu","submitted_at":"2023-12-13T02:20:42Z","abstract_excerpt":"We survey applications of pretrained foundation models in robotics. Traditional deep learning models in robotics are trained on small datasets tailored for specific tasks, which limits their adaptability across diverse applications. In contrast, foundation models pretrained on internet-scale data appear to have superior generalization capabilities, and in some instances display an emergent ability to find zero-shot solutions to problems that are not present in the training data. Foundation models may hold the potential to enhance various components of the robot autonomy stack, from perception "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.07843","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.07843/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.07843","created_at":"2026-07-05T07:23:38.069643+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.07843v1","created_at":"2026-07-05T07:23:38.069643+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.07843","created_at":"2026-07-05T07:23:38.069643+00:00"},{"alias_kind":"pith_short_12","alias_value":"XW44HDW5H4RC","created_at":"2026-07-05T07:23:38.069643+00:00"},{"alias_kind":"pith_short_16","alias_value":"XW44HDW5H4RCIA2Z","created_at":"2026-07-05T07:23:38.069643+00:00"},{"alias_kind":"pith_short_8","alias_value":"XW44HDW5","created_at":"2026-07-05T07:23:38.069643+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.12783","citing_title":"A Tutorial on World Models and Physical AI","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2405.14093","citing_title":"A Survey on Vision-Language-Action Models for Embodied AI","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2502.03814","citing_title":"Large Language Models for Multi-Robot Systems: A Survey","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2409.01652","citing_title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2603.12510","citing_title":"Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12651","citing_title":"Runtime Monitoring of Perception-Based Autonomous Systems via Embedding Temporal Logic","ref_index":128,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12651","citing_title":"Runtime Monitoring of Perception-Based Autonomous Systems via Embedding Temporal Logic","ref_index":128,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13236","citing_title":"SemiFA: An Agentic Multi-Modal Framework for Autonomous Semiconductor Failure Analysis Report Generation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07034","citing_title":"KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13733","citing_title":"Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM","json":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM.json","graph_json":"https://pith.science/api/pith-number/XW44HDW5H4RCIA2Z7SKMJKTWDM/graph.json","events_json":"https://pith.science/api/pith-number/XW44HDW5H4RCIA2Z7SKMJKTWDM/events.json","paper":"https://pith.science/paper/XW44HDW5"},"agent_actions":{"view_html":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM","download_json":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM.json","view_paper":"https://pith.science/paper/XW44HDW5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.07843&json=true","fetch_graph":"https://pith.science/api/pith-number/XW44HDW5H4RCIA2Z7SKMJKTWDM/graph.json","fetch_events":"https://pith.science/api/pith-number/XW44HDW5H4RCIA2Z7SKMJKTWDM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM/action/storage_attestation","attest_author":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM/action/author_attestation","sign_citation":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM/action/citation_signature","submit_replication":"https://pith.science/pith/XW44HDW5H4RCIA2Z7SKMJKTWDM/action/replication_record"}},"created_at":"2026-07-05T07:23:38.069643+00:00","updated_at":"2026-07-05T07:23:38.069643+00:00"}