{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:IYBHVYWQJDKO5CK4GBE7CVDMKJ","short_pith_number":"pith:IYBHVYWQ","schema_version":"1.0","canonical_sha256":"46027ae2d048d4ee895c3049f1546c527ac7a9db0769fe73ac53b1efeef2a8b9","source":{"kind":"arxiv","id":"2306.11706","version":2},"attestation_state":"computed","paper":{"title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.RO","authors_text":"Abbas Abdolmaleki, Agrim Gupta, Akhil Raju, Alex X. Lee, Antoine Laurens, Claudio Fantacci, Coline Devin, Dave Barker, Dushyant Rao, Emilio Parisotto, Francesco Nori, Giulia Vezzani, Jean-Baptiste Regli, Jon Scholz, Jos\\'e Enrique Chen, Jost Tobias Springenberg, Joy Ortiz, Konrad \\.Zo{\\l}na, Konstantinos Bousmalis, Maria Bauza, Martina Zambelli, Martin Riedmiller, Michiel Blokzijl, Misha Denil, Murilo Martins, Nathan Batchelor, Nicolas Heess, Oleg Sushkov, Oliver Groth, Raia Hadsell, Rugile Pevceviciute, Scott Reed, Sergio G\\'omez Colmenarejo, Thomas Lampe, Todor Davchev, Tom Roth\\\"orl, Valentin Dalibard, Yusuf Aytar, Yuxiang Zhou","submitted_at":"2023-06-20T17:35:20Z","abstract_excerpt":"The ability to leverage heterogeneous robotic experience from different robots and tasks to quickly master novel skills and embodiments has the potential to transform robot learning. Inspired by recent advances in foundation models for vision and language, we propose a multi-embodiment, multi-task generalist agent for robotic manipulation. This agent, named RoboCat, is a visual goal-conditioned decision transformer capable of consuming action-labelled visual experience. This data spans a large repertoire of motor control skills from simulated and real robotic arms with varying sets of observat"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2306.11706","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2023-06-20T17:35:20Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"686fea1216ab18147753bd43cbf2afd23e95697099393ed2fd77191f120e761d","abstract_canon_sha256":"07bab6a4d902783429bc8048df2b0c2bc64585ad3f3fbc2acde05fcf6c5d0e11"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:27:06.848245Z","signature_b64":"MPmyxBEuRbJVR82FdUdy2o1AqRjApZIEgleY51CxqKHEANrx8D9zijjdXzOllpT3nJyzjWca82wMlmUxWLPkDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"46027ae2d048d4ee895c3049f1546c527ac7a9db0769fe73ac53b1efeef2a8b9","last_reissued_at":"2026-07-05T07:27:06.847806Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:27:06.847806Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.RO","authors_text":"Abbas Abdolmaleki, Agrim Gupta, Akhil Raju, Alex X. Lee, Antoine Laurens, Claudio Fantacci, Coline Devin, Dave Barker, Dushyant Rao, Emilio Parisotto, Francesco Nori, Giulia Vezzani, Jean-Baptiste Regli, Jon Scholz, Jos\\'e Enrique Chen, Jost Tobias Springenberg, Joy Ortiz, Konrad \\.Zo{\\l}na, Konstantinos Bousmalis, Maria Bauza, Martina Zambelli, Martin Riedmiller, Michiel Blokzijl, Misha Denil, Murilo Martins, Nathan Batchelor, Nicolas Heess, Oleg Sushkov, Oliver Groth, Raia Hadsell, Rugile Pevceviciute, Scott Reed, Sergio G\\'omez Colmenarejo, Thomas Lampe, Todor Davchev, Tom Roth\\\"orl, Valentin Dalibard, Yusuf Aytar, Yuxiang Zhou","submitted_at":"2023-06-20T17:35:20Z","abstract_excerpt":"The ability to leverage heterogeneous robotic experience from different robots and tasks to quickly master novel skills and embodiments has the potential to transform robot learning. Inspired by recent advances in foundation models for vision and language, we propose a multi-embodiment, multi-task generalist agent for robotic manipulation. This agent, named RoboCat, is a visual goal-conditioned decision transformer capable of consuming action-labelled visual experience. This data spans a large repertoire of motor control skills from simulated and real robotic arms with varying sets of observat"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2306.11706","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2306.11706/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2306.11706","created_at":"2026-07-05T07:27:06.847872+00:00"},{"alias_kind":"arxiv_version","alias_value":"2306.11706v2","created_at":"2026-07-05T07:27:06.847872+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2306.11706","created_at":"2026-07-05T07:27:06.847872+00:00"},{"alias_kind":"pith_short_12","alias_value":"IYBHVYWQJDKO","created_at":"2026-07-05T07:27:06.847872+00:00"},{"alias_kind":"pith_short_16","alias_value":"IYBHVYWQJDKO5CK4","created_at":"2026-07-05T07:27:06.847872+00:00"},{"alias_kind":"pith_short_8","alias_value":"IYBHVYWQ","created_at":"2026-07-05T07:27:06.847872+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":30,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21501","citing_title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20871","citing_title":"Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18558","citing_title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09630","citing_title":"ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06556","citing_title":"Robots Need More than VLA and World Models","ref_index":117,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06491","citing_title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00416","citing_title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00110","citing_title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27817","citing_title":"Turning Video Models into Generalist Robot Policies","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22449","citing_title":"Self-Evolving Cognitive Framework via Causal World Modeling for Embodied Scientific Intelligence","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2405.14093","citing_title":"A Survey on Vision-Language-Action Models for Embodied AI","ref_index":97,"is_internal_anchor":false},{"citing_arxiv_id":"2410.06239","citing_title":"Open-Architecture End-to-End System for Real-World Autonomous Robot Navigation","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07799","citing_title":"Learning Without Losing Identity: Capability Evolution for Embodied Agents","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19319","citing_title":"SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2401.03568","citing_title":"Agent AI: Surveying the Horizons of Multimodal Interaction","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14058","citing_title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2603.09030","citing_title":"PlayWorld: Learning Robot World Models from Autonomous Play","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2512.15692","citing_title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2401.02117","citing_title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2312.13139","citing_title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11809","citing_title":"Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2511.14759","citing_title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2410.06158","citing_title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23121","citing_title":"Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2310.08864","citing_title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","ref_index":25,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ","json":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ.json","graph_json":"https://pith.science/api/pith-number/IYBHVYWQJDKO5CK4GBE7CVDMKJ/graph.json","events_json":"https://pith.science/api/pith-number/IYBHVYWQJDKO5CK4GBE7CVDMKJ/events.json","paper":"https://pith.science/paper/IYBHVYWQ"},"agent_actions":{"view_html":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ","download_json":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ.json","view_paper":"https://pith.science/paper/IYBHVYWQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2306.11706&json=true","fetch_graph":"https://pith.science/api/pith-number/IYBHVYWQJDKO5CK4GBE7CVDMKJ/graph.json","fetch_events":"https://pith.science/api/pith-number/IYBHVYWQJDKO5CK4GBE7CVDMKJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ/action/storage_attestation","attest_author":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ/action/author_attestation","sign_citation":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ/action/citation_signature","submit_replication":"https://pith.science/pith/IYBHVYWQJDKO5CK4GBE7CVDMKJ/action/replication_record"}},"created_at":"2026-07-05T07:27:06.847872+00:00","updated_at":"2026-07-05T07:27:06.847872+00:00"}