{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:2WMZMNQGTW4ELDHE65EUCJK5AZ","short_pith_number":"pith:2WMZMNQG","schema_version":"1.0","canonical_sha256":"d5999636069db8458ce4f74941255d064cfc0aecfc4c3b88422eba4d076ab5ed","source":{"kind":"arxiv","id":"2502.05485","version":4},"attestation_state":"computed","paper":{"title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.RO","authors_text":"Abhishek Gupta, Ankit Goyal, Anqi Li, Caelan Reed Garrett, Dieter Fox, Fabio Ramos, Jesse Zhang, Joel Jang, Marius Memmel, Raymond Yu, Yi Li, Yuquan Deng","submitted_at":"2025-02-08T07:50:22Z","abstract_excerpt":"Large foundation models have shown strong open-world generalization to complex problems in vision and language, but similar levels of generalization have yet to be achieved in robotics. One fundamental challenge is the lack of robotic data, which are typically obtained through expensive on-robot operation. A promising remedy is to leverage cheaper, off-domain data such as action-free videos, hand-drawn sketches or simulation data. In this work, we posit that hierarchical vision-language-action (VLA) models can be more effective in utilizing off-domain data than standard monolithic VLA models t"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.05485","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-02-08T07:50:22Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"74e2c82a6caa0022ed1cb20f4d7c88ac0e5ae6cce10a25845b471091e47a9bd5","abstract_canon_sha256":"a3939f0edc57700de7039ba5840d0bfb2450711a6f644a29887031a577957ad9"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:01:03.503725Z","signature_b64":"HIZsessdSBNrvdAwMGI4pAq8jK7OMpKI+Ns/wnIVkT5fr+TukDX6ydaeuk7IG7pUB5b7Fo8z5ycpLDjAnxP3Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d5999636069db8458ce4f74941255d064cfc0aecfc4c3b88422eba4d076ab5ed","last_reissued_at":"2026-07-05T11:01:03.503220Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:01:03.503220Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.RO","authors_text":"Abhishek Gupta, Ankit Goyal, Anqi Li, Caelan Reed Garrett, Dieter Fox, Fabio Ramos, Jesse Zhang, Joel Jang, Marius Memmel, Raymond Yu, Yi Li, Yuquan Deng","submitted_at":"2025-02-08T07:50:22Z","abstract_excerpt":"Large foundation models have shown strong open-world generalization to complex problems in vision and language, but similar levels of generalization have yet to be achieved in robotics. One fundamental challenge is the lack of robotic data, which are typically obtained through expensive on-robot operation. A promising remedy is to leverage cheaper, off-domain data such as action-free videos, hand-drawn sketches or simulation data. In this work, we posit that hierarchical vision-language-action (VLA) models can be more effective in utilizing off-domain data than standard monolithic VLA models t"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.05485","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.05485/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.05485","created_at":"2026-07-05T11:01:03.503275+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.05485v4","created_at":"2026-07-05T11:01:03.503275+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.05485","created_at":"2026-07-05T11:01:03.503275+00:00"},{"alias_kind":"pith_short_12","alias_value":"2WMZMNQGTW4E","created_at":"2026-07-05T11:01:03.503275+00:00"},{"alias_kind":"pith_short_16","alias_value":"2WMZMNQGTW4ELDHE","created_at":"2026-07-05T11:01:03.503275+00:00"},{"alias_kind":"pith_short_8","alias_value":"2WMZMNQG","created_at":"2026-07-05T11:01:03.503275+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":5,"sample":[{"citing_arxiv_id":"2607.06706","citing_title":"Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review","ref_index":62,"is_internal_anchor":true},{"citing_arxiv_id":"2607.07287","citing_title":"TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2607.08724","citing_title":"Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference","ref_index":25,"is_internal_anchor":true},{"citing_arxiv_id":"2607.07101","citing_title":"GeoProp: Grounding Robot State in Vision for Generalist Manipulation","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2607.07287","citing_title":"TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2606.22794","citing_title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20905","citing_title":"Vesta: A Generalist Embodied Reasoning Model","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10267","citing_title":"What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02735","citing_title":"See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17480","citing_title":"GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2511.02239","citing_title":"LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2504.16054","citing_title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20085","citing_title":"Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2507.16815","citing_title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2502.19417","citing_title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2602.13193","citing_title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20231","citing_title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2603.22003","citing_title":"VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2510.13778","citing_title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14125","citing_title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2602.15922","citing_title":"World Action Models are Zero-shot Policies","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10432","citing_title":"AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04664","citing_title":"ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14125","citing_title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","ref_index":22,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ","json":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ.json","graph_json":"https://pith.science/api/pith-number/2WMZMNQGTW4ELDHE65EUCJK5AZ/graph.json","events_json":"https://pith.science/api/pith-number/2WMZMNQGTW4ELDHE65EUCJK5AZ/events.json","paper":"https://pith.science/paper/2WMZMNQG"},"agent_actions":{"view_html":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ","download_json":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ.json","view_paper":"https://pith.science/paper/2WMZMNQG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.05485&json=true","fetch_graph":"https://pith.science/api/pith-number/2WMZMNQGTW4ELDHE65EUCJK5AZ/graph.json","fetch_events":"https://pith.science/api/pith-number/2WMZMNQGTW4ELDHE65EUCJK5AZ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ/action/storage_attestation","attest_author":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ/action/author_attestation","sign_citation":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ/action/citation_signature","submit_replication":"https://pith.science/pith/2WMZMNQGTW4ELDHE65EUCJK5AZ/action/replication_record"}},"created_at":"2026-07-05T11:01:03.503275+00:00","updated_at":"2026-07-05T11:01:03.503275+00:00"}