{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SSKMQM3SNZWW2M3WZ7UTPI25VM","short_pith_number":"pith:SSKMQM3S","schema_version":"1.0","canonical_sha256":"9494c833726e6d6d3376cfe937a35dab0dc4de897fddd8717deda034be3d5f2b","source":{"kind":"arxiv","id":"2502.14795","version":2},"attestation_state":"computed","paper":{"title":"Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.RO","authors_text":"Binghong Zou, Donglin Wang, Hongchao Lu, Huaicheng Zhou, Jiacheng Liu, Jianfei Ma, Jinxin Liu, Panzhong Mo, Pengxiang Ding, Siteng Huang, Ting Wang, Wenshuo Feng, Xinxin Luo, Xinyang Tong, Yiguo Fan, Yuefan Wang","submitted_at":"2025-02-20T18:17:11Z","abstract_excerpt":"This paper addresses the limitations of current humanoid robot control frameworks, which primarily rely on reactive mechanisms and lack autonomous interaction capabilities due to data scarcity. We propose Humanoid-VLA, a novel framework that integrates language understanding, egocentric scene perception, and motion control, enabling universal humanoid control. Humanoid-VLA begins with language-motion pre-alignment using non-egocentric human motion datasets paired with textual descriptions, allowing the model to learn universal motion patterns and action semantics. We then incorporate egocentri"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.14795","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-02-20T18:17:11Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"69cec354a5fc41f114a55a279144403716e3e409e3ffa76f1d760a30e29c2337","abstract_canon_sha256":"b1709173bb889a1175a77e109d03c6a388d5e3927319af8f1730366cd0ae551a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:17:55.275901Z","signature_b64":"Uj/y0c8yphYDiz/idedyBDoDXP4GrAyVS9AGoASrrjZhNtco3o6B0A8nhYq4Ir0KA2BGgLgsCmAjum2/k1DCCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9494c833726e6d6d3376cfe937a35dab0dc4de897fddd8717deda034be3d5f2b","last_reissued_at":"2026-07-05T10:17:55.275275Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:17:55.275275Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.RO","authors_text":"Binghong Zou, Donglin Wang, Hongchao Lu, Huaicheng Zhou, Jiacheng Liu, Jianfei Ma, Jinxin Liu, Panzhong Mo, Pengxiang Ding, Siteng Huang, Ting Wang, Wenshuo Feng, Xinxin Luo, Xinyang Tong, Yiguo Fan, Yuefan Wang","submitted_at":"2025-02-20T18:17:11Z","abstract_excerpt":"This paper addresses the limitations of current humanoid robot control frameworks, which primarily rely on reactive mechanisms and lack autonomous interaction capabilities due to data scarcity. We propose Humanoid-VLA, a novel framework that integrates language understanding, egocentric scene perception, and motion control, enabling universal humanoid control. Humanoid-VLA begins with language-motion pre-alignment using non-egocentric human motion datasets paired with textual descriptions, allowing the model to learn universal motion patterns and action semantics. We then incorporate egocentri"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.14795","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.14795/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.14795","created_at":"2026-07-05T10:17:55.275376+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.14795v2","created_at":"2026-07-05T10:17:55.275376+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.14795","created_at":"2026-07-05T10:17:55.275376+00:00"},{"alias_kind":"pith_short_12","alias_value":"SSKMQM3SNZWW","created_at":"2026-07-05T10:17:55.275376+00:00"},{"alias_kind":"pith_short_16","alias_value":"SSKMQM3SNZWW2M3W","created_at":"2026-07-05T10:17:55.275376+00:00"},{"alias_kind":"pith_short_8","alias_value":"SSKMQM3S","created_at":"2026-07-05T10:17:55.275376+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17833","citing_title":"HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10267","citing_title":"What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08548","citing_title":"OASIS: From Simulation Data Collection to Real-World Humanoid Loco-Manipulation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30645","citing_title":"VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2602.08167","citing_title":"Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2602.18532","citing_title":"VLANeXt: Recipes for Building Strong VLA Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07993","citing_title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21133","citing_title":"Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2507.12768","citing_title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2508.13073","citing_title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","ref_index":198,"is_internal_anchor":false},{"citing_arxiv_id":"2511.22963","citing_title":"Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11369","citing_title":"Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21351","citing_title":"Learn Weightlessness: Imitate Non-Self-Stabilizing Motions on Humanoid Robot","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07993","citing_title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM","json":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM.json","graph_json":"https://pith.science/api/pith-number/SSKMQM3SNZWW2M3WZ7UTPI25VM/graph.json","events_json":"https://pith.science/api/pith-number/SSKMQM3SNZWW2M3WZ7UTPI25VM/events.json","paper":"https://pith.science/paper/SSKMQM3S"},"agent_actions":{"view_html":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM","download_json":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM.json","view_paper":"https://pith.science/paper/SSKMQM3S","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.14795&json=true","fetch_graph":"https://pith.science/api/pith-number/SSKMQM3SNZWW2M3WZ7UTPI25VM/graph.json","fetch_events":"https://pith.science/api/pith-number/SSKMQM3SNZWW2M3WZ7UTPI25VM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM/action/storage_attestation","attest_author":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM/action/author_attestation","sign_citation":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM/action/citation_signature","submit_replication":"https://pith.science/pith/SSKMQM3SNZWW2M3WZ7UTPI25VM/action/replication_record"}},"created_at":"2026-07-05T10:17:55.275376+00:00","updated_at":"2026-07-05T10:17:55.275376+00:00"}