{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:W4XUSKKN2YBGV3IKUXLMZKTSOS","short_pith_number":"pith:W4XUSKKN","schema_version":"1.0","canonical_sha256":"b72f49294dd6026aed0aa5d6ccaa7274ab5a79ba182ec2136ca9c9e5740be861","source":{"kind":"arxiv","id":"2502.14420","version":2},"attestation_state":"computed","paper":{"title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Chaomin Shen, Feifei Feng, Junjie Wen, Minjie Zhu, Ning Liu, Ran Cheng, Weibin Meng, Yaxin Peng, Yichen Zhu, Zhiyuan Xu, Zhongyi Zhou","submitted_at":"2025-02-20T10:16:18Z","abstract_excerpt":"Humans possess a unified cognitive ability to perceive, comprehend, and interact with the physical world. Why can't large language models replicate this holistic understanding? Through a systematic analysis of existing training paradigms in vision-language-action models (VLA), we identify two key challenges: spurious forgetting, where robot training overwrites crucial visual-text alignments, and task interference, where competing control and understanding tasks degrade performance when trained jointly. To overcome these limitations, we propose ChatVLA, a novel framework featuring Phased Alignm"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.14420","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-02-20T10:16:18Z","cross_cats_sorted":["cs.CV","cs.LG"],"title_canon_sha256":"1198cbfe09c582ee3bed2d312a0c3b1c2c32a9aa8a6c66f4365994af5b5e9970","abstract_canon_sha256":"90dd3a865e4e1ea5648bdb68c58977f249a75d525ab80b646e333f395bcc6406"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:17:54.959329Z","signature_b64":"ljq2l8ct+1XqxDgOK2DKSncR1dv9S8DMmyMVUzD1CabMR554S6QPHWrWGob5/hfM4Y3ViSoMrQxwAmFeLaA6AA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b72f49294dd6026aed0aa5d6ccaa7274ab5a79ba182ec2136ca9c9e5740be861","last_reissued_at":"2026-07-05T10:17:54.958886Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:17:54.958886Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Chaomin Shen, Feifei Feng, Junjie Wen, Minjie Zhu, Ning Liu, Ran Cheng, Weibin Meng, Yaxin Peng, Yichen Zhu, Zhiyuan Xu, Zhongyi Zhou","submitted_at":"2025-02-20T10:16:18Z","abstract_excerpt":"Humans possess a unified cognitive ability to perceive, comprehend, and interact with the physical world. Why can't large language models replicate this holistic understanding? Through a systematic analysis of existing training paradigms in vision-language-action models (VLA), we identify two key challenges: spurious forgetting, where robot training overwrites crucial visual-text alignments, and task interference, where competing control and understanding tasks degrade performance when trained jointly. To overcome these limitations, we propose ChatVLA, a novel framework featuring Phased Alignm"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.14420","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.14420/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.14420","created_at":"2026-07-05T10:17:54.958934+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.14420v2","created_at":"2026-07-05T10:17:54.958934+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.14420","created_at":"2026-07-05T10:17:54.958934+00:00"},{"alias_kind":"pith_short_12","alias_value":"W4XUSKKN2YBG","created_at":"2026-07-05T10:17:54.958934+00:00"},{"alias_kind":"pith_short_16","alias_value":"W4XUSKKN2YBGV3IK","created_at":"2026-07-05T10:17:54.958934+00:00"},{"alias_kind":"pith_short_8","alias_value":"W4XUSKKN","created_at":"2026-07-05T10:17:54.958934+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.03392","citing_title":"OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00110","citing_title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","ref_index":138,"is_internal_anchor":false},{"citing_arxiv_id":"2503.03480","citing_title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20082","citing_title":"VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2508.13073","citing_title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","ref_index":130,"is_internal_anchor":false},{"citing_arxiv_id":"2507.04447","citing_title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","ref_index":98,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20231","citing_title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11665","citing_title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21998","citing_title":"Causal World Modeling for Robot Control","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10821","citing_title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15483","citing_title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17800","citing_title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","ref_index":49,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS","json":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS.json","graph_json":"https://pith.science/api/pith-number/W4XUSKKN2YBGV3IKUXLMZKTSOS/graph.json","events_json":"https://pith.science/api/pith-number/W4XUSKKN2YBGV3IKUXLMZKTSOS/events.json","paper":"https://pith.science/paper/W4XUSKKN"},"agent_actions":{"view_html":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS","download_json":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS.json","view_paper":"https://pith.science/paper/W4XUSKKN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.14420&json=true","fetch_graph":"https://pith.science/api/pith-number/W4XUSKKN2YBGV3IKUXLMZKTSOS/graph.json","fetch_events":"https://pith.science/api/pith-number/W4XUSKKN2YBGV3IKUXLMZKTSOS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS/action/storage_attestation","attest_author":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS/action/author_attestation","sign_citation":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS/action/citation_signature","submit_replication":"https://pith.science/pith/W4XUSKKN2YBGV3IKUXLMZKTSOS/action/replication_record"}},"created_at":"2026-07-05T10:17:54.958934+00:00","updated_at":"2026-07-05T10:17:54.958934+00:00"}