{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:Z7JAYGZVQ7GZ2VC34MLHZ3VRPH","short_pith_number":"pith:Z7JAYGZV","schema_version":"1.0","canonical_sha256":"cfd20c1b3587cd9d545be3167ceeb179d591c7c1a772f2872ffbf823b1725b31","source":{"kind":"arxiv","id":"2510.00037","version":5},"attestation_state":"computed","paper":{"title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.CV","authors_text":"Chang Tu, Huijie Zhao, Jiaming Ji, Jianing Guo, Kai Chen, Qi Dou, Shuning Zhang, Simin Li, Weifeng Lv, Xianglong Liu, Xiangqi Kong, Yaodong Yang, Yiyao Ma, Yuanpei Chen, Zhenhong Wu, Zhiqian Liu","submitted_at":"2025-09-26T14:42:23Z","abstract_excerpt":"In Vision-Language-Actionf(VLA) models, robustness to real-world perturbations is critical for deployment. Existing methods target simple visual disturbances, overlooking the broader multi-modal perturbations that arise in actions, instructions, environments, and observations. Here, we first evaluate the robustness of mainstream VLAs under 17 perturbations across four modalities. We find (1) actions as the most fragile modality, (2) Existing visual-robust VLA do not gain robustness in other modality, and (3) pi0 demonstrates superior robustness. To build multi-modal robust VLAs, we propose Rob"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2510.00037","kind":"arxiv","version":5},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-09-26T14:42:23Z","cross_cats_sorted":["cs.AI","cs.RO"],"title_canon_sha256":"3f21e2a8689675bf785eae9dfb5b3283247ed0f9bf65923afa7209d84a77cbf0","abstract_canon_sha256":"fcdc108760e0198672a5de28f88c411ba880fc7162ca0a0d34a92dc123062be4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-21T01:20:37.730003Z","signature_b64":"x7oDzyApc6cIN2hp6Uv5MAYfOP7rhA95D1IJSqr3nFOkres/1ms/k7Q8tTpwtofK3zaFzOWZ/AJrupC9uVEhDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"cfd20c1b3587cd9d545be3167ceeb179d591c7c1a772f2872ffbf823b1725b31","last_reissued_at":"2026-07-21T01:20:37.729026Z","signature_status":"signed_v1","first_computed_at":"2026-07-21T01:20:37.729026Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.CV","authors_text":"Chang Tu, Huijie Zhao, Jiaming Ji, Jianing Guo, Kai Chen, Qi Dou, Shuning Zhang, Simin Li, Weifeng Lv, Xianglong Liu, Xiangqi Kong, Yaodong Yang, Yiyao Ma, Yuanpei Chen, Zhenhong Wu, Zhiqian Liu","submitted_at":"2025-09-26T14:42:23Z","abstract_excerpt":"In Vision-Language-Actionf(VLA) models, robustness to real-world perturbations is critical for deployment. Existing methods target simple visual disturbances, overlooking the broader multi-modal perturbations that arise in actions, instructions, environments, and observations. Here, we first evaluate the robustness of mainstream VLAs under 17 perturbations across four modalities. We find (1) actions as the most fragile modality, (2) Existing visual-robust VLA do not gain robustness in other modality, and (3) pi0 demonstrates superior robustness. To build multi-modal robust VLAs, we propose Rob"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2510.00037","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2510.00037/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2510.00037","created_at":"2026-07-21T01:20:37.729494+00:00"},{"alias_kind":"arxiv_version","alias_value":"2510.00037v5","created_at":"2026-07-21T01:20:37.729494+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2510.00037","created_at":"2026-07-21T01:20:37.729494+00:00"},{"alias_kind":"pith_short_12","alias_value":"Z7JAYGZVQ7GZ","created_at":"2026-07-21T01:20:37.729494+00:00"},{"alias_kind":"pith_short_16","alias_value":"Z7JAYGZVQ7GZ2VC3","created_at":"2026-07-21T01:20:37.729494+00:00"},{"alias_kind":"pith_short_8","alias_value":"Z7JAYGZV","created_at":"2026-07-21T01:20:37.729494+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":8,"sample":[{"citing_arxiv_id":"2606.23641","citing_title":"Flatness Preserves Instruction Following in Vision-Language-Action Models","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2606.12366","citing_title":"APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies","ref_index":50,"is_internal_anchor":true},{"citing_arxiv_id":"2605.26627","citing_title":"Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty","ref_index":11,"is_internal_anchor":true},{"citing_arxiv_id":"2606.30613","citing_title":"Sequential Planning via Anchored Robotic Keypoints","ref_index":50,"is_internal_anchor":true},{"citing_arxiv_id":"2605.26627","citing_title":"Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty","ref_index":11,"is_internal_anchor":true},{"citing_arxiv_id":"2605.28726","citing_title":"How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2605.06481","citing_title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","ref_index":23,"is_internal_anchor":true},{"citing_arxiv_id":"2604.10055","citing_title":"STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations","ref_index":5,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH","json":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH.json","graph_json":"https://pith.science/api/pith-number/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/graph.json","events_json":"https://pith.science/api/pith-number/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/events.json","paper":"https://pith.science/paper/Z7JAYGZV"},"agent_actions":{"view_html":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH","download_json":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH.json","view_paper":"https://pith.science/paper/Z7JAYGZV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2510.00037&json=true","fetch_graph":"https://pith.science/api/pith-number/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/graph.json","fetch_events":"https://pith.science/api/pith-number/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/action/storage_attestation","attest_author":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/action/author_attestation","sign_citation":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/action/citation_signature","submit_replication":"https://pith.science/pith/Z7JAYGZVQ7GZ2VC34MLHZ3VRPH/action/replication_record"}},"created_at":"2026-07-21T01:20:37.729494+00:00","updated_at":"2026-07-21T01:20:37.729494+00:00"}