{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SPMSLMFBX4OGVUWLVME5AKYA4E","short_pith_number":"pith:SPMSLMFB","schema_version":"1.0","canonical_sha256":"93d925b0a1bf1c6ad2cbab09d02b00e125d2861634decd0791093dbc7baa94f1","source":{"kind":"arxiv","id":"2506.10100","version":1},"attestation_state":"computed","paper":{"title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chang Zou, Chuan Wen, Linfeng Zhang, Luo Zhongwei, Yantai Yang, Yuhao Wang, Zhipeng Zhang, Zichen Wen","submitted_at":"2025-06-11T18:34:57Z","abstract_excerpt":"Vision-Language-Action (VLA) models, particularly diffusion-based architectures, demonstrate transformative potential for embodied intelligence but are severely hampered by high computational and memory demands stemming from extensive inherent and inference-time redundancies. While existing acceleration efforts often target isolated inefficiencies, such piecemeal solutions typically fail to holistically address the varied computational and memory bottlenecks across the entire VLA pipeline, thereby limiting practical deployability. We introduce EfficientVLA, a structured and training-free infer"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.10100","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-06-11T18:34:57Z","cross_cats_sorted":[],"title_canon_sha256":"71644bac517febc129230da90f848b7db84b717fcdd4104b5935d7c6e35da5ee","abstract_canon_sha256":"a456176f5e382b40731fb4d2c1c1dd33148955e0c748a62c224c3885c2bb8e07"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:16.499887Z","signature_b64":"tl9+YzWl9CyMOAXscmR41MCmYRQL4+ujaH7hCKaCKIF9xvgAmfnBDbRcceMcd8snhOETJ1UUkWjLnBgqvMq9AA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"93d925b0a1bf1c6ad2cbab09d02b00e125d2861634decd0791093dbc7baa94f1","last_reissued_at":"2026-07-05T11:20:16.499378Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:16.499378Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chang Zou, Chuan Wen, Linfeng Zhang, Luo Zhongwei, Yantai Yang, Yuhao Wang, Zhipeng Zhang, Zichen Wen","submitted_at":"2025-06-11T18:34:57Z","abstract_excerpt":"Vision-Language-Action (VLA) models, particularly diffusion-based architectures, demonstrate transformative potential for embodied intelligence but are severely hampered by high computational and memory demands stemming from extensive inherent and inference-time redundancies. While existing acceleration efforts often target isolated inefficiencies, such piecemeal solutions typically fail to holistically address the varied computational and memory bottlenecks across the entire VLA pipeline, thereby limiting practical deployability. We introduce EfficientVLA, a structured and training-free infer"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.10100","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.10100/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.10100","created_at":"2026-07-05T11:20:16.499439+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.10100v1","created_at":"2026-07-05T11:20:16.499439+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.10100","created_at":"2026-07-05T11:20:16.499439+00:00"},{"alias_kind":"pith_short_12","alias_value":"SPMSLMFBX4OG","created_at":"2026-07-05T11:20:16.499439+00:00"},{"alias_kind":"pith_short_16","alias_value":"SPMSLMFBX4OGVUWL","created_at":"2026-07-05T11:20:16.499439+00:00"},{"alias_kind":"pith_short_8","alias_value":"SPMSLMFB","created_at":"2026-07-05T11:20:16.499439+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22540","citing_title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19565","citing_title":"Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06491","citing_title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02775","citing_title":"AURA: Action-Gated Memory for Robot Policies at Constant VRAM","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31382","citing_title":"Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30378","citing_title":"OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29662","citing_title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29438","citing_title":"ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2601.12894","citing_title":"Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2603.14371","citing_title":"OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2511.15279","citing_title":"Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2508.13073","citing_title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","ref_index":190,"is_internal_anchor":false},{"citing_arxiv_id":"2511.18082","citing_title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20309","citing_title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2603.01581","citing_title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2603.17573","citing_title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2603.25661","citing_title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13316","citing_title":"Test-time Sparsity for Extreme Fast Action Diffusion","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13778","citing_title":"Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02965","citing_title":"Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24447","citing_title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05672","citing_title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05656","citing_title":"SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation","ref_index":16,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E","json":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E.json","graph_json":"https://pith.science/api/pith-number/SPMSLMFBX4OGVUWLVME5AKYA4E/graph.json","events_json":"https://pith.science/api/pith-number/SPMSLMFBX4OGVUWLVME5AKYA4E/events.json","paper":"https://pith.science/paper/SPMSLMFB"},"agent_actions":{"view_html":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E","download_json":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E.json","view_paper":"https://pith.science/paper/SPMSLMFB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.10100&json=true","fetch_graph":"https://pith.science/api/pith-number/SPMSLMFBX4OGVUWLVME5AKYA4E/graph.json","fetch_events":"https://pith.science/api/pith-number/SPMSLMFBX4OGVUWLVME5AKYA4E/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E/action/storage_attestation","attest_author":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E/action/author_attestation","sign_citation":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E/action/citation_signature","submit_replication":"https://pith.science/pith/SPMSLMFBX4OGVUWLVME5AKYA4E/action/replication_record"}},"created_at":"2026-07-05T11:20:16.499439+00:00","updated_at":"2026-07-05T11:20:16.499439+00:00"}