{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:B426X3KHMFKYKADDPMCNSEVGU7","short_pith_number":"pith:B426X3KH","schema_version":"1.0","canonical_sha256":"0f35ebed4761558500637b04d912a6a7c358a03b68de4fada43859e47c38075e","source":{"kind":"arxiv","id":"2505.21432","version":4},"attestation_state":"computed","paper":{"title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Bin Zhao, Delin Qu, Dong Wang, Guanghui Ren, Haoming Song, Maoqing Yao, Modi Shi, Qi Lv, Qizhi Chen, Xuelong Li, Yiwen Tang, Yuanqi Yao","submitted_at":"2025-05-27T17:04:21Z","abstract_excerpt":"Humans practice slow thinking before performing actual actions when handling complex tasks in the physical world. This thinking paradigm, recently, has achieved remarkable advancement in boosting Large Language Models (LLMs) to solve complex tasks in digital domains. However, the potential of slow thinking remains largely unexplored for robotic foundation models interacting with the physical world. In this work, we propose Hume: a dual-system Vision-Language-Action (VLA) model with value-guided System-2 thinking and cascaded action denoising, exploring human-like thinking capabilities of Visio"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.21432","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-05-27T17:04:21Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"65baa47693c93f3c9ce8847984e851d3029fb70fe64ae3f6480a2b07919e60d6","abstract_canon_sha256":"a515b4bdc74f9ed3de899e392e5134c9028295b59250d9bef7e512c6046e20bf"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:33:24.147228Z","signature_b64":"YFH1IxLn4haT6h1HNNE7xtHa/3fjWkAhe4IFGAerA+S1lK+Vc0Hzb6WIDBdDAIg0jpkcLDYgDUhfJNdUPAM5Ag==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0f35ebed4761558500637b04d912a6a7c358a03b68de4fada43859e47c38075e","last_reissued_at":"2026-07-05T11:33:24.146680Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:33:24.146680Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Bin Zhao, Delin Qu, Dong Wang, Guanghui Ren, Haoming Song, Maoqing Yao, Modi Shi, Qi Lv, Qizhi Chen, Xuelong Li, Yiwen Tang, Yuanqi Yao","submitted_at":"2025-05-27T17:04:21Z","abstract_excerpt":"Humans practice slow thinking before performing actual actions when handling complex tasks in the physical world. This thinking paradigm, recently, has achieved remarkable advancement in boosting Large Language Models (LLMs) to solve complex tasks in digital domains. However, the potential of slow thinking remains largely unexplored for robotic foundation models interacting with the physical world. In this work, we propose Hume: a dual-system Vision-Language-Action (VLA) model with value-guided System-2 thinking and cascaded action denoising, exploring human-like thinking capabilities of Visio"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.21432","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.21432/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.21432","created_at":"2026-07-05T11:33:24.146742+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.21432v4","created_at":"2026-07-05T11:33:24.146742+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.21432","created_at":"2026-07-05T11:33:24.146742+00:00"},{"alias_kind":"pith_short_12","alias_value":"B426X3KHMFKY","created_at":"2026-07-05T11:33:24.146742+00:00"},{"alias_kind":"pith_short_16","alias_value":"B426X3KHMFKYKADD","created_at":"2026-07-05T11:33:24.146742+00:00"},{"alias_kind":"pith_short_8","alias_value":"B426X3KH","created_at":"2026-07-05T11:33:24.146742+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27268","citing_title":"E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22794","citing_title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17924","citing_title":"PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08015","citing_title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01088","citing_title":"ROSA: A Robotics Foundation Model Serving System for Robot Factories","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01191","citing_title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30686","citing_title":"Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01581","citing_title":"Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28374","citing_title":"Recursive Self-Evolving Agents via Held-Out Selection","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26006","citing_title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2602.07399","citing_title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2507.04447","citing_title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","ref_index":89,"is_internal_anchor":false},{"citing_arxiv_id":"2509.06951","citing_title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2505.17685","citing_title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2603.10126","citing_title":"AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2603.13842","citing_title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2510.13778","citing_title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03306","citing_title":"Deep Image Clustering Based on Curriculum Learning and Density Information","ref_index":74,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02241","citing_title":"UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04161","citing_title":"Adaptive Action Chunking at Inference-time for Vision-Language-Action Models","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12167","citing_title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01581","citing_title":"Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01194","citing_title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01191","citing_title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","ref_index":13,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7","json":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7.json","graph_json":"https://pith.science/api/pith-number/B426X3KHMFKYKADDPMCNSEVGU7/graph.json","events_json":"https://pith.science/api/pith-number/B426X3KHMFKYKADDPMCNSEVGU7/events.json","paper":"https://pith.science/paper/B426X3KH"},"agent_actions":{"view_html":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7","download_json":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7.json","view_paper":"https://pith.science/paper/B426X3KH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.21432&json=true","fetch_graph":"https://pith.science/api/pith-number/B426X3KHMFKYKADDPMCNSEVGU7/graph.json","fetch_events":"https://pith.science/api/pith-number/B426X3KHMFKYKADDPMCNSEVGU7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7/action/storage_attestation","attest_author":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7/action/author_attestation","sign_citation":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7/action/citation_signature","submit_replication":"https://pith.science/pith/B426X3KHMFKYKADDPMCNSEVGU7/action/replication_record"}},"created_at":"2026-07-05T11:33:24.146742+00:00","updated_at":"2026-07-05T11:33:24.146742+00:00"}