{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:WGBIYQP3M2EK4LVW4CC4RJXZ77","short_pith_number":"pith:WGBIYQP3","schema_version":"1.0","canonical_sha256":"b1828c41fb6688ae2eb6e085c8a6f9fff24c744e869e51cbedc8b937e87021f0","source":{"kind":"arxiv","id":"2505.08243","version":2},"attestation_state":"computed","paper":{"title":"Training Strategies for Efficient Embodied Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Danny Driess, Karl Pertsch, Oier Mees, Sergey Levine, Suneel Belkhale, Suvir Mirchandani, William Chen","submitted_at":"2025-05-13T05:35:00Z","abstract_excerpt":"Robot chain-of-thought reasoning (CoT) -- wherein a model predicts helpful intermediate representations before choosing actions -- provides an effective method for improving the generalization and performance of robot policies, especially vision-language-action models (VLAs). While such approaches have been shown to improve performance and generalization, they suffer from core limitations, like needing specialized robot reasoning data and slow inference speeds. To design new robot reasoning approaches that address these issues, a more complete characterization of why reasoning helps policy per"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.08243","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-05-13T05:35:00Z","cross_cats_sorted":[],"title_canon_sha256":"4e01836f849818d38656b03e179b1c46cb85f1824089166aedb9f44b0d740d61","abstract_canon_sha256":"b9b0221a29b23f1e5838e04fe8b4899a80835de164b27429db539dc2126100ff"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:04:51.183654Z","signature_b64":"Fae7LXSkjJsVxXAVUVUC3pcsrQ51smLxH1sklfKiZmJ+51xTKw0vCPJJanIh+G0Ddr0av1wCLo0S0/hdJguOBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b1828c41fb6688ae2eb6e085c8a6f9fff24c744e869e51cbedc8b937e87021f0","last_reissued_at":"2026-07-05T11:04:51.183105Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:04:51.183105Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Training Strategies for Efficient Embodied Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Danny Driess, Karl Pertsch, Oier Mees, Sergey Levine, Suneel Belkhale, Suvir Mirchandani, William Chen","submitted_at":"2025-05-13T05:35:00Z","abstract_excerpt":"Robot chain-of-thought reasoning (CoT) -- wherein a model predicts helpful intermediate representations before choosing actions -- provides an effective method for improving the generalization and performance of robot policies, especially vision-language-action models (VLAs). While such approaches have been shown to improve performance and generalization, they suffer from core limitations, like needing specialized robot reasoning data and slow inference speeds. To design new robot reasoning approaches that address these issues, a more complete characterization of why reasoning helps policy per"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.08243","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.08243/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.08243","created_at":"2026-07-05T11:04:51.183166+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.08243v2","created_at":"2026-07-05T11:04:51.183166+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.08243","created_at":"2026-07-05T11:04:51.183166+00:00"},{"alias_kind":"pith_short_12","alias_value":"WGBIYQP3M2EK","created_at":"2026-07-05T11:04:51.183166+00:00"},{"alias_kind":"pith_short_16","alias_value":"WGBIYQP3M2EK4LVW","created_at":"2026-07-05T11:04:51.183166+00:00"},{"alias_kind":"pith_short_8","alias_value":"WGBIYQP3","created_at":"2026-07-05T11:04:51.183166+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08024","citing_title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","ref_index":47,"is_internal_anchor":true},{"citing_arxiv_id":"2606.12402","citing_title":"DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30552","citing_title":"Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03784","citing_title":"Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30552","citing_title":"Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2602.19710","citing_title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2511.15669","citing_title":"DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2508.13073","citing_title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","ref_index":95,"is_internal_anchor":false},{"citing_arxiv_id":"2509.09674","citing_title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2603.22003","citing_title":"VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09146","citing_title":"Beyond Thinking: Imagining in 360$^\\circ$ for Humanoid Visual Search","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19839","citing_title":"Environmental Understanding Vision-Language Model for Embodied Agent","ref_index":7,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77","json":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77.json","graph_json":"https://pith.science/api/pith-number/WGBIYQP3M2EK4LVW4CC4RJXZ77/graph.json","events_json":"https://pith.science/api/pith-number/WGBIYQP3M2EK4LVW4CC4RJXZ77/events.json","paper":"https://pith.science/paper/WGBIYQP3"},"agent_actions":{"view_html":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77","download_json":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77.json","view_paper":"https://pith.science/paper/WGBIYQP3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.08243&json=true","fetch_graph":"https://pith.science/api/pith-number/WGBIYQP3M2EK4LVW4CC4RJXZ77/graph.json","fetch_events":"https://pith.science/api/pith-number/WGBIYQP3M2EK4LVW4CC4RJXZ77/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77/action/storage_attestation","attest_author":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77/action/author_attestation","sign_citation":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77/action/citation_signature","submit_replication":"https://pith.science/pith/WGBIYQP3M2EK4LVW4CC4RJXZ77/action/replication_record"}},"created_at":"2026-07-05T11:04:51.183166+00:00","updated_at":"2026-07-05T11:04:51.183166+00:00"}