{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:JEQQUW72AUDZXYECUSX5GP42HM","short_pith_number":"pith:JEQQUW72","schema_version":"1.0","canonical_sha256":"49210a5bfa05079be082a4afd33f9a3b12a209caf6675bf90c870189cd97d95e","source":{"kind":"arxiv","id":"2502.21257","version":2},"attestation_state":"computed","paper":{"title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.RO","authors_text":"Hengyuan Zhang, Huaihai Lyu, Huajie Tan, Jiaming Liu, Jiayu Shi, Mengdi Zhao, Pengju An, Pengwei Wang, Qinghang Su, Shanghang Zhang, Xiaolong Zheng, Xiaoshuai Hao, Xinda Xue, Yao Mu, Yuan Zhang, Yuheng Ji, Zhongyuan Wang","submitted_at":"2025-02-28T17:30:39Z","abstract_excerpt":"Recent advancements in Multimodal Large Language Models (MLLMs) have shown remarkable capabilities across various multimodal contexts. However, their application in robotic scenarios, particularly for long-horizon manipulation tasks, reveals significant limitations. These limitations arise from the current MLLMs lacking three essential robotic brain capabilities: Planning Capability, which involves decomposing complex manipulation instructions into manageable sub-tasks; Affordance Perception, the ability to recognize and interpret the affordances of interactive objects; and Trajectory Predicti"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.21257","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-02-28T17:30:39Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"83b889a18495651be3151c772c681253d4b044094912871b2de090c0773b834f","abstract_canon_sha256":"0d7a6ab69c54d9ff1d3eaffafde9430ff0d9d538c028c1fa4e5a1078d9dcd3ef"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:38:43.319073Z","signature_b64":"a+y8sIDvWiBJO/utfn5Z+ctRxS6g8rH3cWpKWxLwemnh522NzchNhg8QAWE59O2rumGjMMAwgxhvx7gwwGx+Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"49210a5bfa05079be082a4afd33f9a3b12a209caf6675bf90c870189cd97d95e","last_reissued_at":"2026-07-05T10:38:43.318593Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:38:43.318593Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.RO","authors_text":"Hengyuan Zhang, Huaihai Lyu, Huajie Tan, Jiaming Liu, Jiayu Shi, Mengdi Zhao, Pengju An, Pengwei Wang, Qinghang Su, Shanghang Zhang, Xiaolong Zheng, Xiaoshuai Hao, Xinda Xue, Yao Mu, Yuan Zhang, Yuheng Ji, Zhongyuan Wang","submitted_at":"2025-02-28T17:30:39Z","abstract_excerpt":"Recent advancements in Multimodal Large Language Models (MLLMs) have shown remarkable capabilities across various multimodal contexts. However, their application in robotic scenarios, particularly for long-horizon manipulation tasks, reveals significant limitations. These limitations arise from the current MLLMs lacking three essential robotic brain capabilities: Planning Capability, which involves decomposing complex manipulation instructions into manageable sub-tasks; Affordance Perception, the ability to recognize and interpret the affordances of interactive objects; and Trajectory Predicti"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.21257","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.21257/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.21257","created_at":"2026-07-05T10:38:43.318651+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.21257v2","created_at":"2026-07-05T10:38:43.318651+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.21257","created_at":"2026-07-05T10:38:43.318651+00:00"},{"alias_kind":"pith_short_12","alias_value":"JEQQUW72AUDZ","created_at":"2026-07-05T10:38:43.318651+00:00"},{"alias_kind":"pith_short_16","alias_value":"JEQQUW72AUDZXYEC","created_at":"2026-07-05T10:38:43.318651+00:00"},{"alias_kind":"pith_short_8","alias_value":"JEQQUW72","created_at":"2026-07-05T10:38:43.318651+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23557","citing_title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03577","citing_title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28548","citing_title":"GEM: Generative Supervision Helps Embodied Intelligence","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2502.13451","citing_title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2506.06856","citing_title":"Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2508.13998","citing_title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2507.01925","citing_title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","ref_index":154,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08747","citing_title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08747","citing_title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08747","citing_title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08774","citing_title":"ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17807","citing_title":"Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20570","citing_title":"Exploring Spatial Intelligence from a Generative Perspective","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM","json":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM.json","graph_json":"https://pith.science/api/pith-number/JEQQUW72AUDZXYECUSX5GP42HM/graph.json","events_json":"https://pith.science/api/pith-number/JEQQUW72AUDZXYECUSX5GP42HM/events.json","paper":"https://pith.science/paper/JEQQUW72"},"agent_actions":{"view_html":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM","download_json":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM.json","view_paper":"https://pith.science/paper/JEQQUW72","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.21257&json=true","fetch_graph":"https://pith.science/api/pith-number/JEQQUW72AUDZXYECUSX5GP42HM/graph.json","fetch_events":"https://pith.science/api/pith-number/JEQQUW72AUDZXYECUSX5GP42HM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM/action/storage_attestation","attest_author":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM/action/author_attestation","sign_citation":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM/action/citation_signature","submit_replication":"https://pith.science/pith/JEQQUW72AUDZXYECUSX5GP42HM/action/replication_record"}},"created_at":"2026-07-05T10:38:43.318651+00:00","updated_at":"2026-07-05T10:38:43.318651+00:00"}