{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:IVXPFY5OZFHMI2GBA3AF4ET64B","short_pith_number":"pith:IVXPFY5O","schema_version":"1.0","canonical_sha256":"456ef2e3aec94ec468c106c05e127ee067661487c71767d16a69ecb604a4c180","source":{"kind":"arxiv","id":"2607.14187","version":1},"attestation_state":"computed","paper":{"title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.AI","authors_text":"Bohan Ma, Han Hu, Haotian Liang, Kaixuan Wang, Ling Chen, Lingzhu Xiang, Minghui Wang, Mingkang Chen, Ping Luo, Shirong Zeng, Tianshuo Yang, Wanjia He, Weijie Zhou, Xiangli Shi, Xiaomeng Zhu, Xingyu Zhou, Xin Yang, Xiran Huang, Xuantang Xiong, Yajuan Zhu, Yao Mu, Yuchen Si, Yuchun Guo, Yueyu Long, Yufei Huang, Yunxuan Mao, Zhengyou Zhang, Zhiheng Liu, Zhiqing Liu, Zisheng Lu","submitted_at":"2026-07-15T15:45:25Z","abstract_excerpt":"Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task de"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.14187","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2026-07-15T15:45:25Z","cross_cats_sorted":["cs.RO"],"title_canon_sha256":"40fe5fe4d2f18bb520bed69e40d7c3f68e908edcdc4fe92a5b18a50697563de7","abstract_canon_sha256":"2602a22e6d64583b95aaad3690093f15232cb3376947f130617f32e470e25373"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-17T00:20:56.636581Z","signature_b64":"0lDixn2F3/ei/MrhxWlcMItLHhRWbXNulwIrKfNun0Z6Su0eLt8azFna+91MfuO+Ik7Y0K8ETnKlfCZjsh1VDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"456ef2e3aec94ec468c106c05e127ee067661487c71767d16a69ecb604a4c180","last_reissued_at":"2026-07-17T00:20:56.635750Z","signature_status":"signed_v1","first_computed_at":"2026-07-17T00:20:56.635750Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.AI","authors_text":"Bohan Ma, Han Hu, Haotian Liang, Kaixuan Wang, Ling Chen, Lingzhu Xiang, Minghui Wang, Mingkang Chen, Ping Luo, Shirong Zeng, Tianshuo Yang, Wanjia He, Weijie Zhou, Xiangli Shi, Xiaomeng Zhu, Xingyu Zhou, Xin Yang, Xiran Huang, Xuantang Xiong, Yajuan Zhu, Yao Mu, Yuchen Si, Yuchun Guo, Yueyu Long, Yufei Huang, Yunxuan Mao, Zhengyou Zhang, Zhiheng Liu, Zhiqing Liu, Zisheng Lu","submitted_at":"2026-07-15T15:45:25Z","abstract_excerpt":"Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task de"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.14187","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.14187/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.14187","created_at":"2026-07-17T00:20:56.636173+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.14187v1","created_at":"2026-07-17T00:20:56.636173+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.14187","created_at":"2026-07-17T00:20:56.636173+00:00"},{"alias_kind":"pith_short_12","alias_value":"IVXPFY5OZFHM","created_at":"2026-07-17T00:20:56.636173+00:00"},{"alias_kind":"pith_short_16","alias_value":"IVXPFY5OZFHMI2GB","created_at":"2026-07-17T00:20:56.636173+00:00"},{"alias_kind":"pith_short_8","alias_value":"IVXPFY5O","created_at":"2026-07-17T00:20:56.636173+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B","json":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B.json","graph_json":"https://pith.science/api/pith-number/IVXPFY5OZFHMI2GBA3AF4ET64B/graph.json","events_json":"https://pith.science/api/pith-number/IVXPFY5OZFHMI2GBA3AF4ET64B/events.json","paper":"https://pith.science/paper/IVXPFY5O"},"agent_actions":{"view_html":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B","download_json":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B.json","view_paper":"https://pith.science/paper/IVXPFY5O","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.14187&json=true","fetch_graph":"https://pith.science/api/pith-number/IVXPFY5OZFHMI2GBA3AF4ET64B/graph.json","fetch_events":"https://pith.science/api/pith-number/IVXPFY5OZFHMI2GBA3AF4ET64B/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B/action/timestamp_anchor","attest_storage":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B/action/storage_attestation","attest_author":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B/action/author_attestation","sign_citation":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B/action/citation_signature","submit_replication":"https://pith.science/pith/IVXPFY5OZFHMI2GBA3AF4ET64B/action/replication_record"}},"created_at":"2026-07-17T00:20:56.636173+00:00","updated_at":"2026-07-17T00:20:56.636173+00:00"}