{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:DNBDDENJCQQF2BLLL7N4RUWI2X","short_pith_number":"pith:DNBDDENJ","schema_version":"1.0","canonical_sha256":"1b423191a914205d056b5fdbc8d2c8d5df6b90d935fccce2c316f1d5790a215d","source":{"kind":"arxiv","id":"2506.23127","version":1},"attestation_state":"computed","paper":{"title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Jingjing Gong, Junhao Shi, Li Ji, Siyin Wang, Xipeng Qiu, Zhaoye Fei","submitted_at":"2025-06-29T07:31:24Z","abstract_excerpt":"Large Language Models (LLMs) have demonstrated remarkable capabilities across various tasks, yet they face significant challenges in embodied task planning scenarios that require continuous environmental understanding and action generation. Existing approaches generate open-loop action scripts based on static knowledge, making it difficult to learn causal relationships between actions and environmental feedback, particularly in partially observable environments. We introduce Embodied Planner-R1, a novel outcome-driven reinforcement learning framework that enables LLMs to develop interactive ca"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.23127","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-06-29T07:31:24Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"9aebad53e8b7004bb1ebc3ec09798d87bd9069b96eea66a17d4055450ab0dc5a","abstract_canon_sha256":"dda1ca5e01f284e39137ac6682c3194b52073ee8be957aca4bb70207dbb7df26"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:29:16.164371Z","signature_b64":"DKAKWqcCGzPoWWMssVXHcgolomroM/tdGako2xybApTeCk38fLcbJnutqduLF8spD1zzIi9mUeplQeC48vEZAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1b423191a914205d056b5fdbc8d2c8d5df6b90d935fccce2c316f1d5790a215d","last_reissued_at":"2026-07-05T11:29:16.163765Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:29:16.163765Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Jingjing Gong, Junhao Shi, Li Ji, Siyin Wang, Xipeng Qiu, Zhaoye Fei","submitted_at":"2025-06-29T07:31:24Z","abstract_excerpt":"Large Language Models (LLMs) have demonstrated remarkable capabilities across various tasks, yet they face significant challenges in embodied task planning scenarios that require continuous environmental understanding and action generation. Existing approaches generate open-loop action scripts based on static knowledge, making it difficult to learn causal relationships between actions and environmental feedback, particularly in partially observable environments. We introduce Embodied Planner-R1, a novel outcome-driven reinforcement learning framework that enables LLMs to develop interactive ca"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.23127","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.23127/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.23127","created_at":"2026-07-05T11:29:16.163831+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.23127v1","created_at":"2026-07-05T11:29:16.163831+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.23127","created_at":"2026-07-05T11:29:16.163831+00:00"},{"alias_kind":"pith_short_12","alias_value":"DNBDDENJCQQF","created_at":"2026-07-05T11:29:16.163831+00:00"},{"alias_kind":"pith_short_16","alias_value":"DNBDDENJCQQF2BLL","created_at":"2026-07-05T11:29:16.163831+00:00"},{"alias_kind":"pith_short_8","alias_value":"DNBDDENJ","created_at":"2026-07-05T11:29:16.163831+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.16331","citing_title":"BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07774","citing_title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","ref_index":23,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X","json":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X.json","graph_json":"https://pith.science/api/pith-number/DNBDDENJCQQF2BLLL7N4RUWI2X/graph.json","events_json":"https://pith.science/api/pith-number/DNBDDENJCQQF2BLLL7N4RUWI2X/events.json","paper":"https://pith.science/paper/DNBDDENJ"},"agent_actions":{"view_html":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X","download_json":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X.json","view_paper":"https://pith.science/paper/DNBDDENJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.23127&json=true","fetch_graph":"https://pith.science/api/pith-number/DNBDDENJCQQF2BLLL7N4RUWI2X/graph.json","fetch_events":"https://pith.science/api/pith-number/DNBDDENJCQQF2BLLL7N4RUWI2X/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X/action/storage_attestation","attest_author":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X/action/author_attestation","sign_citation":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X/action/citation_signature","submit_replication":"https://pith.science/pith/DNBDDENJCQQF2BLLL7N4RUWI2X/action/replication_record"}},"created_at":"2026-07-05T11:29:16.163831+00:00","updated_at":"2026-07-05T11:29:16.163831+00:00"}