{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2KXQNLIRFUFDYOJVDRM66LPTMK","short_pith_number":"pith:2KXQNLIR","schema_version":"1.0","canonical_sha256":"d2af06ad112d0a3c39351c59ef2df36287db4d5c2307f7e06afe539373bb6ff2","source":{"kind":"arxiv","id":"2404.04929","version":2},"attestation_state":"computed","paper":{"title":"RoboMP$^2$: A Robotic Multimodal Perception-Planning Framework with Multimodal Large Language Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Hao Li, Liqiang Nie, Michael Yu Wang, Qi Lv, Rui Shao, Xiang Deng","submitted_at":"2024-04-07T12:05:47Z","abstract_excerpt":"Multimodal Large Language Models (MLLMs) have shown impressive reasoning abilities and general intelligence in various domains. It inspires researchers to train end-to-end MLLMs or utilize large models to generate policies with human-selected prompts for embodied agents. However, these methods exhibit limited generalization capabilities on unseen tasks or scenarios, and overlook the multimodal environment information which is critical for robots to make decisions. In this paper, we introduce a novel Robotic Multimodal Perception-Planning (RoboMP$^2$) framework for robotic manipulation which co"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.04929","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.RO","submitted_at":"2024-04-07T12:05:47Z","cross_cats_sorted":[],"title_canon_sha256":"c2f2eb8df379102e44c2c15eaea59713d1e7d7c0ff6d37ae5fe2c2f57df12432","abstract_canon_sha256":"e4f1bf8092933637d46bfe3f8f00e3b8c3e32e1af4dfc41dab35b19c7517c780"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:50:11.018370Z","signature_b64":"k2q9/gCHgqwsdUCHRRR3wgaGcc5CCepVyQ5Koh26PJ7PsQd0w7jSaTLQk+nmeMi1w+sxAB40M8OxTu8+abfkDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d2af06ad112d0a3c39351c59ef2df36287db4d5c2307f7e06afe539373bb6ff2","last_reissued_at":"2026-07-05T08:50:11.017860Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:50:11.017860Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RoboMP$^2$: A Robotic Multimodal Perception-Planning Framework with Multimodal Large Language Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Hao Li, Liqiang Nie, Michael Yu Wang, Qi Lv, Rui Shao, Xiang Deng","submitted_at":"2024-04-07T12:05:47Z","abstract_excerpt":"Multimodal Large Language Models (MLLMs) have shown impressive reasoning abilities and general intelligence in various domains. It inspires researchers to train end-to-end MLLMs or utilize large models to generate policies with human-selected prompts for embodied agents. However, these methods exhibit limited generalization capabilities on unseen tasks or scenarios, and overlook the multimodal environment information which is critical for robots to make decisions. In this paper, we introduce a novel Robotic Multimodal Perception-Planning (RoboMP$^2$) framework for robotic manipulation which co"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.04929","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.04929/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.04929","created_at":"2026-07-05T08:50:11.017916+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.04929v2","created_at":"2026-07-05T08:50:11.017916+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.04929","created_at":"2026-07-05T08:50:11.017916+00:00"},{"alias_kind":"pith_short_12","alias_value":"2KXQNLIRFUFD","created_at":"2026-07-05T08:50:11.017916+00:00"},{"alias_kind":"pith_short_16","alias_value":"2KXQNLIRFUFDYOJV","created_at":"2026-07-05T08:50:11.017916+00:00"},{"alias_kind":"pith_short_8","alias_value":"2KXQNLIR","created_at":"2026-07-05T08:50:11.017916+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.23382","citing_title":"MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models","ref_index":21,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK","json":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK.json","graph_json":"https://pith.science/api/pith-number/2KXQNLIRFUFDYOJVDRM66LPTMK/graph.json","events_json":"https://pith.science/api/pith-number/2KXQNLIRFUFDYOJVDRM66LPTMK/events.json","paper":"https://pith.science/paper/2KXQNLIR"},"agent_actions":{"view_html":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK","download_json":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK.json","view_paper":"https://pith.science/paper/2KXQNLIR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.04929&json=true","fetch_graph":"https://pith.science/api/pith-number/2KXQNLIRFUFDYOJVDRM66LPTMK/graph.json","fetch_events":"https://pith.science/api/pith-number/2KXQNLIRFUFDYOJVDRM66LPTMK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK/action/storage_attestation","attest_author":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK/action/author_attestation","sign_citation":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK/action/citation_signature","submit_replication":"https://pith.science/pith/2KXQNLIRFUFDYOJVDRM66LPTMK/action/replication_record"}},"created_at":"2026-07-05T08:50:11.017916+00:00","updated_at":"2026-07-05T08:50:11.017916+00:00"}