{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:Y2T5AK6KWLZWYU5VBUVTXNZ5FP","short_pith_number":"pith:Y2T5AK6K","schema_version":"1.0","canonical_sha256":"c6a7d02bcab2f36c53b50d2b3bb73d2bcdf41f42a5f30f7a191f46cda8d068b1","source":{"kind":"arxiv","id":"2407.00898","version":5},"attestation_state":"computed","paper":{"title":"Residual-MPPI: Online Policy Customization for Continuous Control","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Catherine Weaver, Chenran Li, Chen Tang, Kenta Kawamoto, Masayoshi Tomizuka, Pengcheng Wang, Wei Zhan","submitted_at":"2024-07-01T01:53:07Z","abstract_excerpt":"Policies developed through Reinforcement Learning (RL) and Imitation Learning (IL) have shown great potential in continuous control tasks, but real-world applications often require adapting trained policies to unforeseen requirements. While fine-tuning can address such needs, it typically requires additional data and access to the original training metrics and parameters. In contrast, an online planning algorithm, if capable of meeting the additional requirements, can eliminate the necessity for extensive training phases and customize the policy without knowledge of the original training schem"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.00898","kind":"arxiv","version":5},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-07-01T01:53:07Z","cross_cats_sorted":[],"title_canon_sha256":"6c84a0d66519115076125d5ebec87b28b076f9d1bf826f103e1f062dda634939","abstract_canon_sha256":"f2d05da0432a17574441e3b6c4d7e24ce27eabad7596fa4e166d279ad11c0e1f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:30:54.636613Z","signature_b64":"8DcgIH7qUASdi2JRtd3WWY28ajYt6HiPJxZsCeHyS4QNXrtYOsFyQ2hPvWMPzEmxmfpjW+nHbYWX/63muacJCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c6a7d02bcab2f36c53b50d2b3bb73d2bcdf41f42a5f30f7a191f46cda8d068b1","last_reissued_at":"2026-07-05T10:30:54.635712Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:30:54.635712Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Residual-MPPI: Online Policy Customization for Continuous Control","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Catherine Weaver, Chenran Li, Chen Tang, Kenta Kawamoto, Masayoshi Tomizuka, Pengcheng Wang, Wei Zhan","submitted_at":"2024-07-01T01:53:07Z","abstract_excerpt":"Policies developed through Reinforcement Learning (RL) and Imitation Learning (IL) have shown great potential in continuous control tasks, but real-world applications often require adapting trained policies to unforeseen requirements. While fine-tuning can address such needs, it typically requires additional data and access to the original training metrics and parameters. In contrast, an online planning algorithm, if capable of meeting the additional requirements, can eliminate the necessity for extensive training phases and customize the policy without knowledge of the original training schem"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.00898","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.00898/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.00898","created_at":"2026-07-05T10:30:54.635837+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.00898v5","created_at":"2026-07-05T10:30:54.635837+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.00898","created_at":"2026-07-05T10:30:54.635837+00:00"},{"alias_kind":"pith_short_12","alias_value":"Y2T5AK6KWLZW","created_at":"2026-07-05T10:30:54.635837+00:00"},{"alias_kind":"pith_short_16","alias_value":"Y2T5AK6KWLZWYU5V","created_at":"2026-07-05T10:30:54.635837+00:00"},{"alias_kind":"pith_short_8","alias_value":"Y2T5AK6K","created_at":"2026-07-05T10:30:54.635837+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.08602","citing_title":"Reinforcement Learning for Flow-Matching Policies with Density Transport","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00317","citing_title":"Generalized Model Predictive Path Integral Control as Expectation--Maximization","ref_index":7,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP","json":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP.json","graph_json":"https://pith.science/api/pith-number/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/graph.json","events_json":"https://pith.science/api/pith-number/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/events.json","paper":"https://pith.science/paper/Y2T5AK6K"},"agent_actions":{"view_html":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP","download_json":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP.json","view_paper":"https://pith.science/paper/Y2T5AK6K","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.00898&json=true","fetch_graph":"https://pith.science/api/pith-number/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/graph.json","fetch_events":"https://pith.science/api/pith-number/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/action/storage_attestation","attest_author":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/action/author_attestation","sign_citation":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/action/citation_signature","submit_replication":"https://pith.science/pith/Y2T5AK6KWLZWYU5VBUVTXNZ5FP/action/replication_record"}},"created_at":"2026-07-05T10:30:54.635837+00:00","updated_at":"2026-07-05T10:30:54.635837+00:00"}