{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2021:5SYVXHDI5PWRNO3XEWLXHB4RYY","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"32bd95bd9724923c8255bd93eb030016d22cf31a4322fab8f57dd6061ccfbdbd","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-08-03T04:55:16Z","title_canon_sha256":"97bafbe0c5b09c48afbbc6e33e7818d46b75244fd27b63d6d8caef037d8c2352"},"schema_version":"1.0","source":{"id":"2108.01295","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2108.01295","created_at":"2026-07-05T08:14:37Z"},{"alias_kind":"arxiv_version","alias_value":"2108.01295v2","created_at":"2026-07-05T08:14:37Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2108.01295","created_at":"2026-07-05T08:14:37Z"},{"alias_kind":"pith_short_12","alias_value":"5SYVXHDI5PWR","created_at":"2026-07-05T08:14:37Z"},{"alias_kind":"pith_short_16","alias_value":"5SYVXHDI5PWRNO3X","created_at":"2026-07-05T08:14:37Z"},{"alias_kind":"pith_short_8","alias_value":"5SYVXHDI","created_at":"2026-07-05T08:14:37Z"}],"graph_snapshots":[{"event_id":"sha256:b013821f2553b425be86bcb83c490636973cc547396ebf9089931b71353bae06","target":"graph","created_at":"2026-07-05T08:14:37Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2108.01295/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Model-based reinforcement learning is a widely accepted solution for solving excessive sample demands. However, the predictions of the dynamics models are often not accurate enough, and the resulting bias may incur catastrophic decisions due to insufficient robustness. Therefore, it is highly desired to investigate how to improve the robustness of model-based RL algorithms while maintaining high sampling efficiency. In this paper, we propose Model-Based Double-dropout Planning (MBDP) to balance robustness and efficiency. MBDP consists of two kinds of dropout mechanisms, where the rollout-dropo","authors_text":"Dijun Luo, Mingzhe Chen, Wanpeng Zhang, Xi Xiao, Yao Yao","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-08-03T04:55:16Z","title":"MBDP: A Model-based Approach to Achieve both Robustness and Sample Efficiency via Double Dropout Planning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2108.01295","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:14919c2c81f626f25439707e80ceb57ce63048bd4424ea3e00af9f7288eefc34","target":"record","created_at":"2026-07-05T08:14:37Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"32bd95bd9724923c8255bd93eb030016d22cf31a4322fab8f57dd6061ccfbdbd","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-08-03T04:55:16Z","title_canon_sha256":"97bafbe0c5b09c48afbbc6e33e7818d46b75244fd27b63d6d8caef037d8c2352"},"schema_version":"1.0","source":{"id":"2108.01295","kind":"arxiv","version":2}},"canonical_sha256":"ecb15b9c68ebed16bb772597738791c6078b1ff0b64698ae16e2b0b984e64e68","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"ecb15b9c68ebed16bb772597738791c6078b1ff0b64698ae16e2b0b984e64e68","first_computed_at":"2026-07-05T08:14:37.419557Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T08:14:37.419557Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"EAjcktxcGbcoXU5H92y2vZ6mVkDv/ec+Ln5VR7jrQ1ccyRNamGKq6AroSqqdVjN9mvji4jlnWhXs3USFWKIpBQ==","signature_status":"signed_v1","signed_at":"2026-07-05T08:14:37.420136Z","signed_message":"canonical_sha256_bytes"},"source_id":"2108.01295","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:14919c2c81f626f25439707e80ceb57ce63048bd4424ea3e00af9f7288eefc34","sha256:b013821f2553b425be86bcb83c490636973cc547396ebf9089931b71353bae06"],"state_sha256":"7b4aecc7a64cd8cbc342161e302e4a3eb37f8c14c373967c9d1a3ade648696e1"}