{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2020:63FWEF3XCYTC4ZLXSS22PMIIEV","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"d7f9e8c8e58b942719318c5405361b64236a21a27b3e006a16b20ab36ed257de","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-05-27T08:46:41Z","title_canon_sha256":"50afa7485abc164f84076043dc728a95da3d452947aaacf81366c0f945276383"},"schema_version":"1.0","source":{"id":"2005.13239","kind":"arxiv","version":6}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2005.13239","created_at":"2026-07-05T01:53:20Z"},{"alias_kind":"arxiv_version","alias_value":"2005.13239v6","created_at":"2026-07-05T01:53:20Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2005.13239","created_at":"2026-07-05T01:53:20Z"},{"alias_kind":"pith_short_12","alias_value":"63FWEF3XCYTC","created_at":"2026-07-05T01:53:20Z"},{"alias_kind":"pith_short_16","alias_value":"63FWEF3XCYTC4ZLX","created_at":"2026-07-05T01:53:20Z"},{"alias_kind":"pith_short_8","alias_value":"63FWEF3X","created_at":"2026-07-05T01:53:20Z"}],"graph_snapshots":[{"event_id":"sha256:4a6836ad14bfd9e454184abae6ee0cca818c7f6259cac311ad0cb800bc02f4a8","target":"graph","created_at":"2026-07-05T01:53:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2005.13239/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Offline reinforcement learning (RL) refers to the problem of learning policies entirely from a large batch of previously collected data. This problem setting offers the promise of utilizing such datasets to acquire policies without any costly or dangerous active exploration. However, it is also challenging, due to the distributional shift between the offline training data and those states visited by the learned policy. Despite significant recent progress, the most successful prior methods are model-free and constrain the policy to the support of data, precluding generalization to unseen states","authors_text":"Chelsea Finn, Garrett Thomas, James Zou, Lantao Yu, Sergey Levine, Stefano Ermon, Tengyu Ma, Tianhe Yu","cross_cats":["cs.AI","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-05-27T08:46:41Z","title":"MOPO: Model-based Offline Policy Optimization"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2005.13239","kind":"arxiv","version":6},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:46b17e1574fc1c192fd0c23435faa333b2564a0f1e50b07b9aa9210e3a8a3a2c","target":"record","created_at":"2026-07-05T01:53:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"d7f9e8c8e58b942719318c5405361b64236a21a27b3e006a16b20ab36ed257de","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-05-27T08:46:41Z","title_canon_sha256":"50afa7485abc164f84076043dc728a95da3d452947aaacf81366c0f945276383"},"schema_version":"1.0","source":{"id":"2005.13239","kind":"arxiv","version":6}},"canonical_sha256":"f6cb62177716262e657794b5a7b108255a5fef952ace8ee0ef0fd7b883b68ec4","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"f6cb62177716262e657794b5a7b108255a5fef952ace8ee0ef0fd7b883b68ec4","first_computed_at":"2026-07-05T01:53:20.514286Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T01:53:20.514286Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"3T4YJOb6L/vItaRWHVpXb6dz2JwjtoqD6f1/YwPbDFkW9M/sbHkaFCU2vV9AOnNWDS84i2x6mskle6knrjKeCw==","signature_status":"signed_v1","signed_at":"2026-07-05T01:53:20.514741Z","signed_message":"canonical_sha256_bytes"},"source_id":"2005.13239","source_kind":"arxiv","source_version":6}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:46b17e1574fc1c192fd0c23435faa333b2564a0f1e50b07b9aa9210e3a8a3a2c","sha256:4a6836ad14bfd9e454184abae6ee0cca818c7f6259cac311ad0cb800bc02f4a8"],"state_sha256":"622e91f7df5bfd2b5a0ae976af03ac98052e5e38c7ce6c91605f0d870aebb79c"}