{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:63FWEF3XCYTC4ZLXSS22PMIIEV","short_pith_number":"pith:63FWEF3X","schema_version":"1.0","canonical_sha256":"f6cb62177716262e657794b5a7b108255a5fef952ace8ee0ef0fd7b883b68ec4","source":{"kind":"arxiv","id":"2005.13239","version":6},"attestation_state":"computed","paper":{"title":"MOPO: Model-based Offline Policy Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","stat.ML"],"primary_cat":"cs.LG","authors_text":"Chelsea Finn, Garrett Thomas, James Zou, Lantao Yu, Sergey Levine, Stefano Ermon, Tengyu Ma, Tianhe Yu","submitted_at":"2020-05-27T08:46:41Z","abstract_excerpt":"Offline reinforcement learning (RL) refers to the problem of learning policies entirely from a large batch of previously collected data. This problem setting offers the promise of utilizing such datasets to acquire policies without any costly or dangerous active exploration. However, it is also challenging, due to the distributional shift between the offline training data and those states visited by the learned policy. Despite significant recent progress, the most successful prior methods are model-free and constrain the policy to the support of data, precluding generalization to unseen states"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2005.13239","kind":"arxiv","version":6},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-05-27T08:46:41Z","cross_cats_sorted":["cs.AI","stat.ML"],"title_canon_sha256":"50afa7485abc164f84076043dc728a95da3d452947aaacf81366c0f945276383","abstract_canon_sha256":"d7f9e8c8e58b942719318c5405361b64236a21a27b3e006a16b20ab36ed257de"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T01:53:20.514741Z","signature_b64":"3T4YJOb6L/vItaRWHVpXb6dz2JwjtoqD6f1/YwPbDFkW9M/sbHkaFCU2vV9AOnNWDS84i2x6mskle6knrjKeCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f6cb62177716262e657794b5a7b108255a5fef952ace8ee0ef0fd7b883b68ec4","last_reissued_at":"2026-07-05T01:53:20.514286Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T01:53:20.514286Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MOPO: Model-based Offline Policy Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","stat.ML"],"primary_cat":"cs.LG","authors_text":"Chelsea Finn, Garrett Thomas, James Zou, Lantao Yu, Sergey Levine, Stefano Ermon, Tengyu Ma, Tianhe Yu","submitted_at":"2020-05-27T08:46:41Z","abstract_excerpt":"Offline reinforcement learning (RL) refers to the problem of learning policies entirely from a large batch of previously collected data. This problem setting offers the promise of utilizing such datasets to acquire policies without any costly or dangerous active exploration. However, it is also challenging, due to the distributional shift between the offline training data and those states visited by the learned policy. Despite significant recent progress, the most successful prior methods are model-free and constrain the policy to the support of data, precluding generalization to unseen states"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2005.13239","kind":"arxiv","version":6},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2005.13239/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2005.13239","created_at":"2026-07-05T01:53:20.514343+00:00"},{"alias_kind":"arxiv_version","alias_value":"2005.13239v6","created_at":"2026-07-05T01:53:20.514343+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2005.13239","created_at":"2026-07-05T01:53:20.514343+00:00"},{"alias_kind":"pith_short_12","alias_value":"63FWEF3XCYTC","created_at":"2026-07-05T01:53:20.514343+00:00"},{"alias_kind":"pith_short_16","alias_value":"63FWEF3XCYTC4ZLX","created_at":"2026-07-05T01:53:20.514343+00:00"},{"alias_kind":"pith_short_8","alias_value":"63FWEF3X","created_at":"2026-07-05T01:53:20.514343+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18610","citing_title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19328","citing_title":"UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02092","citing_title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24152","citing_title":"Neuro-Inspired Inverse Learning for Planning and Control","ref_index":112,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18610","citing_title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19826","citing_title":"Explainable Wastewater Digital Twins: Adaptive Context-Conditioned Structured Simulators with Self-Falsifying Decision Support","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2010.02193","citing_title":"Mastering Atari with Discrete World Models","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.01346","citing_title":"Safety, Security, and Cognitive Risks in World Models","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2108.03298","citing_title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05845","citing_title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","ref_index":43,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV","json":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV.json","graph_json":"https://pith.science/api/pith-number/63FWEF3XCYTC4ZLXSS22PMIIEV/graph.json","events_json":"https://pith.science/api/pith-number/63FWEF3XCYTC4ZLXSS22PMIIEV/events.json","paper":"https://pith.science/paper/63FWEF3X"},"agent_actions":{"view_html":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV","download_json":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV.json","view_paper":"https://pith.science/paper/63FWEF3X","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2005.13239&json=true","fetch_graph":"https://pith.science/api/pith-number/63FWEF3XCYTC4ZLXSS22PMIIEV/graph.json","fetch_events":"https://pith.science/api/pith-number/63FWEF3XCYTC4ZLXSS22PMIIEV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV/action/storage_attestation","attest_author":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV/action/author_attestation","sign_citation":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV/action/citation_signature","submit_replication":"https://pith.science/pith/63FWEF3XCYTC4ZLXSS22PMIIEV/action/replication_record"}},"created_at":"2026-07-05T01:53:20.514343+00:00","updated_at":"2026-07-05T01:53:20.514343+00:00"}