{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:D2SNJQKLI5QUGBTXUQYQSF73PR","short_pith_number":"pith:D2SNJQKL","schema_version":"1.0","canonical_sha256":"1ea4d4c14b4761430677a4310917fb7c736cb2b5838d04c44cb6c94c99428dbc","source":{"kind":"arxiv","id":"2004.07219","version":4},"attestation_state":"computed","paper":{"title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"New benchmark datasets for offline RL, drawn from human demonstrations and mixed policies, expose deficiencies in existing algorithms.","cross_cats":["stat.ML"],"primary_cat":"cs.LG","authors_text":"Aviral Kumar, George Tucker, Justin Fu, Ofir Nachum, Sergey Levine","submitted_at":"2020-04-15T17:18:19Z","abstract_excerpt":"The offline reinforcement learning (RL) setting (also known as full batch RL), where a policy is learned from a static dataset, is compelling as progress enables RL methods to take advantage of large, previously-collected datasets, much like how the rise of large datasets has fueled results in supervised learning. However, existing online RL benchmarks are not tailored towards the offline setting and existing offline RL benchmarks are restricted to data generated by partially-trained agents, making progress in offline RL difficult to measure. In this work, we introduce benchmarks specifically "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":true,"formal_links_present":true},"canonical_record":{"source":{"id":"2004.07219","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-04-15T17:18:19Z","cross_cats_sorted":["stat.ML"],"title_canon_sha256":"35a4c1a61624d1cfe16366f887d9938531d3185d83679fea4470f32dcc26b27f","abstract_canon_sha256":"5512cf4724e468ca0a0f4414d6d074c3f6cdb4aae9db977fb8f204e54855c16b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:13:13.911233Z","signature_b64":"GLSdUgMaJt28mxDV0vbKIpVJJ9UeXywLOq+aeVwRuG3BMDx97wIhY6ZftnLv8FbulBfLmiNj/BT1cLIpZdEICA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1ea4d4c14b4761430677a4310917fb7c736cb2b5838d04c44cb6c94c99428dbc","last_reissued_at":"2026-07-05T02:13:13.910791Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:13:13.910791Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"New benchmark datasets for offline RL, drawn from human demonstrations and mixed policies, expose deficiencies in existing algorithms.","cross_cats":["stat.ML"],"primary_cat":"cs.LG","authors_text":"Aviral Kumar, George Tucker, Justin Fu, Ofir Nachum, Sergey Levine","submitted_at":"2020-04-15T17:18:19Z","abstract_excerpt":"The offline reinforcement learning (RL) setting (also known as full batch RL), where a policy is learned from a static dataset, is compelling as progress enables RL methods to take advantage of large, previously-collected datasets, much like how the rise of large datasets has fueled results in supervised learning. However, existing online RL benchmarks are not tailored towards the offline setting and existing offline RL benchmarks are restricted to data generated by partially-trained agents, making progress in offline RL difficult to measure. In this work, we introduce benchmarks specifically "},"claims":{"count":4,"items":[{"kind":"strongest_claim","text":"By moving beyond simple benchmark tasks and data collected by partially-trained RL agents, we reveal important and unappreciated deficiencies of existing algorithms.","source":"verdict.strongest_claim","status":"machine_extracted","claim_id":"C1","attestation":"unclaimed"},{"kind":"weakest_assumption","text":"That datasets generated via hand-designed controllers, human demonstrators, multitask settings, and mixtures of policies capture the key properties most relevant to real-world offline RL applications.","source":"verdict.weakest_assumption","status":"machine_extracted","claim_id":"C2","attestation":"unclaimed"},{"kind":"one_line_summary","text":"D4RL supplies new offline RL benchmarks and datasets from expert and mixed sources to expose weaknesses in existing algorithms and standardize evaluation.","source":"verdict.one_line_summary","status":"machine_extracted","claim_id":"C3","attestation":"unclaimed"},{"kind":"headline","text":"New benchmark datasets for offline RL, drawn from human demonstrations and mixed policies, expose deficiencies in existing algorithms.","source":"verdict.pith_extraction.headline","status":"machine_extracted","claim_id":"C4","attestation":"unclaimed"}],"snapshot_sha256":"0c06905e9ba24f8729ba91ab0b61bdb9ea59af869a8a84e57b82b8486d7ef737"},"source":{"id":"2004.07219","kind":"arxiv","version":4},"verdict":{"id":"f9c60159-366b-4c1b-bde8-534bda9e44c0","model_set":{"reader":"grok-4.3"},"created_at":"2026-05-12T23:14:59.570931Z","strongest_claim":"By moving beyond simple benchmark tasks and data collected by partially-trained RL agents, we reveal important and unappreciated deficiencies of existing algorithms.","one_line_summary":"D4RL supplies new offline RL benchmarks and datasets from expert and mixed sources to expose weaknesses in existing algorithms and standardize evaluation.","pipeline_version":"pith-pipeline@v0.9.0","weakest_assumption":"That datasets generated via hand-designed controllers, human demonstrators, multitask settings, and mixtures of policies capture the key properties most relevant to real-world offline RL applications.","pith_extraction_headline":"New benchmark datasets for offline RL, drawn from human demonstrations and mixed policies, expose deficiencies in existing algorithms."},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2004.07219/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":24,"sample":[{"doi":"","year":1908,"title":"Preprint arXiv:1908.00261 , year=","work_id":"f49e0fd8-840b-4c3d-bf03-e057e1da8f2d","ref_index":1,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":1909,"title":"Scaling data-driven robotics with reward sketching and batch reinforcement learning.Preprint arXiv:1909.12200","work_id":"c44fff83-b8c4-4bf1-a47d-0f5c0046b36c","ref_index":2,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2018,"title":"End- to-end driving via conditional imitation learning","work_id":"a28935f5-b348-47b2-9aeb-25c303b9a4aa","ref_index":3,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":1904,"title":"Challenges of Real-World Reinforcement Learning","work_id":"fc99449a-80f4-4f37-a028-7b3774c78bf6","ref_index":4,"cited_arxiv_id":"1904.12901","is_internal_anchor":false},{"doi":"","year":2003,"title":"Mankowitz, Jerry Li, Cosmin Paduraru, Sven Gowal, and Todd Hes- ter","work_id":"72539193-de5d-4093-a85f-abb4eba8699e","ref_index":5,"cited_arxiv_id":"","is_internal_anchor":false}],"resolved_work":24,"snapshot_sha256":"680ebf13a40fb439d9b1b23727eb2e41ac080d99d079f74ccf5b59c7c056f646","internal_anchors":7},"formal_canon":{"evidence_count":1,"snapshot_sha256":"896b842cd86dfef1170675a52ee16c796e1c4a6ec93fe924fa49b97263993227"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2004.07219","created_at":"2026-07-05T02:13:13.910852+00:00"},{"alias_kind":"arxiv_version","alias_value":"2004.07219v4","created_at":"2026-07-05T02:13:13.910852+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2004.07219","created_at":"2026-07-05T02:13:13.910852+00:00"},{"alias_kind":"pith_short_12","alias_value":"D2SNJQKLI5QU","created_at":"2026-07-05T02:13:13.910852+00:00"},{"alias_kind":"pith_short_16","alias_value":"D2SNJQKLI5QUGBTX","created_at":"2026-07-05T02:13:13.910852+00:00"},{"alias_kind":"pith_short_8","alias_value":"D2SNJQKL","created_at":"2026-07-05T02:13:13.910852+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":98,"internal_anchor_count":98,"sample":[{"citing_arxiv_id":"2607.05375","citing_title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","ref_index":60,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21085","citing_title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2606.19721","citing_title":"OnDeFog: Online Decision Transformer under Frame Dropping","ref_index":8,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01120","citing_title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","ref_index":28,"is_internal_anchor":true},{"citing_arxiv_id":"2606.11982","citing_title":"PAWS: Preference Learning with Advantage-Weighted Segments","ref_index":52,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10613","citing_title":"Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10705","citing_title":"Event-Driven Reinforcement Learning Enables Long-Horizon Control in Semiconductor Fabrication","ref_index":61,"is_internal_anchor":true},{"citing_arxiv_id":"2606.09115","citing_title":"Counterfactual Transport Flows for Offline Conservative Trajectory Refinement","ref_index":93,"is_internal_anchor":true},{"citing_arxiv_id":"2607.00634","citing_title":"Loss Smoothing for Stable Adaptation Under Distribution Shift","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01225","citing_title":"Language-Critique Imitation Learning from Suboptimal Demonstrations","ref_index":80,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01120","citing_title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","ref_index":28,"is_internal_anchor":true},{"citing_arxiv_id":"2606.01123","citing_title":"From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning","ref_index":101,"is_internal_anchor":true},{"citing_arxiv_id":"2605.24924","citing_title":"Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2605.13435","citing_title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2605.14779","citing_title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2605.01663","citing_title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2605.03065","citing_title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"2605.05172","citing_title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","ref_index":8,"is_internal_anchor":true},{"citing_arxiv_id":"2605.23993","citing_title":"Nano World Models: A Minimalist Implementation of Future Video Prediction","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2605.24152","citing_title":"Neuro-Inspired Inverse Learning for Planning and Control","ref_index":89,"is_internal_anchor":true},{"citing_arxiv_id":"2605.24649","citing_title":"On the Stability and Realizability of Recurrent Polynomial Surrogate Ternary Logic Gate Networks","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2605.24810","citing_title":"Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2605.25740","citing_title":"Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning","ref_index":1,"is_internal_anchor":true},{"citing_arxiv_id":"2605.25620","citing_title":"Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2605.25414","citing_title":"How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning","ref_index":1,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":1,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR","json":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR.json","graph_json":"https://pith.science/api/pith-number/D2SNJQKLI5QUGBTXUQYQSF73PR/graph.json","events_json":"https://pith.science/api/pith-number/D2SNJQKLI5QUGBTXUQYQSF73PR/events.json","paper":"https://pith.science/paper/D2SNJQKL"},"agent_actions":{"view_html":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR","download_json":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR.json","view_paper":"https://pith.science/paper/D2SNJQKL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2004.07219&json=true","fetch_graph":"https://pith.science/api/pith-number/D2SNJQKLI5QUGBTXUQYQSF73PR/graph.json","fetch_events":"https://pith.science/api/pith-number/D2SNJQKLI5QUGBTXUQYQSF73PR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR/action/storage_attestation","attest_author":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR/action/author_attestation","sign_citation":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR/action/citation_signature","submit_replication":"https://pith.science/pith/D2SNJQKLI5QUGBTXUQYQSF73PR/action/replication_record"}},"created_at":"2026-07-05T02:13:13.910852+00:00","updated_at":"2026-07-05T02:13:13.910852+00:00"}