{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:4IAI7BER2QBXQJMOMSMUBEX3ZY","short_pith_number":"pith:4IAI7BER","schema_version":"1.0","canonical_sha256":"e2008f8491d40378258e64994092fbce28282cdb20d1a31359d36b882e3582ef","source":{"kind":"arxiv","id":"2103.16596","version":1},"attestation_state":"computed","paper":{"title":"Benchmarks for Deep Off-Policy Evaluation","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["stat.ML"],"primary_cat":"cs.LG","authors_text":"Alexander Novikov, Aviral Kumar, Cosmin Paduraru, George Tucker, Justin Fu, Mengjiao Yang, Michael R. Zhang, Mohammad Norouzi, Ofir Nachum, Sergey Levine, Tom Le Paine, Yutian Chen, Ziyu Wang","submitted_at":"2021-03-30T18:09:33Z","abstract_excerpt":"Off-policy evaluation (OPE) holds the promise of being able to leverage large, offline datasets for both evaluating and selecting complex policies for decision making. The ability to learn offline is particularly important in many real-world domains, such as in healthcare, recommender systems, or robotics, where online data collection is an expensive and potentially dangerous process. Being able to accurately evaluate and select high-performing policies without requiring online interaction could yield significant benefits in safety, time, and cost for these applications. While many OPE methods"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2103.16596","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2021-03-30T18:09:33Z","cross_cats_sorted":["stat.ML"],"title_canon_sha256":"380e93b33454235c39c7c8ef08ae9bc3debbb5e7cd9b202b9e29b9e92be5bc00","abstract_canon_sha256":"542441924512abbf7fe72a6c75882d5477e62b321bb347561331384210dfb489"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:27:56.315550Z","signature_b64":"/Hi/uvnmarrlNO4lQLVmMf3HYFBWdb3tVqQSX6EtcLhQl8nAoCx+H2VDUtkZVe8Ctf+eGnakmoSC9PKP7sU+Ag==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e2008f8491d40378258e64994092fbce28282cdb20d1a31359d36b882e3582ef","last_reissued_at":"2026-07-05T02:27:56.315177Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:27:56.315177Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Benchmarks for Deep Off-Policy Evaluation","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["stat.ML"],"primary_cat":"cs.LG","authors_text":"Alexander Novikov, Aviral Kumar, Cosmin Paduraru, George Tucker, Justin Fu, Mengjiao Yang, Michael R. Zhang, Mohammad Norouzi, Ofir Nachum, Sergey Levine, Tom Le Paine, Yutian Chen, Ziyu Wang","submitted_at":"2021-03-30T18:09:33Z","abstract_excerpt":"Off-policy evaluation (OPE) holds the promise of being able to leverage large, offline datasets for both evaluating and selecting complex policies for decision making. The ability to learn offline is particularly important in many real-world domains, such as in healthcare, recommender systems, or robotics, where online data collection is an expensive and potentially dangerous process. Being able to accurately evaluate and select high-performing policies without requiring online interaction could yield significant benefits in safety, time, and cost for these applications. While many OPE methods"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2103.16596","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2103.16596/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2103.16596","created_at":"2026-07-05T02:27:56.315237+00:00"},{"alias_kind":"arxiv_version","alias_value":"2103.16596v1","created_at":"2026-07-05T02:27:56.315237+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2103.16596","created_at":"2026-07-05T02:27:56.315237+00:00"},{"alias_kind":"pith_short_12","alias_value":"4IAI7BER2QBX","created_at":"2026-07-05T02:27:56.315237+00:00"},{"alias_kind":"pith_short_16","alias_value":"4IAI7BER2QBXQJMO","created_at":"2026-07-05T02:27:56.315237+00:00"},{"alias_kind":"pith_short_8","alias_value":"4IAI7BER","created_at":"2026-07-05T02:27:56.315237+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2601.11505","citing_title":"MetaboNet: The Largest Publicly Available Consolidated Dataset for Type 1 Diabetes Management","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2108.03298","citing_title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY","json":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY.json","graph_json":"https://pith.science/api/pith-number/4IAI7BER2QBXQJMOMSMUBEX3ZY/graph.json","events_json":"https://pith.science/api/pith-number/4IAI7BER2QBXQJMOMSMUBEX3ZY/events.json","paper":"https://pith.science/paper/4IAI7BER"},"agent_actions":{"view_html":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY","download_json":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY.json","view_paper":"https://pith.science/paper/4IAI7BER","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2103.16596&json=true","fetch_graph":"https://pith.science/api/pith-number/4IAI7BER2QBXQJMOMSMUBEX3ZY/graph.json","fetch_events":"https://pith.science/api/pith-number/4IAI7BER2QBXQJMOMSMUBEX3ZY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY/action/storage_attestation","attest_author":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY/action/author_attestation","sign_citation":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY/action/citation_signature","submit_replication":"https://pith.science/pith/4IAI7BER2QBXQJMOMSMUBEX3ZY/action/replication_record"}},"created_at":"2026-07-05T02:27:56.315237+00:00","updated_at":"2026-07-05T02:27:56.315237+00:00"}