{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2020:3RNDXN73Y5UMQ6SLX3T3QHWOYU","short_pith_number":"pith:3RNDXN73","canonical_record":{"source":{"id":"2006.13189","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-23T17:43:44Z","cross_cats_sorted":["cs.AI","stat.ME","stat.ML"],"title_canon_sha256":"3818f43a37d338b2db6633f69a37e2a7905e5ba6c0c1353bb648fd35e33faf37","abstract_canon_sha256":"629008fcaf51dbb35b15898826c535ff9322cc02582fe0230828c2a102401ce8"},"schema_version":"1.0"},"canonical_sha256":"dc5a3bb7fbc768c87a4bbee7b81ecec506c329fe5192748da194731890286314","source":{"kind":"arxiv","id":"2006.13189","version":2},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2006.13189","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"arxiv_version","alias_value":"2006.13189v2","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2006.13189","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"pith_short_12","alias_value":"3RNDXN73Y5UM","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"pith_short_16","alias_value":"3RNDXN73Y5UMQ6SL","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"pith_short_8","alias_value":"3RNDXN73","created_at":"2026-07-05T01:47:55Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2020:3RNDXN73Y5UMQ6SLX3T3QHWOYU","target":"record","payload":{"canonical_record":{"source":{"id":"2006.13189","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-23T17:43:44Z","cross_cats_sorted":["cs.AI","stat.ME","stat.ML"],"title_canon_sha256":"3818f43a37d338b2db6633f69a37e2a7905e5ba6c0c1353bb648fd35e33faf37","abstract_canon_sha256":"629008fcaf51dbb35b15898826c535ff9322cc02582fe0230828c2a102401ce8"},"schema_version":"1.0"},"canonical_sha256":"dc5a3bb7fbc768c87a4bbee7b81ecec506c329fe5192748da194731890286314","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T01:47:55.298743Z","signature_b64":"pgLIRvpScLQlHb4wF9C4bcedObvAxjwDKTuPj7p3exWZljhlYTF4DI+ohvRXeegirF5dlIFReZJE9h5flCt7CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dc5a3bb7fbc768c87a4bbee7b81ecec506c329fe5192748da194731890286314","last_reissued_at":"2026-07-05T01:47:55.298239Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T01:47:55.298239Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2006.13189","source_version":2,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T01:47:55Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"NwFEJYbrrOcEdYIio4FHJJ/qZrPHDR3kPvRUzVMCRFeb7izlfdAV+nwm5wyxaTpPtgFIaJcJrWF2/nfoTsWABg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-16T17:50:27.743022Z"},"content_sha256":"93d64116df080cc3fc8377ed13597d2d30edd89282a42ff4e42916737de90299","schema_version":"1.0","event_id":"sha256:93d64116df080cc3fc8377ed13597d2d30edd89282a42ff4e42916737de90299"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2020:3RNDXN73Y5UMQ6SLX3T3QHWOYU","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Expert-Supervised Reinforcement Learning for Offline Policy Learning and Evaluation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","stat.ME","stat.ML"],"primary_cat":"cs.LG","authors_text":"Aaron Sonabend-W, Junwei Lu, Leo A. Celi, Peter Szolovits, Tianxi Cai","submitted_at":"2020-06-23T17:43:44Z","abstract_excerpt":"Offline Reinforcement Learning (RL) is a promising approach for learning optimal policies in environments where direct exploration is expensive or unfeasible. However, the adoption of such policies in practice is often challenging, as they are hard to interpret within the application context, and lack measures of uncertainty for the learned policy value and its decisions. To overcome these issues, we propose an Expert-Supervised RL (ESRL) framework which uses uncertainty quantification for offline policy learning. In particular, we have three contributions: 1) the method can learn safe and opt"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2006.13189","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2006.13189/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T01:47:55Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"7XVPKhheF5V4sUyw5taJ6ANAvNBY0r81r4QxN/mcWXr80/vAkwvdj0YlLzzVEBKM/8YjOpIfQQFSKZfxXopGAA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-16T17:50:27.743563Z"},"content_sha256":"8abb121237b4cdbf856be3b59effb323ea3974371802979032086ebf7c3bef38","schema_version":"1.0","event_id":"sha256:8abb121237b4cdbf856be3b59effb323ea3974371802979032086ebf7c3bef38"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU/bundle.json","state_url":"https://pith.science/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-16T17:50:27Z","links":{"resolver":"https://pith.science/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU","bundle":"https://pith.science/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU/bundle.json","state":"https://pith.science/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU/state.json","well_known_bundle":"https://pith.science/.well-known/pith/3RNDXN73Y5UMQ6SLX3T3QHWOYU/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2020:3RNDXN73Y5UMQ6SLX3T3QHWOYU","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"629008fcaf51dbb35b15898826c535ff9322cc02582fe0230828c2a102401ce8","cross_cats_sorted":["cs.AI","stat.ME","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-23T17:43:44Z","title_canon_sha256":"3818f43a37d338b2db6633f69a37e2a7905e5ba6c0c1353bb648fd35e33faf37"},"schema_version":"1.0","source":{"id":"2006.13189","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2006.13189","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"arxiv_version","alias_value":"2006.13189v2","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2006.13189","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"pith_short_12","alias_value":"3RNDXN73Y5UM","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"pith_short_16","alias_value":"3RNDXN73Y5UMQ6SL","created_at":"2026-07-05T01:47:55Z"},{"alias_kind":"pith_short_8","alias_value":"3RNDXN73","created_at":"2026-07-05T01:47:55Z"}],"graph_snapshots":[{"event_id":"sha256:8abb121237b4cdbf856be3b59effb323ea3974371802979032086ebf7c3bef38","target":"graph","created_at":"2026-07-05T01:47:55Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2006.13189/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Offline Reinforcement Learning (RL) is a promising approach for learning optimal policies in environments where direct exploration is expensive or unfeasible. However, the adoption of such policies in practice is often challenging, as they are hard to interpret within the application context, and lack measures of uncertainty for the learned policy value and its decisions. To overcome these issues, we propose an Expert-Supervised RL (ESRL) framework which uses uncertainty quantification for offline policy learning. In particular, we have three contributions: 1) the method can learn safe and opt","authors_text":"Aaron Sonabend-W, Junwei Lu, Leo A. Celi, Peter Szolovits, Tianxi Cai","cross_cats":["cs.AI","stat.ME","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-23T17:43:44Z","title":"Expert-Supervised Reinforcement Learning for Offline Policy Learning and Evaluation"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2006.13189","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:93d64116df080cc3fc8377ed13597d2d30edd89282a42ff4e42916737de90299","target":"record","created_at":"2026-07-05T01:47:55Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"629008fcaf51dbb35b15898826c535ff9322cc02582fe0230828c2a102401ce8","cross_cats_sorted":["cs.AI","stat.ME","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-23T17:43:44Z","title_canon_sha256":"3818f43a37d338b2db6633f69a37e2a7905e5ba6c0c1353bb648fd35e33faf37"},"schema_version":"1.0","source":{"id":"2006.13189","kind":"arxiv","version":2}},"canonical_sha256":"dc5a3bb7fbc768c87a4bbee7b81ecec506c329fe5192748da194731890286314","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"dc5a3bb7fbc768c87a4bbee7b81ecec506c329fe5192748da194731890286314","first_computed_at":"2026-07-05T01:47:55.298239Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T01:47:55.298239Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"pgLIRvpScLQlHb4wF9C4bcedObvAxjwDKTuPj7p3exWZljhlYTF4DI+ohvRXeegirF5dlIFReZJE9h5flCt7CA==","signature_status":"signed_v1","signed_at":"2026-07-05T01:47:55.298743Z","signed_message":"canonical_sha256_bytes"},"source_id":"2006.13189","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:93d64116df080cc3fc8377ed13597d2d30edd89282a42ff4e42916737de90299","sha256:8abb121237b4cdbf856be3b59effb323ea3974371802979032086ebf7c3bef38"],"state_sha256":"3762dca236d4c549a8b2fbf77e87f630a3d814f5837629419ab46b5b69519fb6"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"74WG3lVgXA5A0vbPTX0kTndQUE8SyKmga+iqP/CGB/HGzc0Tg0EAx0T6jt7nD7SVqBUxPKTxbCX7k48DlSP4Bw==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-16T17:50:27.748119Z","bundle_sha256":"633774c366526c2a21612c6f7fab68e8c28c95154a144d362cb7bb7d3e7bdc30"}}