{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:GEYNSAO2EJ3T6Z5Q2NVV7HTIPH","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"d69475617471c7cf016acfd7d7dddfa9b6a1b713f68b14053216aa5d8a864f0f","cross_cats_sorted":["stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-08-11T11:55:31Z","title_canon_sha256":"be2615891789dcd7a1a5f85cbabfb86e8aef048e7a5744bca1d04bde07d9a3f4"},"schema_version":"1.0","source":{"id":"2208.05767","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2208.05767","created_at":"2026-07-05T07:28:42Z"},{"alias_kind":"arxiv_version","alias_value":"2208.05767v4","created_at":"2026-07-05T07:28:42Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2208.05767","created_at":"2026-07-05T07:28:42Z"},{"alias_kind":"pith_short_12","alias_value":"GEYNSAO2EJ3T","created_at":"2026-07-05T07:28:42Z"},{"alias_kind":"pith_short_16","alias_value":"GEYNSAO2EJ3T6Z5Q","created_at":"2026-07-05T07:28:42Z"},{"alias_kind":"pith_short_8","alias_value":"GEYNSAO2","created_at":"2026-07-05T07:28:42Z"}],"graph_snapshots":[{"event_id":"sha256:f3009154666504ab90f62fd4407bf6c096b378c7d2eadcbeb11a5728deb31fad","target":"graph","created_at":"2026-07-05T07:28:42Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2208.05767/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"This paper concerns the central issues of model robustness and sample efficiency in offline reinforcement learning (RL), which aims to learn to perform decision making from history data without active exploration. Due to uncertainties and variabilities of the environment, it is critical to learn a robust policy -- with as few samples as possible -- that performs well even when the deployed environment deviates from the nominal one used to collect the history dataset. We consider a distributionally robust formulation of offline RL, focusing on tabular robust Markov decision processes with an un","authors_text":"Laixi Shi, Yuejie Chi","cross_cats":["stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-08-11T11:55:31Z","title":"Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2208.05767","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:c6a4edc86c35d11d9f3d73f31ec527dce005844f45f3464dd44717efbc5764d3","target":"record","created_at":"2026-07-05T07:28:42Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"d69475617471c7cf016acfd7d7dddfa9b6a1b713f68b14053216aa5d8a864f0f","cross_cats_sorted":["stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-08-11T11:55:31Z","title_canon_sha256":"be2615891789dcd7a1a5f85cbabfb86e8aef048e7a5744bca1d04bde07d9a3f4"},"schema_version":"1.0","source":{"id":"2208.05767","kind":"arxiv","version":4}},"canonical_sha256":"3130d901da22773f67b0d36b5f9e6879df8cfe55c0b9cb5b93a79b6a9ff17d0b","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"3130d901da22773f67b0d36b5f9e6879df8cfe55c0b9cb5b93a79b6a9ff17d0b","first_computed_at":"2026-07-05T07:28:42.914464Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T07:28:42.914464Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"C8wMbdkOhBQgpWrRANlH6VLOSnWghHj1Ku2XerdfPV9oE1ET49Y7SLC2uXBrgtw7pY7N7F2vikohxRxTmhEeDA==","signature_status":"signed_v1","signed_at":"2026-07-05T07:28:42.914976Z","signed_message":"canonical_sha256_bytes"},"source_id":"2208.05767","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:c6a4edc86c35d11d9f3d73f31ec527dce005844f45f3464dd44717efbc5764d3","sha256:f3009154666504ab90f62fd4407bf6c096b378c7d2eadcbeb11a5728deb31fad"],"state_sha256":"909d8f229a8ce45a078819f6d306473d29a8e38b76f1f6f79baaaf63ef71e06f"}