{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:7FI66XKCSV4Y6OLWI4JWUJAHFI","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"eda7a1c4504eb8510fea95f63f7fb138da8116bd5fa48ab552d0e354af1de0be","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-02-10T05:43:41Z","title_canon_sha256":"e161008c60bbc0fb97e51efdc21c5e15c28cea6955b3c2c0099b8ee56eea7766"},"schema_version":"1.0","source":{"id":"2202.04849","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2202.04849","created_at":"2026-07-05T04:36:34Z"},{"alias_kind":"arxiv_version","alias_value":"2202.04849v2","created_at":"2026-07-05T04:36:34Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2202.04849","created_at":"2026-07-05T04:36:34Z"},{"alias_kind":"pith_short_12","alias_value":"7FI66XKCSV4Y","created_at":"2026-07-05T04:36:34Z"},{"alias_kind":"pith_short_16","alias_value":"7FI66XKCSV4Y6OLW","created_at":"2026-07-05T04:36:34Z"},{"alias_kind":"pith_short_8","alias_value":"7FI66XKC","created_at":"2026-07-05T04:36:34Z"}],"graph_snapshots":[{"event_id":"sha256:86aae17c3fe21d11fb39704e0451fee3a42014540e048fb3999847550ae87aaf","target":"graph","created_at":"2026-07-05T04:36:34Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2202.04849/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Methods that extract policy primitives from offline demonstrations using deep generative models have shown promise at accelerating reinforcement learning(RL) for new tasks. Intuitively, these methods should also help to trainsafeRLagents because they enforce useful skills. However, we identify these techniques are not well equipped for safe policy learning because they ignore negative experiences(e.g., unsafe or unsuccessful), focusing only on positive experiences, which harms their ability to generalize to new tasks safely. Rather, we model the latentsafetycontextusing principled contrastive ","authors_text":"Bo Dai, Dylan Slack, Nevan Wichers, Yinlam Chow","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-02-10T05:43:41Z","title":"SAFER: Data-Efficient and Safe Reinforcement Learning via Skill Acquisition"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2202.04849","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:8c1a7e62527fb63c8789c73db691ad9c9691cfa9c2b43f9c7c1970c16cf8ab76","target":"record","created_at":"2026-07-05T04:36:34Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"eda7a1c4504eb8510fea95f63f7fb138da8116bd5fa48ab552d0e354af1de0be","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-02-10T05:43:41Z","title_canon_sha256":"e161008c60bbc0fb97e51efdc21c5e15c28cea6955b3c2c0099b8ee56eea7766"},"schema_version":"1.0","source":{"id":"2202.04849","kind":"arxiv","version":2}},"canonical_sha256":"f951ef5d4295798f397647136a24072a2f929b3b7506e1449a9b8d473b666e39","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"f951ef5d4295798f397647136a24072a2f929b3b7506e1449a9b8d473b666e39","first_computed_at":"2026-07-05T04:36:34.925888Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T04:36:34.925888Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"1vwyWYcaT1KGeoEXSfWBYuifCob1LB/U2pKKsBeog4aHxZciIsrMPxcIPW9amdKwIiuMua/YzaNS78N/hHyeBw==","signature_status":"signed_v1","signed_at":"2026-07-05T04:36:34.926364Z","signed_message":"canonical_sha256_bytes"},"source_id":"2202.04849","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:8c1a7e62527fb63c8789c73db691ad9c9691cfa9c2b43f9c7c1970c16cf8ab76","sha256:86aae17c3fe21d11fb39704e0451fee3a42014540e048fb3999847550ae87aaf"],"state_sha256":"fe5612776ef8f16ef93ad012627018f0b1d4166541ee7dd9dc0ffebbce7db8a1"}