{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:37LYZANLOZQ2NGUSONSNKSQXVQ","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"f92eabddcae79f7a320df3f8ee9a405b4e3e12527b26577ddd59e00525be298a","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-12-19T22:29:03Z","title_canon_sha256":"82702fbecd0102277ca29ff2e53e223a4905b8433c26246e0f2f39fa295bdca9"},"schema_version":"1.0","source":{"id":"2412.15429","kind":"arxiv","version":5}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2412.15429","created_at":"2026-07-05T10:51:05Z"},{"alias_kind":"arxiv_version","alias_value":"2412.15429v5","created_at":"2026-07-05T10:51:05Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.15429","created_at":"2026-07-05T10:51:05Z"},{"alias_kind":"pith_short_12","alias_value":"37LYZANLOZQ2","created_at":"2026-07-05T10:51:05Z"},{"alias_kind":"pith_short_16","alias_value":"37LYZANLOZQ2NGUS","created_at":"2026-07-05T10:51:05Z"},{"alias_kind":"pith_short_8","alias_value":"37LYZANL","created_at":"2026-07-05T10:51:05Z"}],"graph_snapshots":[{"event_id":"sha256:efbf4e69589d3be07dd008f35346351e610a40a0a5318c28786c718ce19e95d3","target":"graph","created_at":"2026-07-05T10:51:05Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2412.15429/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Offline safe reinforcement learning (RL) has emerged as a promising approach for learning safe behaviors without engaging in risky online interactions with the environment. Most existing methods in offline safe RL rely on cost constraints at each time step (derived from global cost constraints) and this can result in either overly conservative policies or violation of safety constraints. In this paper, we propose to learn a policy that generates desirable trajectories and avoids undesirable trajectories. To be specific, we first partition the pre-collected dataset of state-action trajectories ","authors_text":"Akshat Kumar, Pradeep Varakantham, Ze Gong","cross_cats":["cs.AI"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.15429","kind":"arxiv","version":5},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:01e7b46d484a22f2e6cd03674364b092232d543b53378d27d10173ac0473f569","target":"record","created_at":"2026-07-05T10:51:05Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"f92eabddcae79f7a320df3f8ee9a405b4e3e12527b26577ddd59e00525be298a","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-12-19T22:29:03Z","title_canon_sha256":"82702fbecd0102277ca29ff2e53e223a4905b8433c26246e0f2f39fa295bdca9"},"schema_version":"1.0","source":{"id":"2412.15429","kind":"arxiv","version":5}},"canonical_sha256":"dfd78c81ab7661a69a927364d54a17ac3338e58eefb9ea4e8803210fbecfce3d","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"dfd78c81ab7661a69a927364d54a17ac3338e58eefb9ea4e8803210fbecfce3d","first_computed_at":"2026-07-05T10:51:05.028605Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:51:05.028605Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"JQQnYOxUCW1Pt9jLUA+r+xuel6fvHQNe+FTmUVs7tOySRiDjA6JC2KtjM+e9TVDXG4Lvuk7Ql6rUaEWcvpWKDA==","signature_status":"signed_v1","signed_at":"2026-07-05T10:51:05.029149Z","signed_message":"canonical_sha256_bytes"},"source_id":"2412.15429","source_kind":"arxiv","source_version":5}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:01e7b46d484a22f2e6cd03674364b092232d543b53378d27d10173ac0473f569","sha256:efbf4e69589d3be07dd008f35346351e610a40a0a5318c28786c718ce19e95d3"],"state_sha256":"a87dee0a2a42a425702b134266d7fecf53a59e2bd273b316f2f8b37a1e83605e"}