{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:TVHBCYZJ3VDRLPJQI4KXGUAT75","short_pith_number":"pith:TVHBCYZJ","schema_version":"1.0","canonical_sha256":"9d4e116329dd4715bd304715735013ff57aba1651a05918fdfa1c22bceec0229","source":{"kind":"arxiv","id":"2206.04436","version":2},"attestation_state":"computed","paper":{"title":"Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Chengyang Ying, Dong Yan, Hang Su, Jun Zhu, Ning Chen, Xinning Zhou","submitted_at":"2022-06-09T11:57:54Z","abstract_excerpt":"Though deep reinforcement learning (DRL) has obtained substantial success, it may encounter catastrophic failures due to the intrinsic uncertainty of both transition and observation. Most of the existing methods for safe reinforcement learning can only handle transition disturbance or observation disturbance since these two kinds of disturbance affect different parts of the agent; besides, the popular worst-case return may lead to overly pessimistic policies. To address these issues, we first theoretically prove that the performance degradation under transition disturbance and observation dist"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2206.04436","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-06-09T11:57:54Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"56eb59dd6680d3e63888681c71b5f108be3aba591107f520f6c82a6938bb6dc3","abstract_canon_sha256":"4f883285333072286e1db1f2b7742f8969d8b4b255bfbcd62c3f75893ef7742d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:04:32.996279Z","signature_b64":"uQaCP8HiEn39r3U+uLiKFZAABBy/a+6CmyEL2VDvNbKE7FFCVfVz91/rX0hhw8VJj0o6crqkUhK2mWL0uJwWCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9d4e116329dd4715bd304715735013ff57aba1651a05918fdfa1c22bceec0229","last_reissued_at":"2026-07-05T11:04:32.995807Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:04:32.995807Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Chengyang Ying, Dong Yan, Hang Su, Jun Zhu, Ning Chen, Xinning Zhou","submitted_at":"2022-06-09T11:57:54Z","abstract_excerpt":"Though deep reinforcement learning (DRL) has obtained substantial success, it may encounter catastrophic failures due to the intrinsic uncertainty of both transition and observation. Most of the existing methods for safe reinforcement learning can only handle transition disturbance or observation disturbance since these two kinds of disturbance affect different parts of the agent; besides, the popular worst-case return may lead to overly pessimistic policies. To address these issues, we first theoretically prove that the performance degradation under transition disturbance and observation dist"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2206.04436","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2206.04436/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2206.04436","created_at":"2026-07-05T11:04:32.995864+00:00"},{"alias_kind":"arxiv_version","alias_value":"2206.04436v2","created_at":"2026-07-05T11:04:32.995864+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2206.04436","created_at":"2026-07-05T11:04:32.995864+00:00"},{"alias_kind":"pith_short_12","alias_value":"TVHBCYZJ3VDR","created_at":"2026-07-05T11:04:32.995864+00:00"},{"alias_kind":"pith_short_16","alias_value":"TVHBCYZJ3VDRLPJQ","created_at":"2026-07-05T11:04:32.995864+00:00"},{"alias_kind":"pith_short_8","alias_value":"TVHBCYZJ","created_at":"2026-07-05T11:04:32.995864+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27766","citing_title":"RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11975","citing_title":"Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18841","citing_title":"From Cumulative Constraints to Adaptive Runtime Safety Control for Nonstationary Reinforcement Learning","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18842","citing_title":"Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11975","citing_title":"Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25379","citing_title":"Safe-Support Q-Learning: Learning without Unsafe Exploration","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75","json":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75.json","graph_json":"https://pith.science/api/pith-number/TVHBCYZJ3VDRLPJQI4KXGUAT75/graph.json","events_json":"https://pith.science/api/pith-number/TVHBCYZJ3VDRLPJQI4KXGUAT75/events.json","paper":"https://pith.science/paper/TVHBCYZJ"},"agent_actions":{"view_html":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75","download_json":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75.json","view_paper":"https://pith.science/paper/TVHBCYZJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2206.04436&json=true","fetch_graph":"https://pith.science/api/pith-number/TVHBCYZJ3VDRLPJQI4KXGUAT75/graph.json","fetch_events":"https://pith.science/api/pith-number/TVHBCYZJ3VDRLPJQI4KXGUAT75/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75/action/storage_attestation","attest_author":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75/action/author_attestation","sign_citation":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75/action/citation_signature","submit_replication":"https://pith.science/pith/TVHBCYZJ3VDRLPJQI4KXGUAT75/action/replication_record"}},"created_at":"2026-07-05T11:04:32.995864+00:00","updated_at":"2026-07-05T11:04:32.995864+00:00"}