{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:AXFLYWSAPDRHXZ533RPH6JAJ42","short_pith_number":"pith:AXFLYWSA","schema_version":"1.0","canonical_sha256":"05cabc5a4078e27be7bbdc5e7f2409e6adbae9b81a15daab05ce3aa06eb10c82","source":{"kind":"arxiv","id":"2505.21841","version":1},"attestation_state":"computed","paper":{"title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Dabeen Lee, Honghao Wei, Jiahui Zhu, Kihyun Yu, Xin Liu","submitted_at":"2025-05-28T00:16:34Z","abstract_excerpt":"Online safe reinforcement learning (RL) plays a key role in dynamic environments, with applications in autonomous driving, robotics, and cybersecurity. The objective is to learn optimal policies that maximize rewards while satisfying safety constraints modeled by constrained Markov decision processes (CMDPs). Existing methods achieve sublinear regret under stochastic constraints but often fail in adversarial settings, where constraints are unknown, time-varying, and potentially adversarially designed. In this paper, we propose the Optimistic Mirror Descent Primal-Dual (OMDPD) algorithm, the fi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.21841","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-28T00:16:34Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"669ebc57ffe93d05b66ea3d5c5074d0e430e99d83aa00db769832b0e076385d6","abstract_canon_sha256":"425b9288ff5e3dfebef159914bf4a0cb35d9d70ab557c34498f271b40e7067d6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:13:27.218112Z","signature_b64":"AsA+TtsspB71QcM2FjZx1aDPyvCw8IqMYWDWQjm2sPQgbwQPO+roMkGFkC93xWVEzldKFnUkdEQVcCLkvGSlCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"05cabc5a4078e27be7bbdc5e7f2409e6adbae9b81a15daab05ce3aa06eb10c82","last_reissued_at":"2026-07-05T11:13:27.217616Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:13:27.217616Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Dabeen Lee, Honghao Wei, Jiahui Zhu, Kihyun Yu, Xin Liu","submitted_at":"2025-05-28T00:16:34Z","abstract_excerpt":"Online safe reinforcement learning (RL) plays a key role in dynamic environments, with applications in autonomous driving, robotics, and cybersecurity. The objective is to learn optimal policies that maximize rewards while satisfying safety constraints modeled by constrained Markov decision processes (CMDPs). Existing methods achieve sublinear regret under stochastic constraints but often fail in adversarial settings, where constraints are unknown, time-varying, and potentially adversarially designed. In this paper, we propose the Optimistic Mirror Descent Primal-Dual (OMDPD) algorithm, the fi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.21841","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.21841/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.21841","created_at":"2026-07-05T11:13:27.217680+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.21841v1","created_at":"2026-07-05T11:13:27.217680+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.21841","created_at":"2026-07-05T11:13:27.217680+00:00"},{"alias_kind":"pith_short_12","alias_value":"AXFLYWSAPDRH","created_at":"2026-07-05T11:13:27.217680+00:00"},{"alias_kind":"pith_short_16","alias_value":"AXFLYWSAPDRHXZ53","created_at":"2026-07-05T11:13:27.217680+00:00"},{"alias_kind":"pith_short_8","alias_value":"AXFLYWSA","created_at":"2026-07-05T11:13:27.217680+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42","json":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42.json","graph_json":"https://pith.science/api/pith-number/AXFLYWSAPDRHXZ533RPH6JAJ42/graph.json","events_json":"https://pith.science/api/pith-number/AXFLYWSAPDRHXZ533RPH6JAJ42/events.json","paper":"https://pith.science/paper/AXFLYWSA"},"agent_actions":{"view_html":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42","download_json":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42.json","view_paper":"https://pith.science/paper/AXFLYWSA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.21841&json=true","fetch_graph":"https://pith.science/api/pith-number/AXFLYWSAPDRHXZ533RPH6JAJ42/graph.json","fetch_events":"https://pith.science/api/pith-number/AXFLYWSAPDRHXZ533RPH6JAJ42/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42/action/storage_attestation","attest_author":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42/action/author_attestation","sign_citation":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42/action/citation_signature","submit_replication":"https://pith.science/pith/AXFLYWSAPDRHXZ533RPH6JAJ42/action/replication_record"}},"created_at":"2026-07-05T11:13:27.217680+00:00","updated_at":"2026-07-05T11:13:27.217680+00:00"}