{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:6T5TIDS2RQNY3ETP46XII53B7J","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"cf1f5c8d331ba0ed0cc30a8905d2850589a31d9bb264d4de795e15c36969efea","cross_cats_sorted":["math.OC"],"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2024-05-23T18:19:47Z","title_canon_sha256":"eb61243d4d257131c622555ff34b3ba7062f46ec39a159db8d49c96ae1c32a3d"},"schema_version":"1.0","source":{"id":"2405.14973","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2405.14973","created_at":"2026-07-05T10:17:08Z"},{"alias_kind":"arxiv_version","alias_value":"2405.14973v2","created_at":"2026-07-05T10:17:08Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.14973","created_at":"2026-07-05T10:17:08Z"},{"alias_kind":"pith_short_12","alias_value":"6T5TIDS2RQNY","created_at":"2026-07-05T10:17:08Z"},{"alias_kind":"pith_short_16","alias_value":"6T5TIDS2RQNY3ETP","created_at":"2026-07-05T10:17:08Z"},{"alias_kind":"pith_short_8","alias_value":"6T5TIDS2","created_at":"2026-07-05T10:17:08Z"}],"graph_snapshots":[{"event_id":"sha256:247ee820cb407a754dd42c258cfd7b213e0543bb4346d8d96dcd1034150336d7","target":"graph","created_at":"2026-07-05T10:17:08Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2405.14973/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Constrained Markov Decision Processes (CMDPs) are critical in many high-stakes applications, where decisions must optimize cumulative rewards while strictly adhering to complex nonlinear constraints. In domains such as power systems, finance, supply chains, and precision robotics, violating these constraints can result in significant financial or societal costs. Existing Reinforcement Learning (RL) methods often struggle with sample efficiency and effectiveness in finding feasible policies for highly and strictly constrained CMDPs, limiting their applicability in these environments. Stochastic","authors_text":"Alexandre Street, Andrew Rosemberg, Davi M. Vallad\\~ao, Pascal Van Hentenryck","cross_cats":["math.OC"],"headline":"","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2024-05-23T18:19:47Z","title":"Efficiently Training Deep-Learning Parametric Policies using Lagrangian Duality"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.14973","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:7cadbd3a8d5cc0d5b7966cd654f2ee43e7deed8befc93994bfd78bb0dba6cca4","target":"record","created_at":"2026-07-05T10:17:08Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"cf1f5c8d331ba0ed0cc30a8905d2850589a31d9bb264d4de795e15c36969efea","cross_cats_sorted":["math.OC"],"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2024-05-23T18:19:47Z","title_canon_sha256":"eb61243d4d257131c622555ff34b3ba7062f46ec39a159db8d49c96ae1c32a3d"},"schema_version":"1.0","source":{"id":"2405.14973","kind":"arxiv","version":2}},"canonical_sha256":"f4fb340e5a8c1b8d926fe7ae847761fa407957a80c7495a4750d691b9d5235eb","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"f4fb340e5a8c1b8d926fe7ae847761fa407957a80c7495a4750d691b9d5235eb","first_computed_at":"2026-07-05T10:17:08.275417Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:17:08.275417Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"MkxY48COxUQEKWNDmY8ciu6pGPup13NjZTziqyXlSxnZRNd1Tnt/99nchcz0GsZQ4Qqyel6WZrd/ScuOO7a6AQ==","signature_status":"signed_v1","signed_at":"2026-07-05T10:17:08.275942Z","signed_message":"canonical_sha256_bytes"},"source_id":"2405.14973","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:7cadbd3a8d5cc0d5b7966cd654f2ee43e7deed8befc93994bfd78bb0dba6cca4","sha256:247ee820cb407a754dd42c258cfd7b213e0543bb4346d8d96dcd1034150336d7"],"state_sha256":"a702df780ad81fb90bd83a5fa6af8cadb537225fd2de39d304909c3c669ce5f6"}