{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:4M5PGCVVSK3YAJJBFEFEALQXKB","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"0e0edb9af400c4a3544c088c6bc989bdbe2205393d41239e291fe18f404cb4b4","cross_cats_sorted":["cs.RO","cs.SY","eess.SY"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-08-17T06:26:17Z","title_canon_sha256":"c5a47df5ae18981b88fc82fb59bde66ab5c68d6521da6288fd762990878a35e4"},"schema_version":"1.0","source":{"id":"2408.09112","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2408.09112","created_at":"2026-07-05T08:56:28Z"},{"alias_kind":"arxiv_version","alias_value":"2408.09112v1","created_at":"2026-07-05T08:56:28Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.09112","created_at":"2026-07-05T08:56:28Z"},{"alias_kind":"pith_short_12","alias_value":"4M5PGCVVSK3Y","created_at":"2026-07-05T08:56:28Z"},{"alias_kind":"pith_short_16","alias_value":"4M5PGCVVSK3YAJJB","created_at":"2026-07-05T08:56:28Z"},{"alias_kind":"pith_short_8","alias_value":"4M5PGCVV","created_at":"2026-07-05T08:56:28Z"}],"graph_snapshots":[{"event_id":"sha256:c45f234e27438227a753353be4bf4f3e24d8e7a14ab66bbf42d300d669518753","target":"graph","created_at":"2026-07-05T08:56:28Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2408.09112/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement learning often uses neural networks to solve complex control tasks. However, neural networks are sensitive to input perturbations, which makes their deployment in safety-critical environments challenging. This work lifts recent results from formally verifying neural networks against such disturbances to reinforcement learning in continuous state and action spaces using reachability analysis. While previous work mainly focuses on adversarial attacks for robust reinforcement learning, we train neural networks utilizing entire sets of perturbed inputs and maximize the worst-case rew","authors_text":"Lukas Koller, Manuel Wendl, Matthias Althoff, Tobias Ladner","cross_cats":["cs.RO","cs.SY","eess.SY"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-08-17T06:26:17Z","title":"Training Verifiably Robust Agents Using Set-Based Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.09112","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:c5a2e09e16e25ef1385e164271e706e6200b4e983ee8f08c69d03173009c83fe","target":"record","created_at":"2026-07-05T08:56:28Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"0e0edb9af400c4a3544c088c6bc989bdbe2205393d41239e291fe18f404cb4b4","cross_cats_sorted":["cs.RO","cs.SY","eess.SY"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-08-17T06:26:17Z","title_canon_sha256":"c5a47df5ae18981b88fc82fb59bde66ab5c68d6521da6288fd762990878a35e4"},"schema_version":"1.0","source":{"id":"2408.09112","kind":"arxiv","version":1}},"canonical_sha256":"e33af30ab592b7802521290a402e175046c0900eac0df9d99cab54147744a7ac","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"e33af30ab592b7802521290a402e175046c0900eac0df9d99cab54147744a7ac","first_computed_at":"2026-07-05T08:56:28.197450Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T08:56:28.197450Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"jk3zDuWHrPWCAHT8HpZ8bXf3FQhRFE3ia0AgQUZyPVA8Pm16Q1k7pKpHfMvRySAeVPCJ2+2mcjR5ngpCtfQCAg==","signature_status":"signed_v1","signed_at":"2026-07-05T08:56:28.197786Z","signed_message":"canonical_sha256_bytes"},"source_id":"2408.09112","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:c5a2e09e16e25ef1385e164271e706e6200b4e983ee8f08c69d03173009c83fe","sha256:c45f234e27438227a753353be4bf4f3e24d8e7a14ab66bbf42d300d669518753"],"state_sha256":"5354d8fd662afcbe6ee1d18f0256b6248d275b8821f108e6491d531fed4e6783"}