{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2019:FDHQZNYP4KLZXOZAMASWR2GA6V","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"416ee2b77549a8ff58a1b6d8e1950975729f4ccd6b3ca4939b70a16ca9adda14","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2019-08-13T14:55:09Z","title_canon_sha256":"71c0021555083fb824ba106bd22e79206e4e07cf0213852169d47d5d414a5bb0"},"schema_version":"1.0","source":{"id":"1908.04683","kind":"arxiv","version":5}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1908.04683","created_at":"2026-07-05T00:17:54Z"},{"alias_kind":"arxiv_version","alias_value":"1908.04683v5","created_at":"2026-07-05T00:17:54Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1908.04683","created_at":"2026-07-05T00:17:54Z"},{"alias_kind":"pith_short_12","alias_value":"FDHQZNYP4KLZ","created_at":"2026-07-05T00:17:54Z"},{"alias_kind":"pith_short_16","alias_value":"FDHQZNYP4KLZXOZA","created_at":"2026-07-05T00:17:54Z"},{"alias_kind":"pith_short_8","alias_value":"FDHQZNYP","created_at":"2026-07-05T00:17:54Z"}],"graph_snapshots":[{"event_id":"sha256:4225c04eacff487c1a4298437aca75d16aa64855f2746cddb4133cd5fb50ed39","target":"graph","created_at":"2026-07-05T00:17:54Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/1908.04683/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Consistent and reproducible evaluation of Deep Reinforcement Learning (DRL) is not straightforward. In the Arcade Learning Environment (ALE), small changes in environment parameters such as stochasticity or the maximum allowed play time can lead to very different performance. In this work, we discuss the difficulties of comparing different agents trained on ALE. In order to take a step further towards reproducible and comparable DRL, we introduce SABER, a Standardized Atari BEnchmark for general Reinforcement learning algorithms. Our methodology extends previous recommendations and contains a ","authors_text":"Emilie Wirbel, Fabien Moutarde, Marin Toromanoff","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2019-08-13T14:55:09Z","title":"Is Deep Reinforcement Learning Really Superhuman on Atari? Leveling the playing field"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1908.04683","kind":"arxiv","version":5},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:df0e7faf85e95fcab1f1ce43a571b832968fbb0805a45c55737c1790aa1351e7","target":"record","created_at":"2026-07-05T00:17:54Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"416ee2b77549a8ff58a1b6d8e1950975729f4ccd6b3ca4939b70a16ca9adda14","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2019-08-13T14:55:09Z","title_canon_sha256":"71c0021555083fb824ba106bd22e79206e4e07cf0213852169d47d5d414a5bb0"},"schema_version":"1.0","source":{"id":"1908.04683","kind":"arxiv","version":5}},"canonical_sha256":"28cf0cb70fe2979bbb20602568e8c0f54c37a9f2c92613d5f7087b7402bdaf61","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"28cf0cb70fe2979bbb20602568e8c0f54c37a9f2c92613d5f7087b7402bdaf61","first_computed_at":"2026-07-05T00:17:54.606365Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T00:17:54.606365Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"7HRV2+bm+xxYkzn+e5ga8CR9uhzZTWl+IKzej1uA5dk0NWzc4eFMhZTLZ5JxTUn4b4d6YQWnkP8GfjnPwst0Aw==","signature_status":"signed_v1","signed_at":"2026-07-05T00:17:54.606881Z","signed_message":"canonical_sha256_bytes"},"source_id":"1908.04683","source_kind":"arxiv","source_version":5}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:df0e7faf85e95fcab1f1ce43a571b832968fbb0805a45c55737c1790aa1351e7","sha256:4225c04eacff487c1a4298437aca75d16aa64855f2746cddb4133cd5fb50ed39"],"state_sha256":"69f3cba7e6476ad8871deccfd52bea0c2d3347171e904ec3efb8df59d16934b9"}