{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2020:A6BQ6T7FTDKQBS4S6WARUUT6TP","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"8cada46b95507c946c1d2221e8cfb286102b86889f5210b54c14c4b2a640b4a3","cross_cats_sorted":["cs.AI","cs.RO","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-26T14:30:41Z","title_canon_sha256":"949a33da0558d24dc89f0b7abf7e9c1d925a4a355678b0fc1e1edaa97f106b0b"},"schema_version":"1.0","source":{"id":"2006.15009","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2006.15009","created_at":"2026-07-05T04:10:20Z"},{"alias_kind":"arxiv_version","alias_value":"2006.15009v4","created_at":"2026-07-05T04:10:20Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2006.15009","created_at":"2026-07-05T04:10:20Z"},{"alias_kind":"pith_short_12","alias_value":"A6BQ6T7FTDKQ","created_at":"2026-07-05T04:10:20Z"},{"alias_kind":"pith_short_16","alias_value":"A6BQ6T7FTDKQBS4S","created_at":"2026-07-05T04:10:20Z"},{"alias_kind":"pith_short_8","alias_value":"A6BQ6T7F","created_at":"2026-07-05T04:10:20Z"}],"graph_snapshots":[{"event_id":"sha256:0c38d5c6a344b6dc77933d029987124c3e439f001f6e549ac72def80c3cb5da0","target":"graph","created_at":"2026-07-05T04:10:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2006.15009/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Sequential decision making, commonly formalized as optimization of a Markov Decision Process, is a key challenge in artificial intelligence. Two successful approaches to MDP optimization are reinforcement learning and planning, which both largely have their own research communities. However, if both research fields solve the same problem, then we might be able to disentangle the common factors in their solution approaches. Therefore, this paper presents a unifying algorithmic framework for reinforcement learning and planning (FRAP), which identifies underlying dimensions on which MDP planning ","authors_text":"Aske Plaat, Catholijn M. Jonker, Joost Broekens, Thomas M. Moerland","cross_cats":["cs.AI","cs.RO","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-26T14:30:41Z","title":"A Unifying Framework for Reinforcement Learning and Planning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2006.15009","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:1d62e347ab6c378df54f97efcfcfc19ca1ded59f6d11e56aa55161643e153189","target":"record","created_at":"2026-07-05T04:10:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"8cada46b95507c946c1d2221e8cfb286102b86889f5210b54c14c4b2a640b4a3","cross_cats_sorted":["cs.AI","cs.RO","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-26T14:30:41Z","title_canon_sha256":"949a33da0558d24dc89f0b7abf7e9c1d925a4a355678b0fc1e1edaa97f106b0b"},"schema_version":"1.0","source":{"id":"2006.15009","kind":"arxiv","version":4}},"canonical_sha256":"07830f4fe598d500cb92f5811a527e9bd526ecf262bd7bc98b97cf7a88995ee1","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"07830f4fe598d500cb92f5811a527e9bd526ecf262bd7bc98b97cf7a88995ee1","first_computed_at":"2026-07-05T04:10:20.828262Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T04:10:20.828262Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"NN4W1XibRNq92/248ylMyBx1nrS0GWwVPXxBuTVChoaoB2Voj9RkE1WZyPh4b/JzHoAgM3piUspaKf877PlSAA==","signature_status":"signed_v1","signed_at":"2026-07-05T04:10:20.828671Z","signed_message":"canonical_sha256_bytes"},"source_id":"2006.15009","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:1d62e347ab6c378df54f97efcfcfc19ca1ded59f6d11e56aa55161643e153189","sha256:0c38d5c6a344b6dc77933d029987124c3e439f001f6e549ac72def80c3cb5da0"],"state_sha256":"736a3aaf3ffd275cd01849a9aa712edcbcc8cb546d2b7cdb3237b1e2f892b9f6"}