{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:2WD4A6QA44F5TMGWF6AYCTAO5R","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"ed27654126e7ec333c4b9e6b0c5045881128498ce88d52440830021f2189e181","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-11-04T02:10:35Z","title_canon_sha256":"e0b2be558b15bbe796e398f2bcebddd44662e28aa2efd20e6ca2a5770396f45b"},"schema_version":"1.0","source":{"id":"2211.02222","kind":"arxiv","version":3}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2211.02222","created_at":"2026-07-05T06:28:56Z"},{"alias_kind":"arxiv_version","alias_value":"2211.02222v3","created_at":"2026-07-05T06:28:56Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2211.02222","created_at":"2026-07-05T06:28:56Z"},{"alias_kind":"pith_short_12","alias_value":"2WD4A6QA44F5","created_at":"2026-07-05T06:28:56Z"},{"alias_kind":"pith_short_16","alias_value":"2WD4A6QA44F5TMGW","created_at":"2026-07-05T06:28:56Z"},{"alias_kind":"pith_short_8","alias_value":"2WD4A6QA","created_at":"2026-07-05T06:28:56Z"}],"graph_snapshots":[{"event_id":"sha256:466aef03e71dc8a2a244e825fa503f39b9b66b5851d6a98009d8af3904ace401","target":"graph","created_at":"2026-07-05T06:28:56Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2211.02222/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Model-Based Reinforcement Learning (RL) is widely believed to have the potential to improve sample efficiency by allowing an agent to synthesize large amounts of imagined experience. Experience Replay (ER) can be considered a simple kind of model, which has proved effective at improving the stability and efficiency of deep RL. In principle, a learned parametric model could improve on ER by generalizing from real experience to augment the dataset with additional plausible experience. However, given that learned value functions can also generalize, it is not immediately obvious why model general","authors_text":"Aditya Ramesh, J\\\"urgen Schmidhuber, Kenny Young, Louis Kirsch","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-11-04T02:10:35Z","title":"The Benefits of Model-Based Generalization in Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2211.02222","kind":"arxiv","version":3},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:a0197bf57697e3565e5c24dbf0a929c72fd79a0f2d26b6faab1e967ca18126e6","target":"record","created_at":"2026-07-05T06:28:56Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"ed27654126e7ec333c4b9e6b0c5045881128498ce88d52440830021f2189e181","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-11-04T02:10:35Z","title_canon_sha256":"e0b2be558b15bbe796e398f2bcebddd44662e28aa2efd20e6ca2a5770396f45b"},"schema_version":"1.0","source":{"id":"2211.02222","kind":"arxiv","version":3}},"canonical_sha256":"d587c07a00e70bd9b0d62f81814c0eec47d893df81937e96f1a1c5f0fd9b647f","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"d587c07a00e70bd9b0d62f81814c0eec47d893df81937e96f1a1c5f0fd9b647f","first_computed_at":"2026-07-05T06:28:56.882779Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T06:28:56.882779Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"0ohHunIMtu0vHfE6n3pB39tAs1Dm3vfsWrvLs0X0gLD0uSJkn8MZ2G6p4kGXlYkYE8VPwo9EwZLtcrAT4UCECA==","signature_status":"signed_v1","signed_at":"2026-07-05T06:28:56.883271Z","signed_message":"canonical_sha256_bytes"},"source_id":"2211.02222","source_kind":"arxiv","source_version":3}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:a0197bf57697e3565e5c24dbf0a929c72fd79a0f2d26b6faab1e967ca18126e6","sha256:466aef03e71dc8a2a244e825fa503f39b9b66b5851d6a98009d8af3904ace401"],"state_sha256":"c418ee316dd4d1b40e98311425b0fab40057bd7ec18621ff862c45024ca65c20"}