{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2024:AF54M76B6I2CK24Y6ARE3XAX2M","short_pith_number":"pith:AF54M76B","canonical_record":{"source":{"id":"2411.18892","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-11-28T03:53:14Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"3f6a88c7bb876b968899439ce23755ec8a9962cad7961f8eb52c9b5e95b980fa","abstract_canon_sha256":"643a547166762d8701fb0af19892de5589219204edbddc7e96af53edfe90551a"},"schema_version":"1.0"},"canonical_sha256":"017bc67fc1f234256b98f0224ddc17d32d6018102287301e656a4f7fa5aab41e","source":{"kind":"arxiv","id":"2411.18892","version":2},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2411.18892","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"arxiv_version","alias_value":"2411.18892v2","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.18892","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"pith_short_12","alias_value":"AF54M76B6I2C","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"pith_short_16","alias_value":"AF54M76B6I2CK24Y","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"pith_short_8","alias_value":"AF54M76B","created_at":"2026-07-05T10:08:25Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2024:AF54M76B6I2CK24Y6ARE3XAX2M","target":"record","payload":{"canonical_record":{"source":{"id":"2411.18892","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-11-28T03:53:14Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"3f6a88c7bb876b968899439ce23755ec8a9962cad7961f8eb52c9b5e95b980fa","abstract_canon_sha256":"643a547166762d8701fb0af19892de5589219204edbddc7e96af53edfe90551a"},"schema_version":"1.0"},"canonical_sha256":"017bc67fc1f234256b98f0224ddc17d32d6018102287301e656a4f7fa5aab41e","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:08:25.401643Z","signature_b64":"VKRLJgIcOe83yrIqU34MojzrSogVFUFXxTG4+62OYR+nnUl8sVUv3UoqQTRkDajrJ+2zspTdTeIE2F+waawvDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"017bc67fc1f234256b98f0224ddc17d32d6018102287301e656a4f7fa5aab41e","last_reissued_at":"2026-07-05T10:08:25.401172Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:08:25.401172Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2411.18892","source_version":2,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:08:25Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"rWm7ig7Z6ZNodQp0VPGg+uoB30udZ69BbkypNGAZucMCVlivWJv/qQMVxApyi9lHy4C3e+biAR6+x4lJ0+fHBg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-06T12:24:35.155053Z"},"content_sha256":"3c39b56be875277b20b1f2db4f6c717e69d9810a1570500d70cf716fc423b953","schema_version":"1.0","event_id":"sha256:3c39b56be875277b20b1f2db4f6c717e69d9810a1570500d70cf716fc423b953"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2024:AF54M76B6I2CK24Y6ARE3XAX2M","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"A Comprehensive Survey of Reinforcement Learning: From Algorithms to Practical Challenges","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.AI","authors_text":"Amir Hossein Moosavi, Dariush Ebrahimi, Majid Ghasemi","submitted_at":"2024-11-28T03:53:14Z","abstract_excerpt":"Reinforcement Learning (RL) has emerged as a powerful paradigm in Artificial Intelligence (AI), enabling agents to learn optimal behaviors through interactions with their environments. Drawing from the foundations of trial and error, RL equips agents to make informed decisions through feedback in the form of rewards or penalties. This paper presents a comprehensive survey of RL, meticulously analyzing a wide range of algorithms, from foundational tabular methods to advanced Deep Reinforcement Learning (DRL) techniques. We categorize and evaluate these algorithms based on key criteria such as s"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.18892","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.18892/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:08:25Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"lPAdP9vkkR7/Zv9ZRE7sJIV7tCFDyMu4ewP8XcnyA4i2qljhMNJnF3mmBbd5F2s6ejTtLFxGh2RTgV0qW6XVBw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-06T12:24:35.155955Z"},"content_sha256":"19052fe71d9caaa7363995665286d2728665ff4ed65b6b1bbcba50333a152c7b","schema_version":"1.0","event_id":"sha256:19052fe71d9caaa7363995665286d2728665ff4ed65b6b1bbcba50333a152c7b"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/AF54M76B6I2CK24Y6ARE3XAX2M/bundle.json","state_url":"https://pith.science/pith/AF54M76B6I2CK24Y6ARE3XAX2M/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/AF54M76B6I2CK24Y6ARE3XAX2M/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-06T12:24:35Z","links":{"resolver":"https://pith.science/pith/AF54M76B6I2CK24Y6ARE3XAX2M","bundle":"https://pith.science/pith/AF54M76B6I2CK24Y6ARE3XAX2M/bundle.json","state":"https://pith.science/pith/AF54M76B6I2CK24Y6ARE3XAX2M/state.json","well_known_bundle":"https://pith.science/.well-known/pith/AF54M76B6I2CK24Y6ARE3XAX2M/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:AF54M76B6I2CK24Y6ARE3XAX2M","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"643a547166762d8701fb0af19892de5589219204edbddc7e96af53edfe90551a","cross_cats_sorted":["cs.LG"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-11-28T03:53:14Z","title_canon_sha256":"3f6a88c7bb876b968899439ce23755ec8a9962cad7961f8eb52c9b5e95b980fa"},"schema_version":"1.0","source":{"id":"2411.18892","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2411.18892","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"arxiv_version","alias_value":"2411.18892v2","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.18892","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"pith_short_12","alias_value":"AF54M76B6I2C","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"pith_short_16","alias_value":"AF54M76B6I2CK24Y","created_at":"2026-07-05T10:08:25Z"},{"alias_kind":"pith_short_8","alias_value":"AF54M76B","created_at":"2026-07-05T10:08:25Z"}],"graph_snapshots":[{"event_id":"sha256:19052fe71d9caaa7363995665286d2728665ff4ed65b6b1bbcba50333a152c7b","target":"graph","created_at":"2026-07-05T10:08:25Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2411.18892/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement Learning (RL) has emerged as a powerful paradigm in Artificial Intelligence (AI), enabling agents to learn optimal behaviors through interactions with their environments. Drawing from the foundations of trial and error, RL equips agents to make informed decisions through feedback in the form of rewards or penalties. This paper presents a comprehensive survey of RL, meticulously analyzing a wide range of algorithms, from foundational tabular methods to advanced Deep Reinforcement Learning (DRL) techniques. We categorize and evaluate these algorithms based on key criteria such as s","authors_text":"Amir Hossein Moosavi, Dariush Ebrahimi, Majid Ghasemi","cross_cats":["cs.LG"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-11-28T03:53:14Z","title":"A Comprehensive Survey of Reinforcement Learning: From Algorithms to Practical Challenges"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.18892","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:3c39b56be875277b20b1f2db4f6c717e69d9810a1570500d70cf716fc423b953","target":"record","created_at":"2026-07-05T10:08:25Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"643a547166762d8701fb0af19892de5589219204edbddc7e96af53edfe90551a","cross_cats_sorted":["cs.LG"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-11-28T03:53:14Z","title_canon_sha256":"3f6a88c7bb876b968899439ce23755ec8a9962cad7961f8eb52c9b5e95b980fa"},"schema_version":"1.0","source":{"id":"2411.18892","kind":"arxiv","version":2}},"canonical_sha256":"017bc67fc1f234256b98f0224ddc17d32d6018102287301e656a4f7fa5aab41e","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"017bc67fc1f234256b98f0224ddc17d32d6018102287301e656a4f7fa5aab41e","first_computed_at":"2026-07-05T10:08:25.401172Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:08:25.401172Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"VKRLJgIcOe83yrIqU34MojzrSogVFUFXxTG4+62OYR+nnUl8sVUv3UoqQTRkDajrJ+2zspTdTeIE2F+waawvDQ==","signature_status":"signed_v1","signed_at":"2026-07-05T10:08:25.401643Z","signed_message":"canonical_sha256_bytes"},"source_id":"2411.18892","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:3c39b56be875277b20b1f2db4f6c717e69d9810a1570500d70cf716fc423b953","sha256:19052fe71d9caaa7363995665286d2728665ff4ed65b6b1bbcba50333a152c7b"],"state_sha256":"d9c89a439b507bd5826a5a57960092d15456b8e454b2551512c1e512a7a9c362"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"AKoYQS6XNGbQSt1/JJVzWLO35bFcxB654pMsdLJFVrQ2Np2gbuFq4EYWKQnJaJMEXlVvT6Ati4i1saERZAdoAg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-06T12:24:35.160486Z","bundle_sha256":"b76bb91d6d6fdbeeb342eb5e3a5ca2304ac5038ad515c70364a8b511a46ee65e"}}