{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2022:D57TLX5ZHME3FIQMBQAPODU74X","short_pith_number":"pith:D57TLX5Z","canonical_record":{"source":{"id":"2209.14488","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T00:42:44Z","cross_cats_sorted":[],"title_canon_sha256":"09b394dc4fa1e3667a4be0acc2ba8682935befb9138dba4abf29c3057316f708","abstract_canon_sha256":"9696696ee555c7ecbd9576f2b68195378b76cdb17790d5d146f11a141fa52ca8"},"schema_version":"1.0"},"canonical_sha256":"1f7f35dfb93b09b2a20c0c00f70e9fe5dcf130c0d57ab86c94211518c8dac26a","source":{"kind":"arxiv","id":"2209.14488","version":2},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2209.14488","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"arxiv_version","alias_value":"2209.14488v2","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2209.14488","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"pith_short_12","alias_value":"D57TLX5ZHME3","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"pith_short_16","alias_value":"D57TLX5ZHME3FIQM","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"pith_short_8","alias_value":"D57TLX5Z","created_at":"2026-07-05T06:06:28Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2022:D57TLX5ZHME3FIQMBQAPODU74X","target":"record","payload":{"canonical_record":{"source":{"id":"2209.14488","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T00:42:44Z","cross_cats_sorted":[],"title_canon_sha256":"09b394dc4fa1e3667a4be0acc2ba8682935befb9138dba4abf29c3057316f708","abstract_canon_sha256":"9696696ee555c7ecbd9576f2b68195378b76cdb17790d5d146f11a141fa52ca8"},"schema_version":"1.0"},"canonical_sha256":"1f7f35dfb93b09b2a20c0c00f70e9fe5dcf130c0d57ab86c94211518c8dac26a","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:06:28.821446Z","signature_b64":"tjLZVRRKCMCc5ELZmTl8b+wkmIKjfTD2cNZMRB0DVANu7OM4MNLh8LfnUEQ2L98cgj0U5vUU5D5sVCQSGBOeBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1f7f35dfb93b09b2a20c0c00f70e9fe5dcf130c0d57ab86c94211518c8dac26a","last_reissued_at":"2026-07-05T06:06:28.820867Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:06:28.820867Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2209.14488","source_version":2,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T06:06:28Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"zn3hutZFmhICuNmgBNYeFwgjs5u2hebzEzBzYfbkdOc8T9pAlNjL9+FqOrdE7wLdd6uvnvoe2DslHw558IN+Ag==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-08T09:22:29.379394Z"},"content_sha256":"52df23291fa6d1f111bbf9f6da4fc46ae4eca5c56deab485abdd4fef708dbffe","schema_version":"1.0","event_id":"sha256:52df23291fa6d1f111bbf9f6da4fc46ae4eca5c56deab485abdd4fef708dbffe"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2022:D57TLX5ZHME3FIQMBQAPODU74X","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Gang Chen, Victoria Huang","submitted_at":"2022-09-29T00:42:44Z","abstract_excerpt":"Actor-critic deep reinforcement learning (DRL) algorithms have recently achieved prominent success in tackling various challenging reinforcement learning (RL) problems, particularly complex control tasks with high-dimensional continuous state and action spaces. Nevertheless, existing research showed that actor-critic DRL algorithms often failed to explore their learning environments effectively, resulting in limited learning stability and performance. To address this limitation, several ensemble DRL algorithms have been proposed lately to boost exploration and stabilize the learning process. H"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2209.14488","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2209.14488/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T06:06:28Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"XWakm7iNwBXQeNVtRIG2iCeQj7zAmsq/hZu9tE4laLsazNGH63UO8axoMioObeuVtj7Y10oTL8NWW+AoDkmRDw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-08T09:22:29.379904Z"},"content_sha256":"9684611e85946b3487cc5b4ca64ee1ee6f7d1f5b6b98c8de8fc75c189661aa5b","schema_version":"1.0","event_id":"sha256:9684611e85946b3487cc5b4ca64ee1ee6f7d1f5b6b98c8de8fc75c189661aa5b"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/D57TLX5ZHME3FIQMBQAPODU74X/bundle.json","state_url":"https://pith.science/pith/D57TLX5ZHME3FIQMBQAPODU74X/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/D57TLX5ZHME3FIQMBQAPODU74X/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-08T09:22:29Z","links":{"resolver":"https://pith.science/pith/D57TLX5ZHME3FIQMBQAPODU74X","bundle":"https://pith.science/pith/D57TLX5ZHME3FIQMBQAPODU74X/bundle.json","state":"https://pith.science/pith/D57TLX5ZHME3FIQMBQAPODU74X/state.json","well_known_bundle":"https://pith.science/.well-known/pith/D57TLX5ZHME3FIQMBQAPODU74X/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:D57TLX5ZHME3FIQMBQAPODU74X","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"9696696ee555c7ecbd9576f2b68195378b76cdb17790d5d146f11a141fa52ca8","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T00:42:44Z","title_canon_sha256":"09b394dc4fa1e3667a4be0acc2ba8682935befb9138dba4abf29c3057316f708"},"schema_version":"1.0","source":{"id":"2209.14488","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2209.14488","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"arxiv_version","alias_value":"2209.14488v2","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2209.14488","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"pith_short_12","alias_value":"D57TLX5ZHME3","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"pith_short_16","alias_value":"D57TLX5ZHME3FIQM","created_at":"2026-07-05T06:06:28Z"},{"alias_kind":"pith_short_8","alias_value":"D57TLX5Z","created_at":"2026-07-05T06:06:28Z"}],"graph_snapshots":[{"event_id":"sha256:9684611e85946b3487cc5b4ca64ee1ee6f7d1f5b6b98c8de8fc75c189661aa5b","target":"graph","created_at":"2026-07-05T06:06:28Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2209.14488/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Actor-critic deep reinforcement learning (DRL) algorithms have recently achieved prominent success in tackling various challenging reinforcement learning (RL) problems, particularly complex control tasks with high-dimensional continuous state and action spaces. Nevertheless, existing research showed that actor-critic DRL algorithms often failed to explore their learning environments effectively, resulting in limited learning stability and performance. To address this limitation, several ensemble DRL algorithms have been proposed lately to boost exploration and stabilize the learning process. H","authors_text":"Gang Chen, Victoria Huang","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T00:42:44Z","title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2209.14488","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:52df23291fa6d1f111bbf9f6da4fc46ae4eca5c56deab485abdd4fef708dbffe","target":"record","created_at":"2026-07-05T06:06:28Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"9696696ee555c7ecbd9576f2b68195378b76cdb17790d5d146f11a141fa52ca8","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T00:42:44Z","title_canon_sha256":"09b394dc4fa1e3667a4be0acc2ba8682935befb9138dba4abf29c3057316f708"},"schema_version":"1.0","source":{"id":"2209.14488","kind":"arxiv","version":2}},"canonical_sha256":"1f7f35dfb93b09b2a20c0c00f70e9fe5dcf130c0d57ab86c94211518c8dac26a","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"1f7f35dfb93b09b2a20c0c00f70e9fe5dcf130c0d57ab86c94211518c8dac26a","first_computed_at":"2026-07-05T06:06:28.820867Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T06:06:28.820867Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"tjLZVRRKCMCc5ELZmTl8b+wkmIKjfTD2cNZMRB0DVANu7OM4MNLh8LfnUEQ2L98cgj0U5vUU5D5sVCQSGBOeBg==","signature_status":"signed_v1","signed_at":"2026-07-05T06:06:28.821446Z","signed_message":"canonical_sha256_bytes"},"source_id":"2209.14488","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:52df23291fa6d1f111bbf9f6da4fc46ae4eca5c56deab485abdd4fef708dbffe","sha256:9684611e85946b3487cc5b4ca64ee1ee6f7d1f5b6b98c8de8fc75c189661aa5b"],"state_sha256":"82550005fc7e1c9fcf83d48a0656346105d9c8e32c44a7d7c88c69bdbeeee210"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"kHl80OQ7xSp1FWviY22CeUjqx6rCiH34osXwcDgFjYmz6ILs0ys8V+GbiCgoFLzPHC3sLXP4TLr111twisyHCg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-08T09:22:29.384593Z","bundle_sha256":"52bd7734dc8e6b53cbb9dbe1df0d2a3eaf2da0a2391dd04b0f99bd32d9e32fbf"}}