{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:ZZOEOWFPKVYKEU73P7UMMZQ66P","short_pith_number":"pith:ZZOEOWFP","canonical_record":{"source":{"id":"2501.12627","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-22T04:22:13Z","cross_cats_sorted":[],"title_canon_sha256":"3839ce09f7f63aaa65e55bf5048d485c9bb072666f0118c3c6397042314057f0","abstract_canon_sha256":"64a8ae079279a60f64a7e6471936c82c472bdcea55d88e150ca301f4f69bb382"},"schema_version":"1.0"},"canonical_sha256":"ce5c4758af5570a253fb7fe8c6661ef3f0adc867c3f4034414801d8fba95a349","source":{"kind":"arxiv","id":"2501.12627","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.12627","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"arxiv_version","alias_value":"2501.12627v1","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.12627","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"pith_short_12","alias_value":"ZZOEOWFPKVYK","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"pith_short_16","alias_value":"ZZOEOWFPKVYKEU73","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"pith_short_8","alias_value":"ZZOEOWFP","created_at":"2026-07-05T10:03:55Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:ZZOEOWFPKVYKEU73P7UMMZQ66P","target":"record","payload":{"canonical_record":{"source":{"id":"2501.12627","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-22T04:22:13Z","cross_cats_sorted":[],"title_canon_sha256":"3839ce09f7f63aaa65e55bf5048d485c9bb072666f0118c3c6397042314057f0","abstract_canon_sha256":"64a8ae079279a60f64a7e6471936c82c472bdcea55d88e150ca301f4f69bb382"},"schema_version":"1.0"},"canonical_sha256":"ce5c4758af5570a253fb7fe8c6661ef3f0adc867c3f4034414801d8fba95a349","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:03:55.949571Z","signature_b64":"gOo5RSGyd8KpkOljORFkJSrWSHl7KOrSmcj7JSmgyqdYDh0BBRBEKQlrZE+MRP/HiaA3yHMegZJiGAq9NZMLAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ce5c4758af5570a253fb7fe8c6661ef3f0adc867c3f4034414801d8fba95a349","last_reissued_at":"2026-07-05T10:03:55.949057Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:03:55.949057Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2501.12627","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:03:55Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"DRDaqjQqlAiD7Fn+GR7MR+DJZ9QCwyHGWxEU5QFVzV4pPa9dWKrmqnV7fMmwBMKgIHK4RnCMlAg9lgVqHuFIBw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-12T08:01:08.604495Z"},"content_sha256":"3e38e071be01874b3acfaacfa62cccf4e7089fc63bf66d0fd6c3404b0ac075c8","schema_version":"1.0","event_id":"sha256:3e38e071be01874b3acfaacfa62cccf4e7089fc63bf66d0fd6c3404b0ac075c8"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:ZZOEOWFPKVYKEU73P7UMMZQ66P","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Li, Mingqi Yuan, Wenjun Zeng, Xin Jin","submitted_at":"2025-01-22T04:22:13Z","abstract_excerpt":"Intrinsic reward shaping has emerged as a prevalent approach to solving hard-exploration and sparse-rewards environments in reinforcement learning (RL). While single intrinsic rewards, such as curiosity-driven or novelty-based methods, have shown effectiveness, they often limit the diversity and efficiency of exploration. Moreover, the potential and principle of combining multiple intrinsic rewards remains insufficiently explored. To address this gap, we introduce HIRE (Hybrid Intrinsic REward), a flexible and elegant framework for creating hybrid intrinsic rewards through deliberate fusion st"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.12627","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.12627/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:03:55Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"fN1ghoCsc+W9h29WncTKjpLhISbcJ4Pmo5GXwVY0TsHHHW+e1byqXSVMFdNUKhAmVe9/HrflWkuoM1075dtfDg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-12T08:01:08.605054Z"},"content_sha256":"f2b6e8c14847e4cbfc8800078e8f2904722e4ee3c46c020ab362a956f3e06c98","schema_version":"1.0","event_id":"sha256:f2b6e8c14847e4cbfc8800078e8f2904722e4ee3c46c020ab362a956f3e06c98"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P/bundle.json","state_url":"https://pith.science/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-12T08:01:08Z","links":{"resolver":"https://pith.science/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P","bundle":"https://pith.science/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P/bundle.json","state":"https://pith.science/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P/state.json","well_known_bundle":"https://pith.science/.well-known/pith/ZZOEOWFPKVYKEU73P7UMMZQ66P/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:ZZOEOWFPKVYKEU73P7UMMZQ66P","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"64a8ae079279a60f64a7e6471936c82c472bdcea55d88e150ca301f4f69bb382","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-22T04:22:13Z","title_canon_sha256":"3839ce09f7f63aaa65e55bf5048d485c9bb072666f0118c3c6397042314057f0"},"schema_version":"1.0","source":{"id":"2501.12627","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.12627","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"arxiv_version","alias_value":"2501.12627v1","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.12627","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"pith_short_12","alias_value":"ZZOEOWFPKVYK","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"pith_short_16","alias_value":"ZZOEOWFPKVYKEU73","created_at":"2026-07-05T10:03:55Z"},{"alias_kind":"pith_short_8","alias_value":"ZZOEOWFP","created_at":"2026-07-05T10:03:55Z"}],"graph_snapshots":[{"event_id":"sha256:f2b6e8c14847e4cbfc8800078e8f2904722e4ee3c46c020ab362a956f3e06c98","target":"graph","created_at":"2026-07-05T10:03:55Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2501.12627/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Intrinsic reward shaping has emerged as a prevalent approach to solving hard-exploration and sparse-rewards environments in reinforcement learning (RL). While single intrinsic rewards, such as curiosity-driven or novelty-based methods, have shown effectiveness, they often limit the diversity and efficiency of exploration. Moreover, the potential and principle of combining multiple intrinsic rewards remains insufficiently explored. To address this gap, we introduce HIRE (Hybrid Intrinsic REward), a flexible and elegant framework for creating hybrid intrinsic rewards through deliberate fusion st","authors_text":"Bo Li, Mingqi Yuan, Wenjun Zeng, Xin Jin","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.12627","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:3e38e071be01874b3acfaacfa62cccf4e7089fc63bf66d0fd6c3404b0ac075c8","target":"record","created_at":"2026-07-05T10:03:55Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"64a8ae079279a60f64a7e6471936c82c472bdcea55d88e150ca301f4f69bb382","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-22T04:22:13Z","title_canon_sha256":"3839ce09f7f63aaa65e55bf5048d485c9bb072666f0118c3c6397042314057f0"},"schema_version":"1.0","source":{"id":"2501.12627","kind":"arxiv","version":1}},"canonical_sha256":"ce5c4758af5570a253fb7fe8c6661ef3f0adc867c3f4034414801d8fba95a349","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"ce5c4758af5570a253fb7fe8c6661ef3f0adc867c3f4034414801d8fba95a349","first_computed_at":"2026-07-05T10:03:55.949057Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:03:55.949057Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"gOo5RSGyd8KpkOljORFkJSrWSHl7KOrSmcj7JSmgyqdYDh0BBRBEKQlrZE+MRP/HiaA3yHMegZJiGAq9NZMLAw==","signature_status":"signed_v1","signed_at":"2026-07-05T10:03:55.949571Z","signed_message":"canonical_sha256_bytes"},"source_id":"2501.12627","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:3e38e071be01874b3acfaacfa62cccf4e7089fc63bf66d0fd6c3404b0ac075c8","sha256:f2b6e8c14847e4cbfc8800078e8f2904722e4ee3c46c020ab362a956f3e06c98"],"state_sha256":"6773d0e70ce88c309cd23b4ea3962788c189c8364f6ff105f3391c2f4559d85b"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"iG+GtV1P04b7UJkoMSLe51HEY5M1cnoeTMess4Ac2V5+wGeT7MgRkI2gscmRihWYfP5+TLZeONp4JLCdVn43BQ==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-12T08:01:08.610310Z","bundle_sha256":"b6c7320ddc89e8473bc835c88c5c703d851b798d3d211a4f153abf30a483acca"}}