{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:XULATNEEFFHY325OKQQEDND7OO","short_pith_number":"pith:XULATNEE","schema_version":"1.0","canonical_sha256":"bd1609b484294f8debae542041b47f73937718c9474f56d1d5f6bf4747609ff9","source":{"kind":"arxiv","id":"2402.07411","version":1},"attestation_state":"computed","paper":{"title":"Potential-Based Reward Shaping For Intrinsic Motivation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Arnav Jhala, Colin M. Potts, David L. Roberts, Grant C. Forbes, Leonardo Villalobos-Arias, Nitish Gupta","submitted_at":"2024-02-12T05:12:09Z","abstract_excerpt":"Recently there has been a proliferation of intrinsic motivation (IM) reward-shaping methods to learn in complex and sparse-reward environments. These methods can often inadvertently change the set of optimal policies in an environment, leading to suboptimal behavior. Previous work on mitigating the risks of reward shaping, particularly through potential-based reward shaping (PBRS), has not been applicable to many IM methods, as they are often complex, trainable functions themselves, and therefore dependent on a wider set of variables than the traditional reward functions that PBRS was develope"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.07411","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-02-12T05:12:09Z","cross_cats_sorted":[],"title_canon_sha256":"79d602849f2611e4cf3382ec1f969184e0f789e6df6b973ae95908846a6204eb","abstract_canon_sha256":"6a45fa08e9e2624ab7e71e83f8f46779df39c5927b4a937d039784b9fe2d6877"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:44:06.106798Z","signature_b64":"80m4n+vGrqYN+AqdiJ4D3BFyjPoSiz4r0xkUIdWTIzREvmhn5KsceIVCeSYqjnjlRz/93Y0yiWltwqd4kiF/Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bd1609b484294f8debae542041b47f73937718c9474f56d1d5f6bf4747609ff9","last_reissued_at":"2026-07-05T07:44:06.106310Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:44:06.106310Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Potential-Based Reward Shaping For Intrinsic Motivation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Arnav Jhala, Colin M. Potts, David L. Roberts, Grant C. Forbes, Leonardo Villalobos-Arias, Nitish Gupta","submitted_at":"2024-02-12T05:12:09Z","abstract_excerpt":"Recently there has been a proliferation of intrinsic motivation (IM) reward-shaping methods to learn in complex and sparse-reward environments. These methods can often inadvertently change the set of optimal policies in an environment, leading to suboptimal behavior. Previous work on mitigating the risks of reward shaping, particularly through potential-based reward shaping (PBRS), has not been applicable to many IM methods, as they are often complex, trainable functions themselves, and therefore dependent on a wider set of variables than the traditional reward functions that PBRS was develope"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.07411","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.07411/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.07411","created_at":"2026-07-05T07:44:06.106378+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.07411v1","created_at":"2026-07-05T07:44:06.106378+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.07411","created_at":"2026-07-05T07:44:06.106378+00:00"},{"alias_kind":"pith_short_12","alias_value":"XULATNEEFFHY","created_at":"2026-07-05T07:44:06.106378+00:00"},{"alias_kind":"pith_short_16","alias_value":"XULATNEEFFHY325O","created_at":"2026-07-05T07:44:06.106378+00:00"},{"alias_kind":"pith_short_8","alias_value":"XULATNEE","created_at":"2026-07-05T07:44:06.106378+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO","json":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO.json","graph_json":"https://pith.science/api/pith-number/XULATNEEFFHY325OKQQEDND7OO/graph.json","events_json":"https://pith.science/api/pith-number/XULATNEEFFHY325OKQQEDND7OO/events.json","paper":"https://pith.science/paper/XULATNEE"},"agent_actions":{"view_html":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO","download_json":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO.json","view_paper":"https://pith.science/paper/XULATNEE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.07411&json=true","fetch_graph":"https://pith.science/api/pith-number/XULATNEEFFHY325OKQQEDND7OO/graph.json","fetch_events":"https://pith.science/api/pith-number/XULATNEEFFHY325OKQQEDND7OO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO/action/storage_attestation","attest_author":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO/action/author_attestation","sign_citation":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO/action/citation_signature","submit_replication":"https://pith.science/pith/XULATNEEFFHY325OKQQEDND7OO/action/replication_record"}},"created_at":"2026-07-05T07:44:06.106378+00:00","updated_at":"2026-07-05T07:44:06.106378+00:00"}