{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:5JLHSCXTHWOCT2ETXSMYQOY4W4","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"a712af9b19861ff4eab407b5ca188bad9b9f23c0b9181de214e639ab93863be2","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-05-30T19:48:52Z","title_canon_sha256":"da380bbca6ed1e7839fc7577c1bbc11d6ba627fca1d14999a2eb1df191bc854f"},"schema_version":"1.0","source":{"id":"2205.15400","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2205.15400","created_at":"2026-07-05T04:27:32Z"},{"alias_kind":"arxiv_version","alias_value":"2205.15400v1","created_at":"2026-07-05T04:27:32Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2205.15400","created_at":"2026-07-05T04:27:32Z"},{"alias_kind":"pith_short_12","alias_value":"5JLHSCXTHWOC","created_at":"2026-07-05T04:27:32Z"},{"alias_kind":"pith_short_16","alias_value":"5JLHSCXTHWOCT2ET","created_at":"2026-07-05T04:27:32Z"},{"alias_kind":"pith_short_8","alias_value":"5JLHSCXT","created_at":"2026-07-05T04:27:32Z"}],"graph_snapshots":[{"event_id":"sha256:6278311745dff5a8f1f190a7f621e7c377a50c4d22b264d5e2081fcc0b4bdb54","target":"graph","created_at":"2026-07-05T04:27:32Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2205.15400/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"To convey desired behavior to a Reinforcement Learning (RL) agent, a designer must choose a reward function for the environment, arguably the most important knob designers have in interacting with RL agents. Although many reward functions induce the same optimal behavior (Ng et al., 1999), in practice, some of them result in faster learning than others. In this paper, we look at how reward-design choices impact learning speed and seek to identify principles of good reward design that quickly induce target behavior. This reward-identification problem is framed as an optimization problem: Firstl","authors_text":"Henry Sowerby, Michael L. Littman, Zhiyuan Zhou","cross_cats":["cs.AI"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-05-30T19:48:52Z","title":"Designing Rewards for Fast Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2205.15400","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:437aa338cbcd99bb06de360130b323c794b6a3bb8c6c810621763ee2b301608c","target":"record","created_at":"2026-07-05T04:27:32Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"a712af9b19861ff4eab407b5ca188bad9b9f23c0b9181de214e639ab93863be2","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-05-30T19:48:52Z","title_canon_sha256":"da380bbca6ed1e7839fc7577c1bbc11d6ba627fca1d14999a2eb1df191bc854f"},"schema_version":"1.0","source":{"id":"2205.15400","kind":"arxiv","version":1}},"canonical_sha256":"ea56790af33d9c29e893bc99883b1cb703c83d6cf3f4815c641e8b2d9c868dc7","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"ea56790af33d9c29e893bc99883b1cb703c83d6cf3f4815c641e8b2d9c868dc7","first_computed_at":"2026-07-05T04:27:32.586259Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T04:27:32.586259Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"HZAvGseF+scXJVY7txwGkyTZmWXjbm46vTatGqFqaOR2TgJh0LkFCR6K2pUTbuQbDjGEQGmytJRRtWTXrombAw==","signature_status":"signed_v1","signed_at":"2026-07-05T04:27:32.586688Z","signed_message":"canonical_sha256_bytes"},"source_id":"2205.15400","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:437aa338cbcd99bb06de360130b323c794b6a3bb8c6c810621763ee2b301608c","sha256:6278311745dff5a8f1f190a7f621e7c377a50c4d22b264d5e2081fcc0b4bdb54"],"state_sha256":"26a7fa941399670ea48f3ef64df164371192cc623d3b7a7299b71809990c00da"}