{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2021:IGXIJ27K3Z4P6JUER7DZIFHXHP","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"58601b756b82218d63da1f488ed178a0e54481c7bef27d2f3c0df37deaaf6e94","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-11-26T13:23:36Z","title_canon_sha256":"9788ddc2dc66a9871a8162ddb9b3a5b231823c2eb134b1154139bfb3c14e386b"},"schema_version":"1.0","source":{"id":"2111.13485","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2111.13485","created_at":"2026-07-05T04:06:01Z"},{"alias_kind":"arxiv_version","alias_value":"2111.13485v2","created_at":"2026-07-05T04:06:01Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2111.13485","created_at":"2026-07-05T04:06:01Z"},{"alias_kind":"pith_short_12","alias_value":"IGXIJ27K3Z4P","created_at":"2026-07-05T04:06:01Z"},{"alias_kind":"pith_short_16","alias_value":"IGXIJ27K3Z4P6JUE","created_at":"2026-07-05T04:06:01Z"},{"alias_kind":"pith_short_8","alias_value":"IGXIJ27K","created_at":"2026-07-05T04:06:01Z"}],"graph_snapshots":[{"event_id":"sha256:a320568532ff051dfb4d8fab6012604c99f22ff8a28223e6566ddae5fc88da87","target":"graph","created_at":"2026-07-05T04:06:01Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2111.13485/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Many practical applications of reinforcement learning require agents to learn from sparse and delayed rewards. It challenges the ability of agents to attribute their actions to future outcomes. In this paper, we consider the problem formulation of episodic reinforcement learning with trajectory feedback. It refers to an extreme delay of reward signals, in which the agent can only obtain one reward signal at the end of each trajectory. A popular paradigm for this problem setting is learning with a designed auxiliary dense reward function, namely proxy reward, instead of sparse environmental sig","authors_text":"Jian Peng, Ruihan Guo, Yuan Zhou, Zhizhou Ren","cross_cats":["cs.AI","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-11-26T13:23:36Z","title":"Learning Long-Term Reward Redistribution via Randomized Return Decomposition"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2111.13485","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:d802c2899a19a2a4a4b8589cdef0e85f2d6af7bc74b97c8a9d7f82e57b71eb28","target":"record","created_at":"2026-07-05T04:06:01Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"58601b756b82218d63da1f488ed178a0e54481c7bef27d2f3c0df37deaaf6e94","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-11-26T13:23:36Z","title_canon_sha256":"9788ddc2dc66a9871a8162ddb9b3a5b231823c2eb134b1154139bfb3c14e386b"},"schema_version":"1.0","source":{"id":"2111.13485","kind":"arxiv","version":2}},"canonical_sha256":"41ae84ebeade78ff26848fc79414f73be8551a95c7bec78c6bdfd1881f72273f","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"41ae84ebeade78ff26848fc79414f73be8551a95c7bec78c6bdfd1881f72273f","first_computed_at":"2026-07-05T04:06:01.238588Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T04:06:01.238588Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"IjhNW9z9xZl9gwNz+/k0Qvx9OQN8y0+RZvO8d9JQbNi2WWdFQIqXywY11UELKVIWSw5aqVDhI2MfjKmSCK+dBw==","signature_status":"signed_v1","signed_at":"2026-07-05T04:06:01.239025Z","signed_message":"canonical_sha256_bytes"},"source_id":"2111.13485","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:d802c2899a19a2a4a4b8589cdef0e85f2d6af7bc74b97c8a9d7f82e57b71eb28","sha256:a320568532ff051dfb4d8fab6012604c99f22ff8a28223e6566ddae5fc88da87"],"state_sha256":"ba5be8b6f4d015a705342ac853e3d11541faae73caf23f92a16a0891db66d9e3"}