{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:HJVTEPESKNCA54X6OMFTFVH47R","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"cdde1269487098cf4f3a604e80a2e3a4447b522aa00302e57a60eaf3ea5d3171","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.IR","submitted_at":"2025-06-27T10:46:41Z","title_canon_sha256":"dcee6638709df6899b6560ff2f18338b5b514e372f8d614794938e5fdcbdf1a5"},"schema_version":"1.0","source":{"id":"2506.22112","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2506.22112","created_at":"2026-07-05T11:29:14Z"},{"alias_kind":"arxiv_version","alias_value":"2506.22112v2","created_at":"2026-07-05T11:29:14Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.22112","created_at":"2026-07-05T11:29:14Z"},{"alias_kind":"pith_short_12","alias_value":"HJVTEPESKNCA","created_at":"2026-07-05T11:29:14Z"},{"alias_kind":"pith_short_16","alias_value":"HJVTEPESKNCA54X6","created_at":"2026-07-05T11:29:14Z"},{"alias_kind":"pith_short_8","alias_value":"HJVTEPES","created_at":"2026-07-05T11:29:14Z"}],"graph_snapshots":[{"event_id":"sha256:b84962f0c7d2681bd6f01e4e909cc56a8f36b7390b6c752ec8b2a97b45b1e6f0","target":"graph","created_at":"2026-07-05T11:29:14Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2506.22112/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Offline reinforcement learning (RL) has emerged as a prevalent and effective methodology for real-world recommender systems, enabling learning policies from historical data and capturing user preferences. In offline RL, reward shaping encounters significant challenges, with past efforts to incorporate prior strategies for uncertainty to improve world models or penalize underexplored state-action pairs. Despite these efforts, a critical gap remains: the simultaneous balancing of intrinsic biases in world models and the diversity of policy recommendations. To address this limitation, we present ","authors_text":"Fan Zhou, Ning Luo, Peng Jiang, Teng Sha, Wenzheng Shu, Xialong Liu, Yanhua Cheng, Yanxiang Zeng, Yongxiang Tang","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.IR","submitted_at":"2025-06-27T10:46:41Z","title":"Reward Balancing Revisited: Enhancing Offline Reinforcement Learning for Recommender Systems"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.22112","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:999aa2d15b3b37b824def7c9a32be12e965242e8e4b2d0aba5df4a616b398bc4","target":"record","created_at":"2026-07-05T11:29:14Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"cdde1269487098cf4f3a604e80a2e3a4447b522aa00302e57a60eaf3ea5d3171","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.IR","submitted_at":"2025-06-27T10:46:41Z","title_canon_sha256":"dcee6638709df6899b6560ff2f18338b5b514e372f8d614794938e5fdcbdf1a5"},"schema_version":"1.0","source":{"id":"2506.22112","kind":"arxiv","version":2}},"canonical_sha256":"3a6b323c9253440ef2fe730b32d4fcfc42c5946cf96ec98cc3adda3d0bce90af","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"3a6b323c9253440ef2fe730b32d4fcfc42c5946cf96ec98cc3adda3d0bce90af","first_computed_at":"2026-07-05T11:29:14.658038Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:29:14.658038Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"X6q4A5sBzguXFAzZCBWkvwzhG8SzkP+7gm01gx17e4oF3Uk3MnpbGKkCR400JPLO3AGwEfbH7saUhnp7qf/JAg==","signature_status":"signed_v1","signed_at":"2026-07-05T11:29:14.658603Z","signed_message":"canonical_sha256_bytes"},"source_id":"2506.22112","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:999aa2d15b3b37b824def7c9a32be12e965242e8e4b2d0aba5df4a616b398bc4","sha256:b84962f0c7d2681bd6f01e4e909cc56a8f36b7390b6c752ec8b2a97b45b1e6f0"],"state_sha256":"8b0316264d958af4f03401af773d7b1f910b13f0eabf3a4a18c74a56f4621cf4"}