{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:QGWRCRHCKKPRP6GCVGWNZZVYPO","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"751377cef871023c7c86fa96e27b4294b5835e5fb19bc99fecd0e80c814ad9f6","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-09-03T15:28:51Z","title_canon_sha256":"79857f4a8e61316b6ce91350f90e3b5c94f1f56f94fa260e9593d0cca26d72b5"},"schema_version":"1.0","source":{"id":"2509.03403","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2509.03403","created_at":"2026-05-20T00:02:06Z"},{"alias_kind":"arxiv_version","alias_value":"2509.03403v2","created_at":"2026-05-20T00:02:06Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.03403","created_at":"2026-05-20T00:02:06Z"},{"alias_kind":"pith_short_12","alias_value":"QGWRCRHCKKPR","created_at":"2026-05-20T00:02:06Z"},{"alias_kind":"pith_short_16","alias_value":"QGWRCRHCKKPRP6GC","created_at":"2026-05-20T00:02:06Z"},{"alias_kind":"pith_short_8","alias_value":"QGWRCRHC","created_at":"2026-05-20T00:02:06Z"}],"graph_snapshots":[{"event_id":"sha256:dad8541309726dd45e6fa00543d60dbb76a4e2fdf7dc773d6dab454f2b2a46c6","target":"graph","created_at":"2026-05-20T00:02:06Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2509.03403/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement Learning with Verifiable Rewards (RLVR) improves final-answer accuracy on reasoning tasks, but it does not reliably improve reasoning quality. Because outcome rewards only assess final answers, they also reward spurious successes: flawed reasoning can still receive maximal reward when it accidentally reaches the correct outcome. This outcome reward hacking creates biased gradients, making current RLVR insufficient for learning faithful reasoning. Process Reward Models (PRMs) provide step-wise supervision, but directly optimizing PRMs or naively combining them with outcome rewards","authors_text":"Anurag Beniwal, Chenlu Ye, Hao Chen, Jing Huang, Narayanan Sadagopan, Tong Zhang, Zhou Yu, Ziji Zhang","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.03403","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:95577796566a007df8d776fb1aea4eb64709477e07b03369344306526f2dd707","target":"record","created_at":"2026-05-20T00:02:06Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"751377cef871023c7c86fa96e27b4294b5835e5fb19bc99fecd0e80c814ad9f6","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-09-03T15:28:51Z","title_canon_sha256":"79857f4a8e61316b6ce91350f90e3b5c94f1f56f94fa260e9593d0cca26d72b5"},"schema_version":"1.0","source":{"id":"2509.03403","kind":"arxiv","version":2}},"canonical_sha256":"81ad1144e2529f17f8c2a9acdce6b87b80e06d6aa80317414561fd711392174c","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"81ad1144e2529f17f8c2a9acdce6b87b80e06d6aa80317414561fd711392174c","first_computed_at":"2026-05-20T00:02:06.242384Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-05-20T00:02:06.242384Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"IX6XDlA811dhw+0FCU8cDbcizWgedNUT0tPa38K3ylbxZ0BfQywECevlcJ1PpH6C/b5rQHBRiRiWXfiItGzdDg==","signature_status":"signed_v1","signed_at":"2026-05-20T00:02:06.243218Z","signed_message":"canonical_sha256_bytes"},"source_id":"2509.03403","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:95577796566a007df8d776fb1aea4eb64709477e07b03369344306526f2dd707","sha256:dad8541309726dd45e6fa00543d60dbb76a4e2fdf7dc773d6dab454f2b2a46c6"],"state_sha256":"eda4f9cc793d2fdeddd209c3698fe3cc1cb0f6d397bf5c44dc68dcce93fd5f35"}