{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:FMWYV2BB27UBY6YISBHNUDYCN2","short_pith_number":"pith:FMWYV2BB","schema_version":"1.0","canonical_sha256":"2b2d8ae821d7e81c7b08904eda0f026ebccbde5cf4388d471c22a1b51ceaef85","source":{"kind":"arxiv","id":"2410.17621","version":2},"attestation_state":"computed","paper":{"title":"Process Supervision-Guided Policy Optimization for Code Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Chen Dun, Guanlin Liu, Liang Huang, Lin Yan, Ning Dai, Renjie Zheng, Wenlei Shi, Xing Jin, Zheng Wu, Ziyun Wei","submitted_at":"2024-10-23T07:22:33Z","abstract_excerpt":"Reinforcement learning (RL) with unit test feedback has enhanced large language models' (LLMs) code generation, but relies on sparse rewards provided only after complete code evaluation, limiting learning efficiency and incremental improvements. When generated code fails all unit tests, no learning signal is received, hindering progress on complex tasks. To address this, we propose a Process Reward Model (PRM) that delivers dense, line-level feedback on code correctness during generation, mimicking human code refinement and providing immediate guidance. We explore various strategies for traini"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.17621","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2024-10-23T07:22:33Z","cross_cats_sorted":[],"title_canon_sha256":"2e767d610b98c4f2bba171a7a2ac1dce359df7605a0ef35a4ecb80834bf11490","abstract_canon_sha256":"e35af8ffb2fcad754c394ffbe7f40e628cefc7002ef3d7df1a9e475c6adf3efd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:09:11.046856Z","signature_b64":"X6YdsxEpDYGsbmV9OcWbbWiTq6AbCAvwb0uesUVTRW/lQYETKxb2Qsa8ZyKKfu1ChitTlf1spgE0+CV83aymCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2b2d8ae821d7e81c7b08904eda0f026ebccbde5cf4388d471c22a1b51ceaef85","last_reissued_at":"2026-07-05T10:09:11.046414Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:09:11.046414Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Process Supervision-Guided Policy Optimization for Code Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Chen Dun, Guanlin Liu, Liang Huang, Lin Yan, Ning Dai, Renjie Zheng, Wenlei Shi, Xing Jin, Zheng Wu, Ziyun Wei","submitted_at":"2024-10-23T07:22:33Z","abstract_excerpt":"Reinforcement learning (RL) with unit test feedback has enhanced large language models' (LLMs) code generation, but relies on sparse rewards provided only after complete code evaluation, limiting learning efficiency and incremental improvements. When generated code fails all unit tests, no learning signal is received, hindering progress on complex tasks. To address this, we propose a Process Reward Model (PRM) that delivers dense, line-level feedback on code correctness during generation, mimicking human code refinement and providing immediate guidance. We explore various strategies for traini"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.17621","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.17621/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.17621","created_at":"2026-07-05T10:09:11.046473+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.17621v2","created_at":"2026-07-05T10:09:11.046473+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.17621","created_at":"2026-07-05T10:09:11.046473+00:00"},{"alias_kind":"pith_short_12","alias_value":"FMWYV2BB27UB","created_at":"2026-07-05T10:09:11.046473+00:00"},{"alias_kind":"pith_short_16","alias_value":"FMWYV2BB27UBY6YI","created_at":"2026-07-05T10:09:11.046473+00:00"},{"alias_kind":"pith_short_8","alias_value":"FMWYV2BB","created_at":"2026-07-05T10:09:11.046473+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.28751","citing_title":"Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15951","citing_title":"From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15529","citing_title":"Process Rewards with Learned Reliability","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07941","citing_title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","ref_index":103,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2","json":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2.json","graph_json":"https://pith.science/api/pith-number/FMWYV2BB27UBY6YISBHNUDYCN2/graph.json","events_json":"https://pith.science/api/pith-number/FMWYV2BB27UBY6YISBHNUDYCN2/events.json","paper":"https://pith.science/paper/FMWYV2BB"},"agent_actions":{"view_html":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2","download_json":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2.json","view_paper":"https://pith.science/paper/FMWYV2BB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.17621&json=true","fetch_graph":"https://pith.science/api/pith-number/FMWYV2BB27UBY6YISBHNUDYCN2/graph.json","fetch_events":"https://pith.science/api/pith-number/FMWYV2BB27UBY6YISBHNUDYCN2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2/action/storage_attestation","attest_author":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2/action/author_attestation","sign_citation":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2/action/citation_signature","submit_replication":"https://pith.science/pith/FMWYV2BB27UBY6YISBHNUDYCN2/action/replication_record"}},"created_at":"2026-07-05T10:09:11.046473+00:00","updated_at":"2026-07-05T10:09:11.046473+00:00"}