{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GLFHKLWWCTXPB4QBLBYUFQMHIQ","short_pith_number":"pith:GLFHKLWW","schema_version":"1.0","canonical_sha256":"32ca752ed614eef0f201587142c187442f38a81f485bf74ea3d29eec42369a36","source":{"kind":"arxiv","id":"2509.02333","version":2},"attestation_state":"computed","paper":{"title":"DCPO: Dynamic Clipping Policy Optimization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Chengfeng Dou, Fei Deng, Kai Lu, Peidong Guo, Qiang Ju, Rihui Xin, Shihui Yang","submitted_at":"2025-09-02T14:01:07Z","abstract_excerpt":"Reinforcement Learning from Verifiable Rewards (RLVR) has emerged as a promising framework for enhancing the reasoning capabilities of large language models. However, existing approaches such as GRPO often suffer from zero gradients. This problem arises primarily due to fixed clipping bounds for token-level probability ratios and the standardization of identical rewards, which can lead to ineffective gradient updates and underutilization of generated responses. In this work, we propose Dynamic Clipping Policy Optimization(DCPO), which introduces a dynamic clipping strategy that adaptively adju"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.02333","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-09-02T14:01:07Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"423eece6c3ea18d337efe7b2174834e32a7a0ebfbdd0fbac6ff955565d66e571","abstract_canon_sha256":"ad01a58c59f654948df96f323eee75946f51c2af4f0db03f15252d1a7b808660"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:06:49.491467Z","signature_b64":"QQfVoM6qri3hdCFVH0OCvD3UxjVtDvpQBFVem/0RL3ndM2/Evd0wbUMOqYx9Gq4+zkuvFnrGPXRfhxDsKGtMCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"32ca752ed614eef0f201587142c187442f38a81f485bf74ea3d29eec42369a36","last_reissued_at":"2026-07-05T12:06:49.490718Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:06:49.490718Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DCPO: Dynamic Clipping Policy Optimization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Chengfeng Dou, Fei Deng, Kai Lu, Peidong Guo, Qiang Ju, Rihui Xin, Shihui Yang","submitted_at":"2025-09-02T14:01:07Z","abstract_excerpt":"Reinforcement Learning from Verifiable Rewards (RLVR) has emerged as a promising framework for enhancing the reasoning capabilities of large language models. However, existing approaches such as GRPO often suffer from zero gradients. This problem arises primarily due to fixed clipping bounds for token-level probability ratios and the standardization of identical rewards, which can lead to ineffective gradient updates and underutilization of generated responses. In this work, we propose Dynamic Clipping Policy Optimization(DCPO), which introduces a dynamic clipping strategy that adaptively adju"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.02333","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.02333/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.02333","created_at":"2026-07-05T12:06:49.490806+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.02333v2","created_at":"2026-07-05T12:06:49.490806+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.02333","created_at":"2026-07-05T12:06:49.490806+00:00"},{"alias_kind":"pith_short_12","alias_value":"GLFHKLWWCTXP","created_at":"2026-07-05T12:06:49.490806+00:00"},{"alias_kind":"pith_short_16","alias_value":"GLFHKLWWCTXPB4QB","created_at":"2026-07-05T12:06:49.490806+00:00"},{"alias_kind":"pith_short_8","alias_value":"GLFHKLWW","created_at":"2026-07-05T12:06:49.490806+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07178","citing_title":"Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning","ref_index":26,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10522","citing_title":"GUI-AC: Enhancing Continual Learning in GUI Agents","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21125","citing_title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28388","citing_title":"Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08982","citing_title":"Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21125","citing_title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2511.04256","citing_title":"SSPO: Subsentence-level Policy Optimization","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12913","citing_title":"Revisiting DAgger in the Era of LLM-Agents","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2604.00860","citing_title":"Policy Improvement Reinforcement Learning","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13088","citing_title":"Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11491","citing_title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23318","citing_title":"Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16972","citing_title":"MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ","json":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ.json","graph_json":"https://pith.science/api/pith-number/GLFHKLWWCTXPB4QBLBYUFQMHIQ/graph.json","events_json":"https://pith.science/api/pith-number/GLFHKLWWCTXPB4QBLBYUFQMHIQ/events.json","paper":"https://pith.science/paper/GLFHKLWW"},"agent_actions":{"view_html":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ","download_json":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ.json","view_paper":"https://pith.science/paper/GLFHKLWW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.02333&json=true","fetch_graph":"https://pith.science/api/pith-number/GLFHKLWWCTXPB4QBLBYUFQMHIQ/graph.json","fetch_events":"https://pith.science/api/pith-number/GLFHKLWWCTXPB4QBLBYUFQMHIQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ/action/storage_attestation","attest_author":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ/action/author_attestation","sign_citation":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ/action/citation_signature","submit_replication":"https://pith.science/pith/GLFHKLWWCTXPB4QBLBYUFQMHIQ/action/replication_record"}},"created_at":"2026-07-05T12:06:49.490806+00:00","updated_at":"2026-07-05T12:06:49.490806+00:00"}