{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:37BEJ4INMN7ZINBSTQM7TXSPBP","short_pith_number":"pith:37BEJ4IN","schema_version":"1.0","canonical_sha256":"dfc244f10d637f9434329c19f9de4f0bdfcb73099b4b6c043847e5b7eb1cbf2f","source":{"kind":"arxiv","id":"2607.06987","version":1},"attestation_state":"computed","paper":{"title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Chongyu Fan, Jingjia Huang, Pengfei Liu, Sijia Liu, Yi Lin","submitted_at":"2026-07-08T04:21:42Z","abstract_excerpt":"Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). However, these algorithms suffer from an exploration-stability dilemma. Pure IS often leads to catastrophic training instability, while standard clipping mechanisms used to mitigate this instability strictly constrain the policy update budget. By formalizing the concept of Probability Capacity (Cap), we reveal that conservative clipping structurally stifles exploration "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.06987","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2026-07-08T04:21:42Z","cross_cats_sorted":[],"title_canon_sha256":"f59e4aecca5893e4eb2ecb941ac346981d18f7578e17adb1d7a67297f539c863","abstract_canon_sha256":"f134708b34fa36a0dd0c3ad3963814e310dcc54d709cd35f5ca50c82a5e942a2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-09T01:20:11.727881Z","signature_b64":"j1QQSwI1F+VeiILMz+N3sa4FTcO+Al5GeZu1U4P1ofEoDgtcVA5/Pk3Mc5DzwzBiqp84YkD9RRf4oIhhV1b/Dw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dfc244f10d637f9434329c19f9de4f0bdfcb73099b4b6c043847e5b7eb1cbf2f","last_reissued_at":"2026-07-09T01:20:11.727443Z","signature_status":"signed_v1","first_computed_at":"2026-07-09T01:20:11.727443Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Chongyu Fan, Jingjia Huang, Pengfei Liu, Sijia Liu, Yi Lin","submitted_at":"2026-07-08T04:21:42Z","abstract_excerpt":"Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). However, these algorithms suffer from an exploration-stability dilemma. Pure IS often leads to catastrophic training instability, while standard clipping mechanisms used to mitigate this instability strictly constrain the policy update budget. By formalizing the concept of Probability Capacity (Cap), we reveal that conservative clipping structurally stifles exploration "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.06987","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.06987/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.06987","created_at":"2026-07-09T01:20:11.727502+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.06987v1","created_at":"2026-07-09T01:20:11.727502+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.06987","created_at":"2026-07-09T01:20:11.727502+00:00"},{"alias_kind":"pith_short_12","alias_value":"37BEJ4INMN7Z","created_at":"2026-07-09T01:20:11.727502+00:00"},{"alias_kind":"pith_short_16","alias_value":"37BEJ4INMN7ZINBS","created_at":"2026-07-09T01:20:11.727502+00:00"},{"alias_kind":"pith_short_8","alias_value":"37BEJ4IN","created_at":"2026-07-09T01:20:11.727502+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP","json":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP.json","graph_json":"https://pith.science/api/pith-number/37BEJ4INMN7ZINBSTQM7TXSPBP/graph.json","events_json":"https://pith.science/api/pith-number/37BEJ4INMN7ZINBSTQM7TXSPBP/events.json","paper":"https://pith.science/paper/37BEJ4IN"},"agent_actions":{"view_html":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP","download_json":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP.json","view_paper":"https://pith.science/paper/37BEJ4IN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.06987&json=true","fetch_graph":"https://pith.science/api/pith-number/37BEJ4INMN7ZINBSTQM7TXSPBP/graph.json","fetch_events":"https://pith.science/api/pith-number/37BEJ4INMN7ZINBSTQM7TXSPBP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP/action/storage_attestation","attest_author":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP/action/author_attestation","sign_citation":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP/action/citation_signature","submit_replication":"https://pith.science/pith/37BEJ4INMN7ZINBSTQM7TXSPBP/action/replication_record"}},"created_at":"2026-07-09T01:20:11.727502+00:00","updated_at":"2026-07-09T01:20:11.727502+00:00"}