{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:MRBW2T5BEDXSQATXKWWOESVM3D","short_pith_number":"pith:MRBW2T5B","schema_version":"1.0","canonical_sha256":"64436d4fa120ef28027755ace24aacd8e1efa25045acffc61e1571c8148ae7d0","source":{"kind":"arxiv","id":"2509.06923","version":1},"attestation_state":"computed","paper":{"title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Dawei Yin, Erxue Min, Hengyi Cai, Hui Wu, Jinman Zhao, Shuaiqiang Wang, Xu Chen, Yongcheng Zeng, Zexu Sun, Zhi-Hong Deng, Ziheng Li","submitted_at":"2025-09-08T17:36:21Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) has achieved remarkable success in enhancing the reasoning capabilities of large language models (LLMs). However, existing RLVR methods often suffer from exploration inefficiency due to mismatches between the training data's difficulty and the model's capability. LLMs fail to discover viable reasoning paths when problems are overly difficult, while learning little new capability when problems are too simple. In this work, we formalize the impact of problem difficulty by quantifying the relationship between loss descent speed and rollout acc"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.06923","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-09-08T17:36:21Z","cross_cats_sorted":[],"title_canon_sha256":"a25536e49572fdf181c2ade407ece85c9f39a45dd09db93595b1e0a4242ea141","abstract_canon_sha256":"be8a9e38abb6f6578b2e152eaba2c38bad13ad5f3d047ffc41da4cd43ad4b1b8"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:06:55.168527Z","signature_b64":"/UUX7C6UeY3xHkPG6womrhIcShuwfCME5rBnj7BjmY2zp1r8wCErCgx51UHFwAld69tM9GPe2PbXBfSOTmINBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"64436d4fa120ef28027755ace24aacd8e1efa25045acffc61e1571c8148ae7d0","last_reissued_at":"2026-07-05T12:06:55.168055Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:06:55.168055Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Dawei Yin, Erxue Min, Hengyi Cai, Hui Wu, Jinman Zhao, Shuaiqiang Wang, Xu Chen, Yongcheng Zeng, Zexu Sun, Zhi-Hong Deng, Ziheng Li","submitted_at":"2025-09-08T17:36:21Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) has achieved remarkable success in enhancing the reasoning capabilities of large language models (LLMs). However, existing RLVR methods often suffer from exploration inefficiency due to mismatches between the training data's difficulty and the model's capability. LLMs fail to discover viable reasoning paths when problems are overly difficult, while learning little new capability when problems are too simple. In this work, we formalize the impact of problem difficulty by quantifying the relationship between loss descent speed and rollout acc"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.06923","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.06923/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.06923","created_at":"2026-07-05T12:06:55.168109+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.06923v1","created_at":"2026-07-05T12:06:55.168109+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.06923","created_at":"2026-07-05T12:06:55.168109+00:00"},{"alias_kind":"pith_short_12","alias_value":"MRBW2T5BEDXS","created_at":"2026-07-05T12:06:55.168109+00:00"},{"alias_kind":"pith_short_16","alias_value":"MRBW2T5BEDXSQATX","created_at":"2026-07-05T12:06:55.168109+00:00"},{"alias_kind":"pith_short_8","alias_value":"MRBW2T5B","created_at":"2026-07-05T12:06:55.168109+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18216","citing_title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05112","citing_title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05112","citing_title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05112","citing_title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","ref_index":10,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D","json":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D.json","graph_json":"https://pith.science/api/pith-number/MRBW2T5BEDXSQATXKWWOESVM3D/graph.json","events_json":"https://pith.science/api/pith-number/MRBW2T5BEDXSQATXKWWOESVM3D/events.json","paper":"https://pith.science/paper/MRBW2T5B"},"agent_actions":{"view_html":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D","download_json":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D.json","view_paper":"https://pith.science/paper/MRBW2T5B","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.06923&json=true","fetch_graph":"https://pith.science/api/pith-number/MRBW2T5BEDXSQATXKWWOESVM3D/graph.json","fetch_events":"https://pith.science/api/pith-number/MRBW2T5BEDXSQATXKWWOESVM3D/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D/action/storage_attestation","attest_author":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D/action/author_attestation","sign_citation":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D/action/citation_signature","submit_replication":"https://pith.science/pith/MRBW2T5BEDXSQATXKWWOESVM3D/action/replication_record"}},"created_at":"2026-07-05T12:06:55.168109+00:00","updated_at":"2026-07-05T12:06:55.168109+00:00"}