{"as_of":"2026-07-22T03:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4770efb76e4bdbf7a75a9eb21ab2d37266cc0ccd79e86f1a34c35acd6ddb527e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T07:50:44.907952Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.22703/citation-record","integrity":"/paper/2605.22703/integrity","json":"/paper/2605.22703/citation-record.json","paper":"/paper/2605.22703"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:78cfeb5c230897c2fb7e8c94ce5ce8307da1b69bff82c514d8d014119e8bf19a","observation_id":"5e0859d6-e3d1-4d7d-a264-7c97c2c886c0","resolution":{"observed_at":"2026-05-22T07:51:15.796005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:97d31cb6e634d644741d0d6374cad306e5786fca71300c9483a7415c8ec5f7e5","observation_id":"9292c4f1-2023-41b6-81e4-7881c07a53be","resolution":{"observed_at":"2026-05-22T07:51:15.639176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-07-10T21:57:38.198014Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:ba0be2829b645362fe720f40bc7cafa2d38b436e268b57b416a2b47f7a5deaa4","observation_id":"f6cd9c29-5cdb-4e8d-ae4c-2dec22cf888e","resolution":{"observed_at":"2026-05-22T07:51:15.814142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:49:45.541596Z","title":"It’s not you, it’s clipping: A soft trust-region via probability smoothing for llm rl.arXiv preprint arXiv:2509.21282","venue":null,"work_id":"1c7b3d38-120c-438c-b172-69d4043df30f","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:b56ba63f2ab39467d00825088bc1aa670b00c9b3538996fe2ae69790a2cebcd4","observation_id":"dd45ef2d-a0f7-4346-b921-f5831caf6140","resolution":{"observed_at":"2026-05-22T07:51:15.802276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:10bf6aef90f49bb95f55b08a5f5679a96dd0b83f99dd8308f82fbea21ca95aba","observation_id":"91d8d387-b458-4cba-807a-ae2c77f70342","resolution":{"observed_at":"2026-05-22T07:51:15.774784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:fdb928575ba626fb31c03ac45ddc96383de5490f8f0b04f71804bb392722f287","observation_id":"301622b1-4422-425a-9431-d2af0c33e505","resolution":{"observed_at":"2026-05-22T07:51:15.620123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"cited_work":{"arxiv_id":"2510.10150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10150","snapshot_observed_at":"2026-07-04T08:29:41.999322Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","venue":"cs.LG","work_id":"32e0712a-e9d7-451f-8c18-f895f13eab70","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2510.10150","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:0d180a1aad4a5e2b98ed730a494e88f6e9d1f897e37674ce3ab54622a2cfdcad","observation_id":"46c30d97-08a2-4b44-838a-3b6b05063a80","resolution":{"observed_at":"2026-05-22T07:51:15.697768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.346092Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to repro- ducibility.arXiv preprint arXiv:2504.07086","venue":null,"work_id":"293ecb4d-96d1-4ced-a46c-a3aa4e23d934","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:87eaefb50d8beeb050f9af2445bdf00c9e872b6d7b2a70f4cbbc81e324a2e83e","observation_id":"90ec24fa-4f83-425a-b3e6-b7970b52808e","resolution":{"observed_at":"2026-05-22T07:51:15.692240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:6213741ea4ce4726cffd8b80d077f016f5f18c83772506b831671f44a792805f","observation_id":"367b4e4c-f50f-4cfa-8dd7-a39443bb77fa","resolution":{"observed_at":"2026-05-22T07:51:15.685603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.282988Z","title":"Low-probability tokens sustain exploration in reinforcement learning with verifiable reward.arXiv preprint arXiv:2510.03222","venue":null,"work_id":"1fb9c583-0e50-429d-a3cd-39db641df2f9","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:09d6ac7fe0fee8600ce0f1a7225f1fddedaf24576eae2450c9d860fef9c71c5d","observation_id":"238b9426-d4a4-4965-89ce-ade9d984a77c","resolution":{"observed_at":"2026-05-22T07:51:15.753818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22117","doi":"10.48550/arxiv.2603.22117","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"On the direction of rlvr updates for llm reasoning: Identification and exploitation","venue":null,"work_id":"f4bbdde2-afd9-44a8-822a-145757254bc0","year":2026},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:e3b9ff94f76196d94c4c33e25ef7c73c915ae3677f3323321152b9aae2d981fb","observation_id":"2517d983-0c8b-4c14-8a63-86309674861c","resolution":{"observed_at":"2026-05-22T07:51:15.727460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:453ae3a081b02651d7ec36ea75913b3c23bc7e4f08c10cd84da6e25696a4ffca","observation_id":"23bd93be-4664-4847-bccb-d7a5f9cb55bd","resolution":{"observed_at":"2026-05-22T07:51:15.704046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00829","last_updated":"2025-04-01T14:18:38Z","snapshot_observed_at":"2026-07-06T21:02:23.162769Z","submitted_at":"2025-04-01T14:18:38Z","title":"How Difficulty-Aware Staged Reinforcement Learning Enhances LLMs' Reasoning Capabilities: A Preliminary Experimental Study","version":1},"cited_work":{"arxiv_id":"2504.00829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.00829","snapshot_observed_at":"2026-07-02T22:27:26.000812Z","title":"How difficulty-aware staged reinforcement learning enhances llms’ reasoning capabilities: A preliminary experimental study.arXiv preprint arXiv:2504.00829","venue":null,"work_id":"970c33a3-1b44-48bb-b041-8df2c6ac6bcc","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2504.00829","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:b2d94fedc5bdd181299dbde9d30f89760ee9cf299b71c5d08eb48a695be7764f","observation_id":"e2abea4e-c79c-4959-a195-af7f96679c08","resolution":{"observed_at":"2026-05-22T07:51:15.808337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:b676ee6fcbc6f03eeccf8de5f96c2f0aa7ec2e1df4be5b214edf82acb77cbdf6","observation_id":"db52912b-150e-466b-98c2-0ac890713bdd","resolution":{"observed_at":"2026-05-22T07:51:15.662587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.150847Z","title":"Clip your sequences fairly: Enforcing length fairness for sequence-level rl.arXiv preprint arXiv:2509.09177","venue":null,"work_id":"64b83182-f7cb-4aae-b3e1-c1ab2236f541","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:9ccec6e18014dadd264174ad136ce7db6cc2d978c795706e24187fd1f8240632","observation_id":"fe4addce-31ae-4ed4-bad0-6f99371cbeaf","resolution":{"observed_at":"2026-05-22T07:51:15.651338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.140816Z","title":"Sparse but critical: A token-level analysis of distributional shifts in rlvr fine-tuning of llms","venue":null,"work_id":"fb448c11-a1b6-4d2c-a2cb-51dac670c22e","year":2026},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:578420c76750700d5abc7d6fee0ea9a0a597192ca09671be5bb1d3d9730f1408","observation_id":"fc1b55e9-9549-4a18-8b38-e370881089db","resolution":{"observed_at":"2026-05-22T07:51:15.645752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:93fc4fa27dd8dc402990f7e5ddfefa72deba00da75551a86218926a84e3e1ab8","observation_id":"e46ca483-3cdd-43b8-bb15-28ce04760131","resolution":{"observed_at":"2026-05-22T07:51:15.709378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:9ddabc264e084648d09d20b4bce15d38150395e19e69b954c8b58933f009d09b","observation_id":"97f8db89-096a-487c-bf6a-422aff7092e3","resolution":{"observed_at":"2026-05-22T07:51:15.714286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:9772180fadef25fd7515f372685f36c4cae8ecb17bd1b27540d1e20380092168","observation_id":"5c4918be-f31a-4c04-84c3-8f75c3fd042e","resolution":{"observed_at":"2026-05-22T07:51:15.732570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"cited_work":{"arxiv_id":"2510.06062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06062","snapshot_observed_at":"2026-07-09T22:26:37.216917Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","venue":"cs.CL","work_id":"9d58b069-561d-440c-9c42-aba858a81448","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2510.06062","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:82b5a5b531347f4a744d9b38bb077e9633f5b40ee09727a8685a0498927790b1","observation_id":"b91137a3-0dbd-4d08-a95c-7173221044fe","resolution":{"observed_at":"2026-05-22T07:51:15.747619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:54:20.294465Z","title":"Quantile advantage estimation for entropy-safe reasoning.arXiv preprint arXiv:2509.22611","venue":null,"work_id":"70aa3a99-c6f2-4f23-9993-39778229d7af","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:10b89720e2cb983664d4e3b886a4ea52b73f490285a52c98d9f2a5aec27e3b67","observation_id":"8ac5d033-92d9-4fa0-b496-0b31101b0133","resolution":{"observed_at":"2026-05-22T07:51:15.790336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.284515Z","title":"Bapo: Stabilizing off-policy reinforcement learning for llms via balanced policy optimization with adaptive clipping.arXiv preprint arXiv:2510.18927","venue":null,"work_id":"b2400ba2-08be-4be8-b3d4-f23f8ca50936","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:fcea209af18cf8e0b0b5fc6fb780475f1d423ed3b65ecb13ba07558fd147bbe3","observation_id":"4c899392-4280-44b4-8a6a-eff6296f39fb","resolution":{"observed_at":"2026-05-22T07:51:15.669534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.169399Z","title":"Single-stream policy optimization.arXiv preprint arXiv:2509.13232","venue":null,"work_id":"d8408690-4ae2-489c-aa5c-16b63d82e681","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:f4d61834f8b1b4f14831536d3eea44e19e9e3a8e57195d47d928007d42fc4de4","observation_id":"9cb69628-45fa-4210-bb7e-79c3b70c4d13","resolution":{"observed_at":"2026-05-22T07:51:15.679598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:0448c51431a569e67155646e6440894c15c22cafca4a91b2c1880ec7def2926f","observation_id":"d65a0d37-bca9-44b1-92e7-76738fb95fc4","resolution":{"observed_at":"2026-05-22T07:51:15.780109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-07-06T21:26:11.353127Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:2fc484ad294ffa57fed3daefc89b397dcc6ed6e68d69ff96cff0377f6f655813","observation_id":"131054e5-b69f-4763-ab6b-3bc8dd993145","resolution":{"observed_at":"2026-05-22T07:51:15.632516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:9ad18acca15fa128839e675e4d7807540ebe896f5394ae26b2a8273d94313d21","observation_id":"5aead835-031d-4dfa-9f94-aac20548c730","resolution":{"observed_at":"2026-05-22T07:51:15.656925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:1c6236a64f187ca6a4b156e193f52e5b04ba4dec8a2f6cdba103447f3e0abd1f","observation_id":"1e6d9905-7329-4639-aa7d-6711f79f0fdf","resolution":{"observed_at":"2026-05-22T07:51:15.625672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-10T14:27:07.145784Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:531c5eaf323a2c9a7fca56e5632644397a261d17e31048ad17c08a6260b2e6d0","observation_id":"319eccbc-5a9e-4908-bb6b-ed66cf03d02d","resolution":{"observed_at":"2026-05-22T07:51:15.739709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":null,"work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:b30f4a4774520ce49843bcf6661ab3761223a4c512c766b50fdf849c20442a8b","observation_id":"ac259059-5106-49e2-ade4-755b0239ff58","resolution":{"observed_at":"2026-05-22T07:51:15.721002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2605.22703."}