{"as_of":"2026-08-07T03:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e01b6a427a0891b51a22e96025a39a111deaed31fedece0fd6c78011f4768165","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T11:10:56.755558Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:08:22.453766Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:08:30.124848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"cited_work":{"arxiv_id":"2606.22317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22317","snapshot_observed_at":"2026-08-06T00:08:30.124848Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","venue":"cs.LG","work_id":"1ddc5f2e-97b4-448e-aef3-d6f358e5d8f7","year":2026},"citing_paper":{"arxiv_id":"2608.01522","last_updated":"2026-08-02T22:19:01Z","snapshot_observed_at":"2026-08-06T23:26:58.684733Z","submitted_at":"2026-08-02T22:19:01Z","title":"Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T00:08:22.453766Z"},"links":{"cited_paper":"/paper/2606.22317","citing_paper":"/paper/2608.01522"},"observation_digest":"sha256:e3cafd170aec1e483176a9b9a6bceb64c735a31366e38db1993343518973ebfe","observation_id":"98747308-700e-46db-9866-9d4b7a981365","resolution":{"observed_at":"2026-08-06T00:08:30.212990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.22317/citation-record","integrity":"/paper/2606.22317/integrity","json":"/paper/2606.22317/citation-record.json","paper":"/paper/2606.22317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Rl for reasoning by adaptively revealing rationales","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:95915b071c6d798aa9bee1ea4974f00335e13cee6ea7f4a3c312adbf969ad242","observation_id":"e539e23a-43b7-4966-b543-bbe156f47c81","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:9a147dd3b18d4c2491b5a58e209c36cd8ff1df367470c3e440acca995e66cb40","observation_id":"787e5272-d8f9-4bc4-b96c-1ffedd6855f8","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:675b20645ba72428c3fe88619fc01a2e81537961d5d28aafde411ca16156691b","observation_id":"4a135eb6-9869-4771-b9e7-e43eefdb1b66","resolution":{"observed_at":"2026-07-04T08:39:42.281464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Unveiling the key factors for distilling chain-of- thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:5c9bfaa351d46001a80898d66d853128260f8e0df9cebac1a31f2fe77dc7f65b","observation_id":"53c92407-fa65-4bcd-a92d-6d8c29db6b0e","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:ed728d826248af86f78495e50f0447cc028c29871a722a99641499982eeefc33","observation_id":"b8e2a08b-f532-431c-846a-ddc673baa1ad","resolution":{"observed_at":"2026-07-04T08:39:42.312906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:ccea0ba7cf8cfd1389e194b4d0c3fa0e0d2a125d95de269bff3572e27ec9bebe","observation_id":"64a05973-4fc6-49f6-af85-097bb1ea1560","resolution":{"observed_at":"2026-07-04T08:39:42.306067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:906c874d6c1366f51e905f846d90a5fbac8cd92462ae72836d355e3e080fec41","observation_id":"3151905a-5e48-41e1-b11a-8801af193a51","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:3c26a8b61bc5e9b2fe5ae776e428501890f092ca0ca61450509b0591856651b6","observation_id":"ad351469-98a8-4e59-8bd9-405ba2ef7126","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-04T15:54:46.196160Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:7c6878d5b8b74cefb019fb3bcb7378ae00745f325aea513075fef66bc96adfec","observation_id":"f8d10b29-0fe4-4ea3-b166-67a56fbff509","resolution":{"observed_at":"2026-07-04T08:39:42.300162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:d96b867c43e074dc6603ef661ace0de7f69fb46f75ab0f0be66084992c0ec383","observation_id":"efe3cd24-14c7-4002-9329-7febe15112df","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:57a911e44ac34095f23b2373f291f52499fc9f785c37c80183ea7d45cb99fe4e","observation_id":"d75c0abc-3b57-43a6-87f4-ba96f7b181e6","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:4a7b951ff623551eba0904d3b74c598d19328552771af8c7ab3d42891647d294","observation_id":"fe5532e9-d0c2-4fd2-ae39-4ada51a27e06","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:6e5897a220f8870e4c18a3546a15b692c963a4491a4ae972b81593d44582b084","observation_id":"fb9e5769-20cf-4bb0-9e43-29e2eb5fca8d","resolution":{"observed_at":"2026-07-04T08:39:42.309663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01244","last_updated":"2024-05-25T12:17:29Z","snapshot_observed_at":"2026-08-07T01:29:50.918024Z","submitted_at":"2024-03-02T16:11:23Z","title":"Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal","version":2},"cited_work":{"arxiv_id":"2403.01244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.01244","snapshot_observed_at":"2026-07-04T08:39:42.301817Z","title":"Mitigating catastrophic forgetting in large language models with self-synthesized rehearsal","venue":null,"work_id":"e3fe8bba-402b-4514-9049-4d4031479a08","year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2403.01244","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:f51a3a2d4c3f4833f5dd996c98597645bd930a94a142bf2b9cddcdbadc67484b","observation_id":"d3229f20-a436-4298-9568-fa00c3fededc","resolution":{"observed_at":"2026-07-04T08:39:42.303465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08255","last_updated":"2025-09-10T03:20:56Z","snapshot_observed_at":"2026-08-04T21:01:47.252809Z","submitted_at":"2025-09-10T03:20:56Z","title":"Mitigating Catastrophic Forgetting in Large Language Models with Forgetting-aware Pruning","version":1},"cited_work":{"arxiv_id":"2509.08255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08255","snapshot_observed_at":"2026-07-04T08:39:42.248343Z","title":"Mitigating catastrophic forgetting in large language models with forgetting-aware pruning (FAPM)","venue":null,"work_id":"1366ed0a-abfd-4b80-8776-594427d8eae7","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2509.08255","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:5529a0b2507fc3a16404ba71b5e8a431ec0bbafdcc6457918100e8382e6821d4","observation_id":"323258c1-76b1-450c-9c1d-2d951894027c","resolution":{"observed_at":"2026-07-04T08:39:42.251664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Unlocking the power of function vectors for characterizing and mitigating catastrophic forgetting in continual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:f48ad614590f725a827253980ca51d36d7e581733217f292f43ee471f16c36cd","observation_id":"891db1dc-2849-41a6-beab-792e3241c235","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:39:42.280138Z","title":"Tacler: Tailored curriculum reinforcement learning for efficient reasoning","venue":null,"work_id":"60d38206-73ce-4049-afe9-fb78326714dc","year":2026},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:acdc0762ba058610613f50c9d1ede77d91e90a3618d47a8fdaac8149db8b9523","observation_id":"17048d55-71be-4e19-acdb-9a311510ee34","resolution":{"observed_at":"2026-07-04T08:39:42.282278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Language models can easily learn to reason from demonstrations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:2e2491335b1bda5610ff3f3c2445e33047c2e9f0ee5892ed26e5dfc64b9af8a8","observation_id":"17451c98-d139-4776-a6b5-bc6c2dd4e791","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:518a3bf2fe3f3c7c522cfab1389187b814e98c16a32153c0d97a15768aca9e35","observation_id":"decc794b-e1f0-437d-9233-7f06515cb487","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:e72057898553e1e5534b427cc9a917f2a21dc5702910c82cc17fb154e2e1f82b","observation_id":"f8ad80ca-2fa3-494f-8906-9fb1e7df4371","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"An empirical study of catastrophic forgetting in large language models during continual fine-tuning.IEEE Transactions on Audio, Speech and Language Processing, 33:3776–3786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:f97f38e708f9ee2766ec44b6f41ba6fc0f6f96910baf1a2f65f46e4f29b122d5","observation_id":"7482cacf-f7f2-4d09-a49e-852c9a44988d","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:04f570ae2a2a38619b4ba190035d49255f25a2d2a150d4686a5acfb4e4654071","observation_id":"edaefd69-d03e-481a-8969-5ab596b96f69","resolution":{"observed_at":"2026-07-04T08:39:42.302931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:8e82543b30aaf2d5091386e31097ab4f1e426ed5face6019b96aebd48eb49a79","observation_id":"723e8753-b778-4129-922a-d40edde2e06e","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Curriculum reinforcement learning from easy to hard tasks improves llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:8dcf2d39529425e00fa9edfd15cf49859a4bb9deb5aea1a3d5aa05c9565a8b7b","observation_id":"016d0c7a-9751-40a5-8080-0e77cc613d27","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13914","doi":"10.48550/arxiv.2504.13914","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed1.5-thinking: Advancing superb reasoning models with reinforce- ment learning","venue":"ArXiv.org","work_id":"1eaca2b2-5ee7-4243-b8f5-117441248181","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:802596620cc9c09b05bcd35d85198d2701b66d5a66a0c1de61258fce9bc1a67b","observation_id":"8362972f-329f-4e83-bec4-80781be32119","resolution":{"observed_at":"2026-07-04T08:39:42.305959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:47072f3780ff0d084979a1fb9cff86df85856aedc3082e1abd5d13a8d55da670","observation_id":"b8c90504-fcc3-44f6-8b25-198bfd340ed9","resolution":{"observed_at":"2026-07-04T08:39:42.296432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04524","last_updated":"2025-06-18T08:39:46Z","snapshot_observed_at":"2026-08-06T10:38:46.719692Z","submitted_at":"2025-04-06T15:48:26Z","title":"Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning","version":2},"cited_work":{"arxiv_id":"2504.04524","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04524","snapshot_observed_at":"2026-07-04T08:39:42.243396Z","title":"Trust region preference approximation: A simple and stable reinforcement learning algorithm for llm reasoning","venue":null,"work_id":"b707415c-bc57-4c17-a491-5bd9839e5371","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2504.04524","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:2273b33a03b225f7548f8c284872e79e15a193a1889dddaa413d75ed938450e5","observation_id":"7ef419e3-2fbe-40db-8337-6893563729c0","resolution":{"observed_at":"2026-07-04T08:39:42.245665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-02T16:04:50.458535Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":"2503.21380","doi":"10.48550/arxiv.2503.21380","metadata_source":"pith","pith_arxiv_id":"2503.21380","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","venue":"cs.CL","work_id":"3dcb0e77-7b4c-4b36-9c04-1e76b8bdb08d","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2503.21380","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:cdd04a3b6f0ff94d08f9f674a0ac2d82a1525bd79a438712eaeb86f71826799a","observation_id":"ab311a9c-566d-43ae-b144-be5d30a34c1d","resolution":{"observed_at":"2026-07-04T08:39:42.235813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:fc040d999f9d8a0a5e0ec324164d87062fcc96ecb1737598f83d8285ca30df4e","observation_id":"a0133171-3f07-48a0-9401-bcdd1fa39746","resolution":{"observed_at":"2026-07-04T08:39:42.240336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Continual gradient low-rank projec- tion fine-tuning for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:9b60f6221e370c839fc29f8d34c96edb410b4fec85bef5b94eb93be05aab28b2","observation_id":"8c149a40-a299-411c-8ba8-5a3bf370ad9c","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Inscl: A data-efficient continual learning paradigm for fine-tuning large language models with instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:b97c5e6ea8c7c7b798fc61bea6d879f5c603fe50b7fef66b6fe8add6503a04b9","observation_id":"06b8fae7-b780-4c1f-8dbe-e5be94315c3f","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Reasoning scaffolding: Distilling the flow of thought from llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:ba0459dec09b2a4f57fdfd89c93eed39e8b062c79375ab28cbfa39ed646d49ac","observation_id":"d7643db9-d66f-4523-901c-3a4510bdcdbb","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Reinforcement learning with verifiable rewards im- plicitly incentivizes correct reasoning in base llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:4476ca4af65fb8eb2e33814a96fbfb2dc6c4193b92b0552934e5cb70a103b60f","observation_id":"f5286da5-28a9-4042-aef8-60ae367d41e6","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:39:42.289681Z","title":"Enhancing long-chain reasoning distillation through error- aware self-reflection","venue":null,"work_id":"2e5faecf-27ec-42f6-be60-5e956c7a8987","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:c42e0691ab8b1576f0dbf21b5d25554e70a5ef14fae7822b1d03ce94f1f4c926","observation_id":"b972c2da-bbc1-4150-bcd6-8612b0d312db","resolution":{"observed_at":"2026-07-04T08:39:42.294055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Training large language models for reasoning through reverse curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:a5742e81484b6757459bec7e45ac4deb000e68d3a5dab17b7e281e67cdad4cb3","observation_id":"c5d14caa-9f01-4289-b406-a09d72b93085","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:98a0b2004ab0735398dd50e356fb2ebce1890a723ef147267628251acc9e49b9","observation_id":"839f41f2-2611-43a2-8774-b6641b528f98","resolution":{"observed_at":"2026-07-04T08:39:42.270996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:8b62cea07536db3e27a92d9ca0cf6b23292cc0a5221f91955db3ad4a8b64848a","observation_id":"fbefa8f7-7a04-451b-93e7-c40665df5795","resolution":{"observed_at":"2026-07-04T08:39:42.246400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:23b1f45d65ade52d2ae9715afd4b11e4638f8bac07df4b698b5906cb4e44b758","observation_id":"718c7f29-425f-4845-8d62-542048da84d5","resolution":{"observed_at":"2026-07-04T08:39:42.291866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:03e7228cd7664f9f1d76bd28313cb3317a0ffc1f9126c22fc600ed3c955d4774","observation_id":"95a29bb8-2dc5-4a77-bfbf-602c4f97dede","resolution":{"observed_at":"2026-07-04T08:39:42.287324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? InThe Thirty-Ninth Annual Conference on Neural Information Processing Systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:85e80ce072c10bb1150b1eb62a0722e6973b1e5c74e0bb2098eea27c456db38b","observation_id":"a70a5b3d-ba88-4aea-8d5f-8f72a9783c5d","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:2b0e5bc0250dcf264ce9367433787d17fe7cf245425157178329b01e62e9bbff","observation_id":"f7a37b8b-b608-4975-b3e9-7ecac6a0816d","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Cures: From gradient analysis to efficient curriculum learning for reasoning llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:b662275b1cbcf7be8db62e3b233fac6a1787e0a229213521809f814362c4cfff","observation_id":"c27be518-5a20-411d-b4b7-0546b5c51438","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:5b93b892e8b03975d9275bb785d6722a1e99ba4b74b8f736c527dd04ef031c60","observation_id":"18cc8457-84ee-4f9a-b06a-a2255195ebb4","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Kakade, Cengiz Pehlevan, Samy Jelassi, and Eran Malach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:235d9aff7ee7d2052a80eac53472e14624358fa855478bcbb64237da046c3975","observation_id":"36f0bdf7-7d43-43d0-b75f-8fb4811e8bfd","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Automatic curricu- lum expert iteration for reliable llm reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:4fd7edb6b328cbc784c01b06295630175dbae80b6e26f805bbe135a4b85ce795","observation_id":"98c9bfd3-6cf0-48e0-8cb6-b7c8f7025cd5","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-05T20:30:49.812919Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":"2412.06559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-07-04T08:39:42.307124Z","title":"Processbench: Identifying process errors in mathematical reasoning","venue":null,"work_id":"fd09974e-3188-49d4-a208-329b8acfbb53","year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:778b3bdd2826dad64e9266810bf8c8930a2bb6876031cc8beadf57ebc2c429ab","observation_id":"25c971c0-9475-447f-a550-646d002e9c3e","resolution":{"observed_at":"2026-07-04T08:39:42.309787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:10:56.755558Z","title":"Group sequence policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:d7ffe56bde8f7ebca6ff6ae80bc467b752b58bf9921a0f56631a42c4ec1c0d02","observation_id":"9860daca-8e29-48b4-8ae9-2150d7e84b98","resolution":{"observed_at":"2026-06-26T11:10:56.755558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13453","last_updated":"2025-01-23T08:09:54Z","snapshot_observed_at":"2026-08-05T09:49:03.691086Z","submitted_at":"2025-01-23T08:09:54Z","title":"Spurious Forgetting in Continual Learning of Language Models","version":1},"cited_work":{"arxiv_id":"2501.13453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13453","snapshot_observed_at":"2026-07-04T08:39:42.275515Z","title":"arXiv preprint arXiv:2501.13453 (2025)","venue":null,"work_id":"874160b9-44d1-4305-bbe4-9518d9777d0f","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2501.13453","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:3914d965bfe9a0404b4139dbb01c25806fa6ad717a2dbe0ce8a844d5f77ee769","observation_id":"9f250876-a5da-45b9-91d1-02e9001bbc6d","resolution":{"observed_at":"2026-07-04T08:39:42.278601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.16084","doi":"10.48550/arxiv.2504.16084","metadata_source":"pith","pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TTRL: Test-Time Reinforcement Learning","venue":"cs.CL","work_id":"54ef1983-e8f7-4b17-9b74-6155b56c8b00","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:8892bacaf7beb9f310b2caa59ddda9fcb242b4734df68c9f882df937297bbfac","observation_id":"c0543458-410c-43b3-813c-6a4ba4d1f2cc","resolution":{"observed_at":"2026-07-04T08:39:42.296851Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T02:35:30.805654Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2606.22317."}