{"as_of":"2026-08-05T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:618bdedbe830ae62128e7e90af47f5e61a377c624210d5f91a7b9b4c6b8202b1","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:32:23.972335Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:04:51.970049Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T14:28:31.391729Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"cited_work":{"arxiv_id":"2604.18493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18493","snapshot_observed_at":"2026-07-03T14:28:31.391729Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","venue":"cs.LG","work_id":"e169c994-c019-4320-8447-7bca3766ff85","year":2026},"citing_paper":{"arxiv_id":"2606.13174","last_updated":"2026-06-11T10:43:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T10:43:40Z","title":"Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T07:04:51.970049Z"},"links":{"cited_paper":"/paper/2604.18493","citing_paper":"/paper/2606.13174"},"observation_digest":"sha256:419d354a48f63f91f456f0b2c55b1102cb14e12b047ac490e343f2f6212e58e7","observation_id":"50715b1b-3c85-4a8e-a212-7f03ec207950","resolution":{"observed_at":"2026-07-03T14:28:31.392889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18493/citation-record","integrity":"/paper/2604.18493/integrity","json":"/paper/2604.18493/citation-record.json","paper":"/paper/2604.18493"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.16084","doi":"10.48550/arxiv.2504.16084","metadata_source":"pith","pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TTRL: Test-Time Reinforcement Learning","venue":"cs.CL","work_id":"54ef1983-e8f7-4b17-9b74-6155b56c8b00","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:b383de1ab5c1948ecfccb60996f5843e1761abf3c1a06cfa682658fd1f18f293","observation_id":"3d982aff-524c-4a4b-99f9-06491df24d12","resolution":{"observed_at":"2026-05-10T05:36:02.011777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-02T16:49:32.082324Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"cited_work":{"arxiv_id":"2508.11356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11356","snapshot_observed_at":"2026-07-10T12:07:03.473290Z","title":"Ettrl: Balancing exploration and exploitation in llm test-time reinforcement learning via entropy mechanism","venue":"cs.LG","work_id":"61f883f4-4072-4ec3-a7b2-f8139ee1feb2","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2508.11356","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:17c05a0cb8d434ed0fb0265a4afac11ba07bc322fcbf34b7f1c3c379b31374d6","observation_id":"f7f0a398-e21b-4adc-858e-2091dc4b56c2","resolution":{"observed_at":"2026-05-10T05:36:02.052658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:41dda4cd538eb16475204ce16e676b24057f8c49ea9ea6a85f95891c8a5fa284","observation_id":"43f1f110-ab36-4a96-bb50-dd20d000d334","resolution":{"observed_at":"2026-05-10T05:36:02.059877Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:87444b74022d71e009a8147404ff4cc904acbac088539c9ee6a06d7aa26a9c56","observation_id":"a77039c5-391b-46f0-961b-c9bd3e6d4e0a","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-07-06T21:55:50.206625Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"cited_work":{"arxiv_id":"2507.08794","doi":"10.48550/arxiv.2507.08794","metadata_source":"pith","pith_arxiv_id":"2507.08794","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"One token to fool llm-as-a-judge","venue":"cs.LG","work_id":"f77305eb-5f89-4afb-84f3-51d864f3f3fa","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2507.08794","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:a8c8d5f848051ec52be83329a26868c174500e6fc1bfecd76da4987ca57bd395","observation_id":"95ea86d6-6133-45e6-9987-8b5466e5ed5a","resolution":{"observed_at":"2026-06-12T02:08:19.458599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:e16cbf273ebaa16ea6ae5d528d976e9a2ce5247c2386f807d7146da27787043a","observation_id":"fdd4da0d-4987-4e9a-b13e-ced8e7368487","resolution":{"observed_at":"2026-05-10T05:36:02.050328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:7eba8b51f991fd284ce4916734aa008d07d12daf32a39aa23a18ec98c6b0292e","observation_id":"47a0b006-db2a-4212-8b40-51b8c559e048","resolution":{"observed_at":"2026-05-10T05:36:02.055017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:d3bf3e3fff9ac4cfaedd7344222f9fe747d3c63cf0dc2c5254fed28115d1c9be","observation_id":"6b320650-b316-425c-9ddd-a63262182404","resolution":{"observed_at":"2026-05-10T05:36:02.019262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:8f7d4007cb2a818d20826fe7d6d83f74a33b99c843e2489d994766990ad46606","observation_id":"5b18a2b9-e4fb-4e0e-ba7f-197c79a03bbb","resolution":{"observed_at":"2026-05-13T08:21:05.971096Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01939","doi":"10.48550/arxiv.2506.01939","metadata_source":"pith","pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","venue":"cs.CL","work_id":"e5e936f3-0cff-4732-b394-f607d7a63f5f","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:aedaf3f07ab17df30263e33c16e253910501ca668e8bd3e299b7cb72ed74b51c","observation_id":"d67d51a4-c9e1-4ea0-94f3-2bcf7f5312e0","resolution":{"observed_at":"2026-05-12T12:12:09.004283Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:853d28c8e06c1458c12f5a59b1da70c78f4509deec83e80263fb4fc3f87bee31","observation_id":"52f3cb1b-099f-4c53-9e14-867cb07c84b5","resolution":{"observed_at":"2026-05-10T05:36:02.036290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:7999a04cabe3de6c454e6a003202efa9bded94ea495c85371c473fb74cd8edb2","observation_id":"b8b20a9b-7f99-42a0-9d14-1775e1bc2563","resolution":{"observed_at":"2026-05-12T12:31:34.026635Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":"2505.22660","doi":"10.48550/arxiv.2505.22660","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Maximizing confidence alone improves reasoning","venue":"ArXiv.org","work_id":"471b6786-7627-4021-a6b3-7f5cd8c83643","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0d582fcebd468fd73f7732798a3dae66f729be29149c0c9b949ea3bcc57a23b4","observation_id":"c5a719de-c496-4442-952c-34eb2b8251e0","resolution":{"observed_at":"2026-05-10T05:36:02.040925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2505.15134","doi":"10.48550/arxiv.2505.15134","metadata_source":"pith","pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","venue":"cs.LG","work_id":"f8d10af5-2f58-4959-97c3-4e23db3983ad","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0a88d00dbf4b63a9048001dd2fad4bb2a23129cc8a37a39c2c0171a8abdb2cb9","observation_id":"21d385bb-39f7-49c0-b23a-75d66eacf57b","resolution":{"observed_at":"2026-05-18T15:58:33.819070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":"2505.19590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-07-10T12:07:03.461827Z","title":"Learning to Reason without External Rewards","venue":"cs.LG","work_id":"7286f998-80ea-4c9e-8736-a39c53696142","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:c4a890c220b0a6085694ab8ef5df47e1ea8913ed12548f0c47a1735fcbe19a6c","observation_id":"98aa62d3-2ba4-46c1-a96c-2b8cb987701b","resolution":{"observed_at":"2026-05-15T21:16:57.297836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-07-06T21:05:59.227458Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:370141c669b0741390b3400fa69b0290fd80d54fdcfd687a4715f0f34999d428","observation_id":"b03f0231-88d5-41b8-972d-ca08f6ba4319","resolution":{"observed_at":"2026-05-10T05:36:02.057418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08020","last_updated":"2025-02-08T19:39:09Z","snapshot_observed_at":"2026-07-06T19:31:13.821669Z","submitted_at":"2024-10-10T15:17:49Z","title":"Efficiently Learning at Test-Time: Active Fine-Tuning of LLMs","version":3},"cited_work":{"arxiv_id":"2410.08020","doi":"10.48550/arxiv.2410.08020","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficiently learning at test-time: Active fine-tuning of llms.arXiv preprint arXiv:2410.08020","venue":"arXiv (Cornell University)","work_id":"47956813-b9ae-4d6e-a89b-9b0865e84729","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2410.08020","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:d2cd94c58be9598b01473e59b7bbbf9b8250a2c23b10fcfcf23bf26d60fd9839","observation_id":"9d56d6ae-3ad8-4349-a497-dbd30086eec0","resolution":{"observed_at":"2026-05-10T05:36:02.038742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:857ea3261a258aa6e5f1ba355f76e0e5f1284f1af1fe2f7347a0c0ec293127b5","observation_id":"0ebb5673-a95c-46c8-b46b-c61a588a9abb","resolution":{"observed_at":"2026-05-10T05:36:02.024064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:371eaa9702a3055ca838a8c1e49fe32cf6b094dd2d547b8a08d2fa628f9ede9e","observation_id":"696efccc-7a89-405e-80f4-a3c7a869dc1c","resolution":{"observed_at":"2026-05-10T05:36:02.016993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:938292d940d72f55fbb203108487c95e987a17985c23bcd9d2f8170702ba6853","observation_id":"9ea96b77-9e51-4be1-b951-b8c924bb42b2","resolution":{"observed_at":"2026-05-10T13:23:58.476668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:6945077b214b4889431131942d3dd3f241e19b55c0716f5feffb0476873d1aae","observation_id":"8ae0e32a-3386-4927-a0a5-ec71e8f0c24c","resolution":{"observed_at":"2026-05-10T05:36:02.026279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:6b79fabb84c164c09bf09f4f85e3357676b3cbad978e979ef275b0013e251981","observation_id":"5e6d2d1b-a4e5-46e4-9faf-25570ad0a42e","resolution":{"observed_at":"2026-05-10T05:36:01.399505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-07-06T21:39:56.824255Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:678049c43cb077709312b86925be15c3171676022081a634b087bbdaf6fbf543","observation_id":"97b7fe68-7dfb-4165-bc4e-0cade0795304","resolution":{"observed_at":"2026-05-10T05:36:01.402466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:19:34.001123Z","title":"Can large reasoning models self-train?","venue":null,"work_id":"676b6b60-dcea-400f-9a21-469309587fd2","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:dd6d47979859d5ab171b6a966a33412d3a5f6ce2668ec1b5ca892626ed97a659","observation_id":"f9113143-e73d-4457-9c01-23d025e5bb2b","resolution":{"observed_at":"2026-05-10T05:36:01.968236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.936924Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":"4a676cb5-4703-473b-97c5-46ab8c31fd41","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0a8387df6ff0b2e694bdd0c147c5116b343d3ea132b6a6acb859661fe77efbfc","observation_id":"89cda544-1c8e-48f0-a479-3f16ac20cc81","resolution":{"observed_at":"2026-05-21T20:14:21.149853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging Face repository , volume=","venue":null,"work_id":"e547af6b-ea8a-4879-b17e-a3f0238449ae","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0b7c1ba638762876a37bbcc103dafc5f5b24d558547dff68ae1ace9a9da5d043","observation_id":"4831cb6f-d040-423c-a5b9-d941ebdeb8cf","resolution":{"observed_at":"2026-05-21T20:14:21.156222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:ba816ed0f82c7cf9be822ee692973283dd61bf9e4b593a9413e408daef62b0ca","observation_id":"98b3b3c6-30d8-4225-bfa1-75cf3791759a","resolution":{"observed_at":"2026-05-10T13:00:39.484061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:a3d759ab290a707a89a8a5080e970628b10f9f0c1a543d1bef120064d152d997","observation_id":"55898f63-c9ab-42a1-9e93-f14d32339cfc","resolution":{"observed_at":"2026-05-10T05:36:01.975383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"049f0001-6ab9-4896-8e3b-50d2b3087adc","year":2020},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:eb739bcc5371d05e28fc561d027d210cc2e9f26976a062f9cf98a7e181712a0d","observation_id":"26110588-8257-45f7-bbd3-bde092241b05","resolution":{"observed_at":"2026-05-21T20:14:21.139626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":"2006.10726","doi":"10.48550/arxiv.2006.10726","metadata_source":"pith","pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","venue":"cs.LG","work_id":"7f343a70-32a2-42dc-945a-66a6feb179fb","year":2020},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:2a5a570a58e58b7a9520fcbd0a5856f74668d86cc4b3b090700f20688ab28281","observation_id":"c97915af-e7eb-4acc-b148-7d9ad74b52a5","resolution":{"observed_at":"2026-05-16T10:09:24.402331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"61bd5f72-e342-4a8b-920a-73e612fa4ea4","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:334bda3ff595468c8cf0312b5ee32631a1d6d8752157af05c2343c6b7e1f95c9","observation_id":"534b6c4f-b157-46aa-ba63-5fe0fa65c371","resolution":{"observed_at":"2026-05-21T20:14:21.137596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T20:41:22.743557Z","title":"Workshop on challenges in representation learning, ICML , volume=","venue":null,"work_id":"443d4d2c-59a3-4390-a1fd-8fa370f96b36","year":2013},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:32019e2df83ce0dd2db508ed4ea04ddf450814ca570aa9b4b3406de8075313c9","observation_id":"7ac4f40b-16d9-4972-8feb-a9c4b7a41e7a","resolution":{"observed_at":"2026-05-21T20:14:21.166341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"ba1c1215-50e7-4da2-b006-862ef9000981","year":2018},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:a5e60f2a8e35ea8639374c9c5ee5249157f05457e0d6434a75c19e251e239a8f","observation_id":"6c1c20d2-4eb6-42f2-9452-72f79511353d","resolution":{"observed_at":"2026-05-21T20:14:21.168441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:46:18.396760Z","title":"Nature , volume=","venue":null,"work_id":"9001f585-72d6-4744-b68b-b283f8a3deb8","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:50e08a5719dc22948fbb9db03942f79e058f556683a74a1b768204c484b3e765","observation_id":"63ddf2bd-59e8-48f4-a51e-3321c0340c5d","resolution":{"observed_at":"2026-05-21T20:14:21.158224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:54.159672Z","title":"1992 , publisher=","venue":null,"work_id":"ddca853b-4d8a-49d9-898a-6d6e8f27282e","year":1992},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:89de551aa594145ff3b2dcc218bbf4d698b12edee052594dad08183e81695e29","observation_id":"095e9a13-56fe-4811-9a1c-7278e980bc9c","resolution":{"observed_at":"2026-05-21T20:14:21.133855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2015 , publisher=","venue":null,"work_id":"d3312915-060a-48e6-b5ed-83506c9de2a9","year":2015},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:557c1d70fd5d30f499682b12d3eda88ed5ff1904cda0f48ae96ba680286b70bf","observation_id":"91a4765b-38ad-4bf6-b8e1-28fb4649bdc2","resolution":{"observed_at":"2026-05-21T20:14:21.146122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evolutionary computation , volume=","venue":null,"work_id":"98071858-4db3-4a43-b80e-7ef5cb90181c","year":2011},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f60fc8312f09bbcb7824cb616493eeb6c16132f276505c05d565ce32a4b9be9f","observation_id":"eec50442-9be8-410a-9192-680113fb5c04","resolution":{"observed_at":"2026-05-21T20:14:21.162083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frontiers in Robotics and AI , volume=","venue":null,"work_id":"d56af457-e0c4-4c6d-8d02-6a4056790805","year":2016},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:7ed6546dbf2c2c422e089d4f0fcb57a31a357b0e7786d9db0f52cdf9d764da1c","observation_id":"3150ed39-a429-4888-822e-2c036bfbba5e","resolution":{"observed_at":"2026-05-21T20:14:21.170575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-07-06T22:22:26.392981Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:159dfaffcab74e3eb9233e655df2a38a5bc8f184ef57ba59330b9ea763eb2b66","observation_id":"d85fd09c-20f7-485f-9cac-9bb1d58d1c65","resolution":{"observed_at":"2026-05-10T05:36:01.947611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17126","last_updated":"2025-03-21T13:21:45Z","snapshot_observed_at":"2026-07-06T20:56:40.518889Z","submitted_at":"2025-03-21T13:21:45Z","title":"Modifying Large Language Model Post-Training for Diverse Creative Writing","version":1},"cited_work":{"arxiv_id":"2503.17126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17126","snapshot_observed_at":"2026-06-29T07:53:14.421985Z","title":"Modifying large language model post- training for diverse creative writing","venue":null,"work_id":"d96394ec-96f0-4d15-9e32-6167857ea485","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2503.17126","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f4cc321f07cb5c2845ec005df6df99f311acf15e898bc8c0d0b4ae140f69524a","observation_id":"712dbd10-e8fa-4e8c-b391-6cdde66035f1","resolution":{"observed_at":"2026-05-10T05:36:01.965924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13957","last_updated":"2026-05-16T17:37:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:56:03Z","title":"Supervising the search process produces reliable and generalizable information-seeking agents","version":3},"cited_work":{"arxiv_id":"2502.13957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13957","snapshot_observed_at":"2026-07-03T14:28:31.095422Z","title":"Rag-gym: Optimizing reasoning and search agents with process supervision.arXiv preprint arXiv:2502.13957","venue":"cs.CL","work_id":"b9acf078-c5d0-4155-b152-0a7c81ef8313","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2502.13957","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:d67bdb84f2868eabb0cc08987b096040f19555f0b0ec7922bb9316d78c7e23a0","observation_id":"039526f7-c65a-432c-a4db-ffbfe5e0f3b3","resolution":{"observed_at":"2026-05-20T00:02:48.394837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04642","last_updated":"2025-08-06T17:29:40Z","snapshot_observed_at":"2026-07-06T21:53:03.863213Z","submitted_at":"2025-07-07T03:50:59Z","title":"R1-RE: Cross-Domain Relation Extraction with RLVR","version":2},"cited_work":{"arxiv_id":"2507.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.04642 , year=","venue":null,"work_id":"984a2104-af51-4e4f-b424-3ea29041bcb9","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2507.04642","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:a5e4e4b2c95c1df72652c5cfd2e91476969a545bc3191f3c45c609b1959c5862","observation_id":"d41f4700-3287-4645-9187-33226ff86958","resolution":{"observed_at":"2026-05-10T05:36:01.990762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:31341a3b0a4574d608cbf329c50a4b57243b1337eb289cb1cda7e11aef44c484","observation_id":"c50ad9dd-2bad-4881-a5e8-43369204a2e7","resolution":{"observed_at":"2026-05-10T05:36:01.999728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:25208cedc9d6b50c3e4fce00452883c58d8424d4f91288acec191f61e1b6ffaf","observation_id":"4608f550-acd6-40c2-ad73-24abc60bcef4","resolution":{"observed_at":"2026-05-10T05:36:02.006979Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-04T21:28:47.405179Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:6ed67d2bf79a4757684644a779595e95fc318fe40fa59b4b30409e9934b0c463","observation_id":"4bf022af-6523-4e8d-b7b2-2929d433f2d5","resolution":{"observed_at":"2026-05-10T05:36:02.009207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15817","last_updated":"2025-06-09T21:22:15Z","snapshot_observed_at":"2026-07-06T21:28:01.596548Z","submitted_at":"2025-05-21T17:59:54Z","title":"Learning to Reason via Mixture-of-Thought for Logical Reasoning","version":2},"cited_work":{"arxiv_id":"2505.15817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15817","snapshot_observed_at":"2026-07-02T02:56:30.043811Z","title":"Learning to reason via mixture-of-thought for logical reasoning","venue":null,"work_id":"ae06c16d-d4f4-4b4d-8ce5-49a53d161d43","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.15817","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:bf6b4a529b77810d13b374db253e40493bd79bc562eb5739c31f73e4a11bf60e","observation_id":"0485d328-d6f1-41f6-99ea-6222fc70d86b","resolution":{"observed_at":"2026-05-10T05:36:01.997503Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.17312 , year=","venue":null,"work_id":"9af667d6-37ba-4630-970d-c769df110b94","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:5673f53e1ecfdcdea9747add873496327f97ca23e75e95ecfd5e0076f0da2a43","observation_id":"f95d8c1f-8773-4da6-b3a5-dbcc2a60c164","resolution":{"observed_at":"2026-05-10T05:36:01.995170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04810","doi":"10.48550/arxiv.2506.04810","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In Proceedings of the 62nd Annual Meeting of the Association for Compu- tational Linguistics (Volume 3: System Demonstra- tions), Bangkok, Thailand","venue":"ArXiv.org","work_id":"24719a41-c6b7-4b70-a1a4-af1ecdc18a47","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:974204d3841b6116153e7f73ba4ddf13bbada050dcd7184a25193ac985321d80","observation_id":"071fa43e-982e-4eb2-b78f-fd27e1edc040","resolution":{"observed_at":"2026-05-10T05:36:01.992928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13148","last_updated":"2025-02-21T20:53:08Z","snapshot_observed_at":"2026-08-05T03:04:44.966583Z","submitted_at":"2024-02-20T17:04:06Z","title":"Defending Jailbreak Prompts via In-Context Adversarial Game","version":3},"cited_work":{"arxiv_id":"2402.13148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13148","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defending jailbreak prompts via in-context adversarial game","venue":null,"work_id":"411c98f9-da98-438e-b1a8-a6071b3ae0b9","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2402.13148","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0c9ba968499b38eaabfb66e14fa7f9f6f5b047a897a4e7a3611f84f8fd6c7fc9","observation_id":"d5e49c82-93f5-4adb-b388-7b1d2a99e7c5","resolution":{"observed_at":"2026-05-10T05:36:02.001919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:41.996521Z","title":"2023 , publisher =","venue":null,"work_id":"6ef22063-0062-46a1-aa85-de21fda4a133","year":2023},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f293368f4c39a555e31dec193d566cbc94ac2cad70ed26790db2e214c5aa9012","observation_id":"698142b3-acf4-4bd0-8187-5ea823064abd","resolution":{"observed_at":"2026-05-21T20:14:21.135657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"b83f502e-39f1-452d-8dff-2f73c20b75a4","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f37fe588a80ea965d96e4c0857d5672ee7a194bd3174521742ec57948d2a3982","observation_id":"8e36973e-67df-41e7-9a97-302f3a39317d","resolution":{"observed_at":"2026-05-21T20:14:21.144077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"b3ae4e6e-f1c1-4549-87b9-725ffb5937e0","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:2f8156cd4976da528eefb50be64522b52e73a2cce50cbdd1ef24dd8518e73156","observation_id":"678442dc-6f4e-4b81-9c71-cf18cc9545e6","resolution":{"observed_at":"2026-05-21T20:14:21.142084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":"45911ec3-2ab5-41ea-83da-1fbc0672d1ca","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:b13a6071bdf7f91eef8b7a54b6f23d6fbbb213f3f4dbf79c44404954e59aa6b3","observation_id":"82b04643-3a14-492f-813f-e86bb6a40b19","resolution":{"observed_at":"2026-05-21T20:14:21.152295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.617","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Large Language Models by On-Policy Self-Judgment","venue":null,"work_id":"61eb7563-2dab-49e2-9900-d1e209917d0e","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f662ac1852d3236fc2aa1712f84c2fa7a8a70a17defef6c749e79a2d5d25776d","observation_id":"45f50f34-9bc3-4bc8-bc40-73d74df433d9","resolution":{"observed_at":"2026-05-10T05:36:01.404182Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0369955-0b30-4c1f-9583-3ba88c06c2c7","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:beb2e27a2ff4c10dfbb9416b0feb028ebfd566cb3bce2fa882ec485c3e4c5b38","observation_id":"b657e844-1f88-4e90-bfe9-b4ed64598212","resolution":{"observed_at":"2026-05-21T20:14:21.154192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"1d21629f-fad9-42b4-b25c-123dabbeed31","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:4e3db1cf8d54681549943ac7e7f07479b110111833e0e1a28e272bef657a2ffd","observation_id":"d77c955d-4b00-40ee-8a6e-d31116646c74","resolution":{"observed_at":"2026-05-21T20:14:21.164119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:52:44.733481Z","title":"2024 , url=","venue":null,"work_id":"d577c796-0174-49ab-86bd-4ef0f17f8566","year":2024},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:15ce2f4171b5d0c3b98beadbb9ecadc9c504b4fc5a124e4432e4f411fb457b11","observation_id":"f71a7038-d81c-4929-b5a1-7fed1804b6cf","resolution":{"observed_at":"2026-05-21T20:14:21.160158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"a5d16709-2a6e-4624-9dc1-182465eb4f6c","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:49ba0d4d6b20306d6d9f140af609001f062d2df18bbaedeb0bb430728f3b7d37","observation_id":"2c8918ec-5cca-43ce-b873-f66263a5a20c","resolution":{"observed_at":"2026-05-21T20:14:21.131627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"da615d40-2a0d-4fcd-8db3-9387499c9795","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:b0d35ac145366aa445d059b6e951ed51d98f6091c80326df5f5e74dddc51af1a","observation_id":"3d562eac-0960-4867-9192-5a117513b837","resolution":{"observed_at":"2026-05-21T20:14:21.148048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20347","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.670758Z","title":"Serl: Self-play reinforcement learning for large language models with limited data","venue":null,"work_id":"504cbf18-21bd-46c7-81c6-de09bc479215","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:e4a021a859a5ed201797b1abdcf3c47929361410c4bf6b9874a315259ead6fc0","observation_id":"3837c19e-f352-4972-aee6-56285219ce18","resolution":{"observed_at":"2026-05-10T05:36:01.977673Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-07-06T21:39:42.169262Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:d70e9a92ed83ac317dcf03d88d9870242d5b5196be4a5255645ac1b157aa6db3","observation_id":"24083e58-3a7d-4795-ad66-57b4b709d172","resolution":{"observed_at":"2026-05-10T05:36:01.961406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.406410Z","title":"arXiv preprint arXiv:2509.15194 , year =","venue":null,"work_id":"9e4533d3-39f4-4116-a575-d72a6e615941","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:ce3b9da303527c772e12f081cea4cb44c86ac19dad2ebdbe1e1b2ba0bb99eb50","observation_id":"68a635f4-60e6-45b8-9935-fb20d3e069d7","resolution":{"observed_at":"2026-05-10T05:36:01.949886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.365086Z","title":"arXiv preprint arXiv:2509.23095 , year=","venue":null,"work_id":"46a537b9-d8f5-460a-a9ad-522b2fa5ed2e","year":null},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:3f4261932e2cf7e2c9d8c320011b99365fe0c05d6fafac2ee49fbb67aacc129f","observation_id":"07669db1-072f-490d-bc54-986566efa132","resolution":{"observed_at":"2026-05-10T05:36:01.988613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01591","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.370160Z","title":"Clue: Non-parametric verification from experience via hidden-state clustering","venue":null,"work_id":"28256fa9-401d-4343-9020-980de25d141d","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:34af0dc43a23187035cdb623388f7652ed6df4d71717d1f14f58c118e1aa9ac1","observation_id":"5162493c-3ae6-416d-8e69-bcf803ca90cc","resolution":{"observed_at":"2026-05-10T05:36:01.972859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.372600Z","title":"Can llms guide their own exploration? gradient-guided reinforcement learning for llm reasoning","venue":null,"work_id":"2a20b1ce-d30e-4599-9057-c9f6932478b7","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:87fc21f417a2181fca5769a34c4ff809f8337da3a77cc7d054009c4b13d101f0","observation_id":"7d2189a3-1cd6-40b3-834c-fc70876c7e91","resolution":{"observed_at":"2026-05-10T05:36:01.986460Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.394004Z","title":"Exploring multi-temperature strategies for token-and rollout-level control in rlvr","venue":null,"work_id":"176f10fa-68a7-4fe9-a839-87a35639a826","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:42c68fa680434cbcf16c0f1f825e2dcdff51a5aeef6ae5f6b14d9c20bab84aab","observation_id":"ac91009d-f39c-4271-9c98-335f9dd7d980","resolution":{"observed_at":"2026-05-10T05:36:01.970575Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:39:46.072456Z","title":"V ogue: Guiding exploration with visual uncertainty improves multimodal reasoning","venue":null,"work_id":"68f80ef3-f364-4bb2-9193-83ea68d5b8da","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f43fc2d08e0770047fa6b172e563e178ade3f4691d7de417b5ca5baf43dff974","observation_id":"de6189ef-5623-4637-a986-bdee79e7b202","resolution":{"observed_at":"2026-05-10T05:36:01.942930Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.627804Z","title":"Visplay: Self-evolving vision-language models from images","venue":null,"work_id":"283f2b88-cd61-482b-bd8c-64fd7bd57e60","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0001dd9bf58c77564910564350d640eafd1d01bbb855ed29fe57fb1b15d53df8","observation_id":"7b8365cc-580e-4ddd-9fb8-b09be38c1ab5","resolution":{"observed_at":"2026-05-10T05:36:01.935863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:56.401499Z","title":"arXiv preprint arXiv:2510.02172 , year=","venue":null,"work_id":"f7ef98ea-f2a8-4642-b3e0-d62a5235723f","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:38787831d66fb99534b54d79a7443b1d066267f1208cbeeefb1c2180ca67af39","observation_id":"edfc3ae5-4955-4c93-bb1c-5879db03753e","resolution":{"observed_at":"2026-05-10T05:36:01.952217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:5388c873ffc85a094a0e7bc8506fa6cb29e9246a901b47c33a3931ca9533400c","observation_id":"aa87b846-4536-486e-aa05-534c6f69aa0a","resolution":{"observed_at":"2026-05-10T13:05:26.778195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:2fb3dbd55c8494d06d323994b85e36dbaef79b67631d5f0b012ff93dd2bc897d","observation_id":"29bfc979-f3e0-4a74-bd01-18b712687633","resolution":{"observed_at":"2026-05-10T05:36:01.940490Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f6c56959ef0985bb93e1cfdbb11cc1bd31e39b5b35dba0bb044cb7a935b51e87","observation_id":"2c94ed64-a235-4ca7-afe5-59f43d3d5e7d","resolution":{"observed_at":"2026-05-10T05:36:01.984213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0b4fd1ffe94502a461e1d6ea112e4823a42c3ba6dd85b5395833b73cb3b91997","observation_id":"0d3b114b-7072-4f2c-83fe-8eb9bab0386a","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:af91ddc14dc05e1adac64ce5b2dd883ed3dd029768c06c72c0d59082693b57b5","observation_id":"91e51ab2-e4e0-4a61-b9fc-5863ab8ade4b","resolution":{"observed_at":"2026-05-10T05:36:01.954519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.401684Z","title":"Save the good prefix: Precise error penalization via process-supervised rl to enhance llm reasoning","venue":null,"work_id":"5419b17d-0e9d-40bf-ab19-7ee39f8c99ab","year":2026},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:f4d108683ee2d6f544e5a50931faf6c8635a27623220b72ea1b93874ddde8dd2","observation_id":"98630689-e10f-4b36-b5a8-5e003b457348","resolution":{"observed_at":"2026-05-10T05:36:01.956824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12124","last_updated":"2026-06-04T09:33:04Z","snapshot_observed_at":"2026-08-03T00:00:10.451907Z","submitted_at":"2026-02-12T16:13:14Z","title":"Alignment Risks from Capability-Seeking RL Training","version":2},"cited_work":{"arxiv_id":"2602.12124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12124","snapshot_observed_at":"2026-07-03T14:28:31.396535Z","title":"decisions","venue":"cs.LG","work_id":"59cdeeb9-646e-46e2-a68e-2ff2b30d1640","year":2026},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2602.12124","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:be9c2ae3ca8a2b5dc4bc7842a3e119b8cc041e21484107fdd5347ac9df6eb56a","observation_id":"ae620dac-a917-4846-9c49-b721a7444220","resolution":{"observed_at":"2026-06-05T02:16:23.300865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.404131Z","title":"Stable and efficient single-rollout rl for multimodal reasoning","venue":null,"work_id":"73a31322-9e67-40d3-8e03-0d781eb8fa65","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:957d5beb1d595286ab99d388ba3d9314ad785d7963bc39c5daf51e2e81f93340","observation_id":"64d68eea-30f4-4754-b8df-bf4de29647c5","resolution":{"observed_at":"2026-05-10T05:36:01.982078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":42,"parse_uncertain":0,"unresolved":1,"verified_exact":15,"verified_fuzzy":19},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2604.18493."}