{"as_of":"2026-08-20T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc2b3f05c59866430f035aa0df3ce1eaf8381e277364ba025fe927f8cc1ed7bb","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T03:20:40.229376Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07674/citation-record","integrity":"/paper/2607.07674/integrity","json":"/paper/2607.07674/citation-record.json","paper":"/paper/2607.07674"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:a43e85159d9da9136b135b9ed0911e9ce08759c7f20b3fdb9dd2ed061d07559b","observation_id":"7feb0db6-746c-465b-8429-ab56ebe1bf9e","resolution":{"observed_at":"2026-07-09T03:25:57.826547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:57.801171Z","title":"Reuse your flops: Scaling rl on hard problems by conditioning on very off-policy prefixes","venue":null,"work_id":"2be8a44f-c445-4fc6-9eec-82c26f802afc","year":2026},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:8481cc8cf8a1a145d53c06c17d2cfaf4117e7ef2f3d9aa8f7168abab099f3cfa","observation_id":"549f727b-acea-40ef-95ad-c461e05d5f1d","resolution":{"observed_at":"2026-07-09T03:25:57.802842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18779","doi":"10.48550/arxiv.2601.18779","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pope: Learning to reason on hard problems via privileged on-policy exploration","venue":"arXiv (Cornell University)","work_id":"49d6a516-37ca-4bd7-8174-20b4b69db931","year":2026},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:e40553c8981ab8ee43e6047a625232cfdd9b47a124cffa52aac1dac9ba8498b0","observation_id":"a99ee716-3ffe-489d-8b5b-29fa8a1a2dde","resolution":{"observed_at":"2026-07-09T03:25:57.834564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-15T15:20:51.338738Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"cited_work":{"arxiv_id":"2507.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01679","snapshot_observed_at":"2026-07-09T03:25:57.822896Z","title":"Blending supervised and reinforcement fine-tuning with prefix sampling","venue":"cs.LG","work_id":"332ec991-94ae-4112-8658-b61d31b96f5a","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2507.01679","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:1e5f0232320221052dbb1e60f427425ce540f78ef17e1c34b7f054b54fd756cf","observation_id":"5563cdc8-2fe4-4eea-9619-a90c0e6f1c8d","resolution":{"observed_at":"2026-07-09T03:25:57.824146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:57.790089Z","title":"Scaf-grpo: Scaffolded group relative policy optimization for enhancing llm reasoning","venue":null,"work_id":"117a7e2d-1e9b-4af4-b12b-5442888b0847","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:cc5e57b63d3e87ea4d1a2d116e2f866db4f16af239fe500d8ec4ad893eea2bb1","observation_id":"af4623f5-24c8-43d1-b05b-d780020a0754","resolution":{"observed_at":"2026-07-09T03:25:57.791721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23905","last_updated":"2025-06-27T14:37:02Z","snapshot_observed_at":"2026-08-16T12:45:24.960151Z","submitted_at":"2025-03-31T09:54:55Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO","version":2},"cited_work":{"arxiv_id":"2503.23905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.23905","snapshot_observed_at":"2026-07-10T05:16:48.098751Z","title":"Pei Ke, Bosi Wen, Andrew Feng, Xiao Liu, Xuanyu Lei, Jiale Cheng, Shengyuan Wang, Aohan Zeng, Yuxiao Dong, Hongning Wang, and 1 others","venue":"cs.CV","work_id":"df4a012f-d754-4456-9abb-47743d3a28a0","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2503.23905","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:4141b7362d4b4327e98f58fd41e3ab1846260238243ce615367825be3bac8a75","observation_id":"cb77a87f-83cd-4b53-ac29-ce2a0c3b81e7","resolution":{"observed_at":"2026-07-09T03:25:57.810399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:57.827775Z","title":"arXiv preprint arXiv:2510.01135 , year=","venue":null,"work_id":"02edf1f1-72c5-4f73-9f10-13d8ece8f4b8","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:67733ea61e9243d9dfa894a27495f6ca192e4a913fecfa0b111232627332db42","observation_id":"20b9b9b3-b7dd-4fc8-a989-404cbf300221","resolution":{"observed_at":"2026-07-09T03:25:57.829414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05808","last_updated":"2024-03-17T09:02:02Z","snapshot_observed_at":"2026-08-16T16:48:38.451350Z","submitted_at":"2024-02-08T16:46:26Z","title":"Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.05808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05808","snapshot_observed_at":"2026-07-09T03:25:57.814784Z","title":"Training large language models for reasoning through reverse curriculum reinforcement learning","venue":"cs.AI","work_id":"53bde03c-0616-4cdc-ba9f-748188eb1b7a","year":2024},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2402.05808","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:2ea99d454be836066e40e6ffec74d6eb81f51ba7578d59f9235bdb1687299dcf","observation_id":"22afc2ab-00e6-4edd-aac9-940b8f276cd0","resolution":{"observed_at":"2026-07-09T03:25:57.816174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:e1d3948000ee9418169b1c55c16bcebd98ec8b3591663c566bcba96168aedeeb","observation_id":"6de9f22c-4787-4d37-8836-fd4369b43e5b","resolution":{"observed_at":"2026-07-09T03:25:57.808011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:5bc132460a4883b0bdf5969a5c27a5cce4d621d691554e8b126ff167d6d6c6da","observation_id":"a7fd83c7-f141-4b77-89ff-788be4ac41d2","resolution":{"observed_at":"2026-07-09T03:25:57.836976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:7cbf6e46006e065e7de88dd291b256d587a09b3b6cb0cd21813f3abbc761d7ae","observation_id":"cf77be72-9782-4428-ab86-11bc600eb237","resolution":{"observed_at":"2026-07-09T03:25:57.821678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:18bd1e8969259791c7a3dabfb1d6d0d9db763ec753dc2d504365ce9a0c3a2b7b","observation_id":"06adb3ca-45e4-45eb-92a9-a4eb7e0b4b1e","resolution":{"observed_at":"2026-07-09T03:25:57.831866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:7d7a80d9303cf4127611531ec9c3774d813d536231ff09c64d8944d3cb030acc","observation_id":"9d2b0d31-fa6a-4f94-a299-5a38af249d85","resolution":{"observed_at":"2026-07-09T03:25:57.839356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:b121e0431fb83fa565894dbaa2c56be204a31968484ac759a003239232e74258","observation_id":"4a1dc497-6031-4de0-87ed-b1c7a839baa1","resolution":{"observed_at":"2026-07-09T03:25:57.797458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:524288c664c00253b0e4d04676a970234dd259be449da2b0fd943b2edc5d29d3","observation_id":"0da35ac9-16c6-4de0-8812-3750e063f7ba","resolution":{"observed_at":"2026-07-09T03:25:57.794724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:57.811550Z","title":"Learning what reinforcement learning can't: Interleaved online fine-tuning for hardest questions","venue":null,"work_id":"77400081-d7b1-4be9-88ff-c1082c417c04","year":2026},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:0c213de4726f2959bf8623bacbbfbabe08158f52e72829525d7706db0b59e68c","observation_id":"737d1113-7763-432b-94e5-7e95e7e972a2","resolution":{"observed_at":"2026-07-09T03:25:57.813418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:a425f66fba63c30f2618f927f056e4bd8c2be147e99078f8b32c6a4d28be5206","observation_id":"b7ccd8a8-742b-4b69-9b5e-a9c96dc71207","resolution":{"observed_at":"2026-07-09T03:25:57.819124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-18T16:22:37.329414Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":"2607.02770","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-07-09T03:25:57.798689Z","title":"Gemma 4 Technical Report","venue":"cs.CL","work_id":"661325ed-d80b-46ad-856a-e5b534f99033","year":2026},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:144a6ae8a354d8c911202e67e5664d61a968686d956130309ad84cdc9587c3c9","observation_id":"5004e8d1-2b04-470e-9391-df500e37ae63","resolution":{"observed_at":"2026-07-09T03:25:57.800044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:f53a8afc8386353fcb6a45e505f59e67a32798f8d318efda232aa03a06317048","observation_id":"2dea5867-8b5f-49dc-9414-306428d24929","resolution":{"observed_at":"2026-07-09T03:25:57.841864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:5159696d1c17ab1d136ee4a49772ed748afd7e6a72fadf9bd51a462cf7d9eda0","observation_id":"0c14db54-8009-4346-b6c2-c90fc5dd85db","resolution":{"observed_at":"2026-07-09T03:25:57.805458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:faea760d2cf52310f491f296eb3b79f0a00b49e60c56a812511d0cf113577dd0","observation_id":"1f612d8e-6e7c-4fc5-a97c-28a4d692d36f","resolution":{"observed_at":"2026-07-09T03:25:57.788893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T16:47:45.733576Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.07674."}