{"as_of":"2026-08-07T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:456bc8a586c316373be2e3b34f626bcb511cd4a6d2e245e48d8645fb4cd1a37f","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:26:08.536798Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:18:39.658589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T22:43:37.868176Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:530d255ebb3dc2b98940baf19d4795f7de53f4732dd2a4253a513faa5bb7455c","observation_id":"cc5cb283-56ab-47d4-a8ee-94f90b6acb05","resolution":{"observed_at":"2026-05-16T22:43:37.870506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2603.11321","last_updated":"2026-04-04T03:49:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T21:33:41Z","title":"Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T12:44:50.752937Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2603.11321"},"observation_digest":"sha256:1456d4a7b4f490c8cf40c213afcf59fb04cda6b174e51472aae30d935d932b5d","observation_id":"73d7339c-e9ef-4e58-b417-a13640e62122","resolution":{"observed_at":"2026-05-15T12:45:37.299666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2604.06079","last_updated":"2026-04-07T16:58:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-07T16:58:14Z","title":"Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T19:45:40.915428Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2604.06079"},"observation_digest":"sha256:fe5934e0bb9e4fe2f441a482655218d8bf4e15ebf10c99cddcef8be68c036a22","observation_id":"d0d6a44c-6a40-42d8-bd33-517004870c9c","resolution":{"observed_at":"2026-05-10T22:30:53.376328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2604.08926","last_updated":"2026-04-10T03:42:16Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:42:16Z","title":"Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:26.829527Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2604.08926"},"observation_digest":"sha256:a05792892140df23100515d93a41e079994aa4b8b940bf3d2e175424eff2867e","observation_id":"4757bf6b-42e1-436c-812b-69a03b3cd5cf","resolution":{"observed_at":"2026-05-11T08:06:00.003903Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-08-02T10:18:39.658589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22642","last_updated":"2026-06-24T00:12:03Z","snapshot_observed_at":"2026-08-07T04:06:13.678510Z","submitted_at":"2026-06-24T00:12:03Z","title":"CRAFT: Learn the Schema, Execute the Plan","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T10:18:39.658589Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2607.22642"},"observation_digest":"sha256:2cecee2e55ee633f0e05dc3db2ea378e33be92508041f4786d0ae52b301716d8","observation_id":"b7e02888-5225-4b44-9d33-6f18a8d8d872","resolution":{"observed_at":"2026-08-02T10:18:39.658589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-07-31T21:13:06.724007Z","title":"Chen Zhang, Luis Fernando D’Haro, Yiming Chen, Malu Zhang, and Haizhou Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24199","last_updated":"2026-07-27T09:24:41Z","snapshot_observed_at":"2026-08-07T18:43:26.314228Z","submitted_at":"2026-07-27T09:24:41Z","title":"Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T21:13:06.724007Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2607.24199"},"observation_digest":"sha256:42dc6c939cd8bda1015bd972c4393cd39ad530102ec2bd3186f7fd6e836a4691","observation_id":"94b467e5-494d-45ae-ab3b-100edb5b663d","resolution":{"observed_at":"2026-07-31T21:13:06.724007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.08267/citation-record","integrity":"/paper/2507.08267/integrity","json":"/paper/2507.08267/citation-record.json","paper":"/paper/2507.08267"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.461183Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.461183Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:8fc11e4bac15a2f5d79bffc3eaa72925ee5b1ba045eff138e766d818fc5444d5","observation_id":"b57bf2b3-6c37-4caf-9e90-3603c8f86b2f","resolution":{"observed_at":"2026-08-06T18:26:08.461183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T18:26:08.464611Z","title":"and Welleck, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.464611Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:4022a4c431eaf02891aae9a4e387f67f52e47881d0892bfa720bbf9c2c7e12d3","observation_id":"64f6567c-e674-4803-a3b2-9a077cd0b661","resolution":{"observed_at":"2026-08-06T18:26:08.464611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T18:26:08.467197Z","title":"V., R \\'e , C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.467197Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:c0dece962112cd43ddb8434a19b9e8301fc7aae489df8435a7c922d0bceda3e5","observation_id":"92ed019e-744e-403f-88e5-6f7c2f51ed3d","resolution":{"observed_at":"2026-08-06T18:26:08.467197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.946447Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"2079d7e9-ecff-43f2-9927-d6f3a3d79345","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.470895Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:e92e300bfaa1aab1ab12a71bb7edee0dc69fd1cc27484dd34151f11b2be8c9be","observation_id":"3fe5eb46-0af6-40a4-9cdd-03814bc37907","resolution":{"observed_at":"2026-08-06T18:26:08.949427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.473351Z","title":"and Ngo, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.473351Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:887e30e46799f0d40a556a3ceecb9214c2035a62225887ed6d7c234828319b54","observation_id":"7e909581-2699-444c-a2d5-827300282a19","resolution":{"observed_at":"2026-08-06T18:26:08.473351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:26:08.475643Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.475643Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:f474f008d6857744d6f63b40ff4951646ddc33265db98c36688e70cb10d13484","observation_id":"37aca5f0-c980-4c84-ae41-f2358fc22c83","resolution":{"observed_at":"2026-08-06T18:26:08.475643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.477985Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.477985Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:511584e0d7f3b82aa377f5e39073134b38a23eaa5c9897038f17800d63ad694f","observation_id":"580f2210-02d4-4d7c-aa92-f4e60816498c","resolution":{"observed_at":"2026-08-06T18:26:08.477985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.936075Z","title":"C., Buzzard, K., Gowers, T., Liu, P","venue":null,"work_id":"78008d55-7b16-47e1-add8-35e47eaac3ca","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.480618Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:4d3670914447ba87fd74573b9963e58b25cb55cf80147605db5214d38e1c64e0","observation_id":"f6258d02-8f85-4857-8d2d-d5583d8f9fdc","resolution":{"observed_at":"2026-08-06T18:26:08.938412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.928733Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"862dbaab-593a-419b-b42d-e81ba19b23ae","year":2021},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.483094Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:0ec401aed7a95ea5eba78cb603489c7c4499cce26e945fe38b2a770b8fb2570e","observation_id":"f6dfa5ca-d1dd-4f0a-88ba-63076368c673","resolution":{"observed_at":"2026-08-06T18:26:08.931008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T18:26:08.485151Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.485151Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:1b74dc38bf059e504d99b451f3b3de92a4007b906f693370e44bdf0f476b1b91","observation_id":"71208300-83d6-435a-8ee8-eb585246e9b9","resolution":{"observed_at":"2026-08-06T18:26:08.485151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.921969Z","title":"C3ot: Generating shorter chain-of-thought without compromising effectiveness","venue":null,"work_id":"4a53ca59-f617-4956-9574-3e8bbd04d312","year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.488176Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:f0ded786f9dec9fae526b4ac73147286c1ff7941142d7b86a61957da1de5087a","observation_id":"3bf86600-963a-49d0-b315-4e4c9a5dd9a4","resolution":{"observed_at":"2026-08-06T18:26:08.924347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T18:26:08.490527Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.490527Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:13cd1d0782b120836497662aadbf6fa56faf7d77fc45f23001850af5722de130","observation_id":"34d686bd-584d-427a-a481-721473558fc3","resolution":{"observed_at":"2026-08-06T18:26:08.490527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.914952Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"467a12d3-2268-400f-903f-9c516d245347","year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.492780Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:a459a848ed011d0cd5ba9ed9cde54e7130d7b42e66be8ad780409bd7894c3b63","observation_id":"97a5c783-791f-435b-8a72-10a9db1142a4","resolution":{"observed_at":"2026-08-06T18:26:08.917123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.494732Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.494732Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:3a91a09505f220dd424652880d14600238ce7ca88d65ef0e7f1a44d3bceddc6e","observation_id":"86cb55e2-32e5-41a4-917c-00cdee1a533a","resolution":{"observed_at":"2026-08-06T18:26:08.494732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.903018Z","title":"Can language models learn to skip steps? In The Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":"fc206b3b-0236-40d1-a361-29a49b4d2997","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.496800Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:aae96e2006a6fd6dea0af5c3f5d537089479ada0a675d9580dfd9e378013e121","observation_id":"d67c5727-2112-4cbd-8b15-c01819965be2","resolution":{"observed_at":"2026-08-06T18:26:08.906089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-06T18:26:08.499132Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.499132Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:8d9b9c1a5252cec74a9d6deab3e8fbe781b5b39b8a8408899d32c76e78792e46","observation_id":"b6a561d6-ea7c-40c9-9b64-6c5474e58b1c","resolution":{"observed_at":"2026-08-06T18:26:08.499132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.501675Z","title":"Wider or deeper? scaling llm inference-time compute with adaptive branching tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.501675Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:2c2a1f44cff0777fa7284ac82384fbe3294000e92b8078831f15b27a0650c319","observation_id":"b34e44a7-7b90-4f77-b857-fadfa7d5e00a","resolution":{"observed_at":"2026-08-06T18:26:08.501675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T18:26:08.503965Z","title":"L., Fei-Fei, L., Hajishirzi, H., Zettlemoyer, L., Liang, P., Candès, E., and Hashimoto, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.503965Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:0987eaa609901a9939bf2da816b8f89bbad34307649f2f18d1c9cf7f1267f994","observation_id":"540f1a2e-80f3-4915-ab92-4d4b1f879a47","resolution":{"observed_at":"2026-08-06T18:26:08.503965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-07T17:42:49.612783Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-06T18:26:08.506610Z","title":"H., Yang, Y., Kim, Y., and Yun, S.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.506610Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:469312d2b4701b27d9813c404a33edb85a97bb9cb6d6d7ef6c9ebb0f6b1b49fd","observation_id":"2a50dcea-77aa-48c6-b002-3b3d8b4a68ee","resolution":{"observed_at":"2026-08-06T18:26:08.506610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:26:08.509681Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.509681Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:a4de86cfaf84ab3391ff28c4a4e7b463caabcb762b99df4ca9d1c7c792cf293f","observation_id":"58b1e904-03b7-4c56-81ca-614ffd5da247","resolution":{"observed_at":"2026-08-06T18:26:08.509681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-05T15:21:07.825807Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-06T18:26:08.512634Z","title":"Competitive programming with large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.512634Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:051cb6655268e6d8e2bf664a0af45190d57c1d053c7a47df2e9bcce3e65f0490","observation_id":"8bd696b0-af35-491a-bd05-22225f5cf6a0","resolution":{"observed_at":"2026-08-06T18:26:08.512634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.895749Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"b72ae8c2-1ca3-4f7e-9ebf-4ee4e50362a6","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.515249Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:974b3c8ed1b77f12edd83baa03f892550936d22122ec0d0297ffd2350becef1d","observation_id":"02302a27-eca4-4170-b3c1-f439d6e8558b","resolution":{"observed_at":"2026-08-06T18:26:08.898157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:26:08.517455Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.517455Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:5c7715a59e281138d2a507e9edc0b8f1a1e22ef0aa20c5cb7797957da01d45b9","observation_id":"8615f2d8-2c23-4121-9b1b-6851900bd419","resolution":{"observed_at":"2026-08-06T18:26:08.517455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T18:26:08.520090Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.520090Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:917274adf2c53b151ffb34b789247c76349f8d36d08eb21aee439c81d94ae16e","observation_id":"c9e81936-ede2-4c91-8adf-4e591b2ceaf4","resolution":{"observed_at":"2026-08-06T18:26:08.520090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.522615Z","title":"H., Le, Q","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.522615Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:ff723844d2afe86e9ee78f5371cf846f4def2e0a0dd128bd2364b0e9f4d71271","observation_id":"aa33f8c4-dc5e-4f4f-b329-bcc927e8dd22","resolution":{"observed_at":"2026-08-06T18:26:08.522615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-07T17:06:45.905806Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-06T18:26:08.525387Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.525387Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:e9aecd0b86b2ba2d05e8cfcd5aad9f5f16d42fdaabc2df609e24857f56ecc338","observation_id":"6c52c4c3-7204-4084-8ba8-a61935fa4f62","resolution":{"observed_at":"2026-08-06T18:26:08.525387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.883323Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for LLM problem-solving","venue":null,"work_id":"bbb0956b-7225-442d-9a05-9bc2a8ba167c","year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.527957Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:37b42a40210ba386057382dadf79545b02a41199ddae8ba11e7db974a06c1b31","observation_id":"2df7098c-9852-4f97-8a62-9c8852132e61","resolution":{"observed_at":"2026-08-06T18:26:08.885946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.530115Z","title":"T., Wang, W., and Li, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.530115Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:ab794791bf0e6d42da0cfd8a01d9a3b20c43bc829d3afcd1ee7b29e7dc6328e7","observation_id":"21d4e395-d743-4d01-aa42-52e48ab6cfea","resolution":{"observed_at":"2026-08-06T18:26:08.530115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-06T18:26:08.532302Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.532302Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:0f9eb34f43f2d6f752c5a08cc9aee75772cac0d29e9e6b7c51b7cbf904019986","observation_id":"8d0d3622-a270-4a90-b1b8-f81966e32d0a","resolution":{"observed_at":"2026-08-06T18:26:08.532302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.874330Z","title":"Demystifying long chain-of-thought reasoning in LLM s","venue":null,"work_id":"e70beb8b-e110-476a-a6c4-c0a1f59b9de4","year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.534689Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:ee7747519e14983406d1bece0e3379ed3e571514829ac46dcacb2a8069c1ef94","observation_id":"cb22ee4b-3048-4dc8-8a0d-33c50d00818a","resolution":{"observed_at":"2026-08-06T18:26:08.878484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T18:26:08.536798Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.536798Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:a30f5334db5c865b657b027a7ecbcb9302f03af9dc1705e7e536634131298774","observation_id":"432f3e6a-5dd0-4835-afcf-14f230158f4b","resolution":{"observed_at":"2026-08-06T18:26:08.536798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:21:13.792665Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 6 inbound Pith citation observations for arXiv:2507.08267."}