{"as_of":"2026-08-09T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d25b13c7421d269235be5bb6f5782308cd60fa41477e63d98c0e57c95b2326f2","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:44:51.047658Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T17:03:13.686066Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2508.17784","last_updated":"2026-04-12T14:04:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T08:26:43Z","title":"Proximal Supervised Fine-Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T20:42:14.423836Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2508.17784"},"observation_digest":"sha256:024ac2d382855a224fa35479cf6a50909a49991f3fea143c5dd5896b1ed3bcb1","observation_id":"54a57a42-7d6b-497a-b993-a839ecc1914d","resolution":{"observed_at":"2026-05-18T20:42:50.932782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2510.01379","last_updated":"2026-04-19T08:10:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T19:07:16Z","title":"Multi-LLM Orchestration for High-Quality Code Generation: Exploiting Complementary Model Strengths","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T10:22:09.037783Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2510.01379"},"observation_digest":"sha256:76302808587a25d8e88d7d9015e97ec1af272c3a378605a0a44c656d2f2573d7","observation_id":"3f61dc23-2063-46c8-8d16-a499a3e67153","resolution":{"observed_at":"2026-05-18T10:22:33.306633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2605.00610","last_updated":"2026-05-01T12:20:44Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T12:20:44Z","title":"Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T19:05:51.423427Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2605.00610"},"observation_digest":"sha256:319b9d10ba7bf331babe03936ea7e2ec266a72be9b29fff419701baeb6f28424","observation_id":"1c44e9b4-86b8-4c9d-9515-fd5da3410e5d","resolution":{"observed_at":"2026-05-11T15:51:44.181536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2605.02469","last_updated":"2026-05-04T11:10:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:10:32Z","title":"Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:22.546508Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2605.02469"},"observation_digest":"sha256:97ce2f7c6cf888e9fda16c28ae32bdc87e4b39e8b8bdff4650a4b701e251f6e5","observation_id":"5a99cba9-220f-481b-9f34-85429aad88fb","resolution":{"observed_at":"2026-05-09T05:45:23.212875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2605.10973","last_updated":"2026-05-08T20:20:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-08T20:20:05Z","title":"Rotation-Preserving Supervised Fine-Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T06:26:20.393476Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2605.10973"},"observation_digest":"sha256:02a08b15d776f2c458c4acb6cd6a4318195656efd877bc18a675c749e9146468","observation_id":"c53f467c-925c-4fd4-b0f5-bd44f83690f3","resolution":{"observed_at":"2026-05-13T06:27:24.422736Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:4e08467a64fbffa8788775551186e8658309c1501ad79e0f32a0d36256bff36c","observation_id":"b6439b38-6462-46eb-b7c8-88e767908f8d","resolution":{"observed_at":"2026-06-29T08:03:13.954844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2605.31455","last_updated":"2026-05-29T15:49:13Z","snapshot_observed_at":"2026-08-06T06:42:59.945235Z","submitted_at":"2026-05-29T15:49:13Z","title":"DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:49.358792Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2605.31455"},"observation_digest":"sha256:5a03471cd7cd9b3eb74d5b914952acfec23458ae4963a22e8d7d5c275aa1e879","observation_id":"353feea3-2ed2-4330-92c0-23c886e339e7","resolution":{"observed_at":"2026-06-28T23:22:47.435668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2606.09396","last_updated":"2026-06-08T12:14:06Z","snapshot_observed_at":"2026-08-02T09:59:19.994689Z","submitted_at":"2026-06-08T12:14:06Z","title":"PriFT: Prior-Support Guided Supervised Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:09.015766Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2606.09396"},"observation_digest":"sha256:0cee8c89f9a88be1bfb74b8357b6495bd12737932bf3dee1c274abf94bc83f34","observation_id":"4d8fce38-062b-45f3-8b32-d81b7b5715d8","resolution":{"observed_at":"2026-07-03T00:57:29.908830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-07-06T23:49:12.754871Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:068b69018a13779e943b46c38775453a6f16ce575ed956d351c04f467acccbdb","observation_id":"197441d6-2553-4e83-98c0-184d73a79727","resolution":{"observed_at":"2026-07-02T22:27:26.355797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2606.11206","last_updated":"2026-04-22T14:47:30Z","snapshot_observed_at":"2026-08-04T23:02:24.231983Z","submitted_at":"2026-04-22T14:47:30Z","title":"Compatibility-Aware Dynamic Fine-Tuning for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-05T02:27:50.369374Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2606.11206"},"observation_digest":"sha256:480060eeb1cd21bb67e9c0acc872f780c73b8e46354ba6401003f2be0d812531","observation_id":"4e3531e1-fe33-4e57-97ba-b04f0faf917c","resolution":{"observed_at":"2026-07-05T02:30:40.844795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":"2507.12856","doi":"10.48550/arxiv.2507.12856","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chongli Qin and Jost Tobias Springenberg","venue":"ArXiv.org","work_id":"dbe7eff5-4fbf-4dee-b0e2-0c360577b8e0","year":2025},"citing_paper":{"arxiv_id":"2606.24064","last_updated":"2026-06-23T02:14:12Z","snapshot_observed_at":"2026-08-01T19:53:34.208327Z","submitted_at":"2026-06-23T02:14:12Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T00:39:29.703711Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2606.24064"},"observation_digest":"sha256:9ccb16e064af458218930f30a6714d6a54413ab12dd4c212ab30814ce77ed2e6","observation_id":"01422f85-b83c-4c76-ab8e-e3f2056d0f89","resolution":{"observed_at":"2026-07-04T16:29:57.043899Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12856","snapshot_observed_at":"2026-07-11T17:03:13.686066Z","title":"arXiv preprint arXiv:2507.12856 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04574","last_updated":"2026-07-06T01:02:30Z","snapshot_observed_at":"2026-08-07T10:27:24.643931Z","submitted_at":"2026-07-06T01:02:30Z","title":"A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-11T17:03:13.686066Z"},"links":{"cited_paper":"/paper/2507.12856","citing_paper":"/paper/2607.04574"},"observation_digest":"sha256:7dfd80a53934f774bc66583cbac3f97dc7ccb5b3acb85552b97911c6cc7fc35b","observation_id":"6f56a063-4987-42b8-8411-20189f8b2049","resolution":{"observed_at":"2026-07-11T17:03:13.686066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12856/citation-record","integrity":"/paper/2507.12856/integrity","json":"/paper/2507.12856/citation-record.json","paper":"/paper/2507.12856"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:45.401136Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:45.401136Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:5e5337f22bb0f163d2b676a16bac3d8a12fbfb37b0d54e492276529b36538207","observation_id":"afb97173-c846-4dd5-aa11-24107e077d56","resolution":{"observed_at":"2026-08-06T16:44:45.401136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T16:44:45.500663Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:45.500663Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:e2936fb013e29683f5c7d3bf01a7bca52890416d6be83c99d85467173d735aea","observation_id":"2ae96b4f-752c-4734-b189-ad82e388fa32","resolution":{"observed_at":"2026-08-06T16:44:45.500663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-06T16:44:45.719179Z","title":"Rlaif vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:45.719179Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:0cdb21b0e2dbe2dc2290750d6dfcf83986bb6090b6b0c0aaf613468e28262150","observation_id":"2dd8d10b-7d19-4cf4-837d-47a1138126a0","resolution":{"observed_at":"2026-08-06T16:44:45.719179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T16:44:45.773825Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:45.773825Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:dcb8487c22e6cc79fa29c6f33835aae8fcefedc88502faed29dc5ff124494478","observation_id":"e196e2bc-700e-4987-ab05-180d411725d2","resolution":{"observed_at":"2026-08-06T16:44:45.773825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:44:45.860300Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:45.860300Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:b5a5acb3a432cc7b72ef66ba371d5156f0d113c2b6c87e57b2a7b35b108f35c9","observation_id":"fde1362d-60b9-4d0e-8d05-604669c47cd2","resolution":{"observed_at":"2026-08-06T16:44:45.860300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:44:45.911559Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:45.911559Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:b46da45849fd72dc72960cce6f91ecb660a7ef1c764d345d2249196eb4614dbd","observation_id":"8300ce0c-2d2a-4072-8b57-4d8ea246b60a","resolution":{"observed_at":"2026-08-06T16:44:45.911559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-06T16:44:46.002490Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.002490Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:5eb91f3c2c18f559836ba9e7cf4e9af1b5882667410984df6db8b8e96c054c44","observation_id":"7c232c5e-c530-4ae6-92d8-14ba6956428d","resolution":{"observed_at":"2026-08-06T16:44:46.002490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-09T00:46:31.152615Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-06T16:44:46.084746Z","title":"Remax: A simple, effective, and efficient method for aligning large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.084746Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:8e0ae02c5f711a1df244d43ec9ece7876f95eadfaacdd0434ac18739bb96159f","observation_id":"62ef0cf6-7c98-4fcd-90de-0686f7a6e8d3","resolution":{"observed_at":"2026-08-06T16:44:46.084746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:46.142290Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.142290Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:3bd4f4618985a8602f1c7958bea1e198a1b79802053348eab3dae06a02242401","observation_id":"b86cc15b-f822-4864-ae8e-5ebee5ffefb5","resolution":{"observed_at":"2026-08-06T16:44:46.142290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04166","last_updated":"2025-03-07T10:51:04Z","snapshot_observed_at":"2026-08-08T12:24:13.216966Z","submitted_at":"2024-10-05T14:04:03Z","title":"Learning from negative feedback, or positive feedback or both","version":3},"cited_work":{"arxiv_id":"2410.04166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04166","snapshot_observed_at":"2026-08-06T16:44:52.425401Z","title":"Learning from negative feedback, or positive feedback or both","venue":"cs.LG","work_id":"99760e95-1f53-4558-a988-f02730abd6f8","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.237472Z"},"links":{"cited_paper":"/paper/2410.04166","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:275441529b67df1346d7534a27215c6203916d666e261a0631dc717fe6efdc35","observation_id":"bfb073a7-0f9e-4f28-a85d-514a64fbb332","resolution":{"observed_at":"2026-08-06T16:44:52.510853Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T16:44:46.335618Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.335618Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:aba7c7f5fc6a5676b7abd6ded149349b2cd7292224efe61291d5d04ef0ccf6c6","observation_id":"5640087d-64d5-4b35-ab97-d304c031a795","resolution":{"observed_at":"2026-08-06T16:44:46.335618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-06T16:44:46.435921Z","title":"Reinforcement learning for reasoning in large language models with one training example, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.435921Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:1cc06ae18908fc7a88fe2c0f5c421dd7c203a2f9ec7d3a6f953253bcd977873d","observation_id":"4f91e8dd-5014-4aa0-afd3-33baf1614ff9","resolution":{"observed_at":"2026-08-06T16:44:46.435921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.804015Z","title":"Peters and S","venue":null,"work_id":"9638891f-73e4-46af-816b-f11feb72a07b","year":2007},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.568818Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:87936caec2173b0e4d0c241c87aa23f92a4a37e30a90f17917c3b79a7a51e3ff","observation_id":"efee556c-471a-43b1-a52e-e3c1a6e1fe78","resolution":{"observed_at":"2026-08-06T16:44:56.861232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"file/7647966","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:52.193974Z","title":"Policy search for motor primitives in robotics","venue":null,"work_id":"63f3d926-2b28-4e8e-8f41-9255e0ea2fc6","year":2008},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.673807Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:6a47dd067fb7ce72e5e9778a6d2d6aedfaf1281dc3c4829cf7e9f37406ae49cd","observation_id":"b741377d-402c-46d2-8377-8ae21207358e","resolution":{"observed_at":"2026-08-06T16:44:52.290791Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-06T16:44:46.752711Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.752711Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:f2dc104744003b4721a084f869b916ce90fc0e7fc64d84c1ec4b435bb6e6ebf1","observation_id":"57f29dac-888b-4f4d-9cd4-52053917f724","resolution":{"observed_at":"2026-08-06T16:44:46.752711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T16:44:46.837944Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.837944Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:26654f5b229578558744122434cff4e51215235271704930b0990ccb51b859ef","observation_id":"6c0d0215-1793-4c1c-b3cc-6c7d45288ae8","resolution":{"observed_at":"2026-08-06T16:44:46.837944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.672381Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2020","venue":null,"work_id":"d47a8361-c26e-47ee-8a75-39a732b3d08f","year":2020},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:46.919989Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:553f3c75661a74107412637e0447841e9338a61d6155c87d2b5076cfa7a59367","observation_id":"16728588-cee1-4bd4-a0ea-133600395631","resolution":{"observed_at":"2026-08-06T16:44:56.734986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco.1997.9.2.271","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:51.186040Z","title":null,"venue":null,"work_id":"6e0306b8-2902-418a-9be2-fbceab92e2a7","year":1997},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.018101Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:e92273f368f5dd7466fbb52d17c9bec0fa91fc16dda17ef8a71259dfc1815112","observation_id":"8e88bc7c-02fd-4134-8a20-025d8f5fa7ca","resolution":{"observed_at":"2026-08-06T16:44:51.237564Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.538094Z","title":"Learning math reasoning from self-sampled correct and partially-correct solutions","venue":null,"work_id":"7d4df0f8-f09e-4946-9a51-ed7c90e3b386","year":2023},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.085028Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:c085f09d640d16abb5b9dc20a7955c97f21c9775c96595819e493b4e95a04eab","observation_id":"7ab64d06-7140-4cfd-99d0-38a5b645dc80","resolution":{"observed_at":"2026-08-06T16:44:56.594199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.401735Z","title":"Learning to generalize from sparse and underspecified rewards","venue":null,"work_id":"184178d4-4fce-4def-806a-a2220345eb77","year":2019},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.185820Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:68befd8fff806da8ed19195b6f9ac0230337fb156ecf48a7f176ed431cea05a7","observation_id":"83d709d3-e8cb-4135-8314-b8b5f1ab78a7","resolution":{"observed_at":"2026-08-06T16:44:56.440699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.284217Z","title":"Reward augmented maximum likelihood for neural structured prediction","venue":null,"work_id":"d74292f1-cf9a-429a-ab84-f8bcdd233b80","year":2016},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.286124Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:f0f0ac24292a82fe0b45f7450488cf84ff32791c63bb6ce863de274d880e41ce","observation_id":"d419a748-668a-4a22-8bd7-aaa10210dcb6","resolution":{"observed_at":"2026-08-06T16:44:56.339577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.174432Z","title":"Scaling relationship on learning mathematical reasoning with large language models, 2024","venue":null,"work_id":"29318c06-7335-4fef-b3ee-6634e689d3c0","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.353089Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:540bc187851104f42584464615ce45627bea7f3d8ed102e2ba6b0fa1a8a63bb8","observation_id":"c2cdac58-84db-41e2-ad62-c8f93657213c","resolution":{"observed_at":"2026-08-06T16:44:56.228534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:47.432332Z","title":"Simplify rlhf as reward-weighted sft: A variational method, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.432332Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:1b2dc66debdd15dbe27ab0c264d99c0039ea5a30a02e443e5b79e8ed1cfbf537","observation_id":"4a3e8de1-e1a8-473a-9616-c3df12e2d901","resolution":{"observed_at":"2026-08-06T16:44:47.432332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-06T16:44:47.542530Z","title":"Reinforced self-training (rest) for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.542530Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:66fe2941f59a6c2e0e7f9f1ac65dd002f81350f538e11c601d646326c159506d","observation_id":"257f81c1-d435-4a4a-875b-84f7e81c6f2d","resolution":{"observed_at":"2026-08-06T16:44:47.542530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:56.017115Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":"5650c2c0-b1d7-4da7-9e92-65286fd8add6","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.619956Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:de28cdca5633a7126d167c79a12b73617d8b9f4d034420b78975029346e93bbe","observation_id":"771076c3-756d-4b82-bf86-b02498f3c9c5","resolution":{"observed_at":"2026-08-06T16:44:56.075852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:55.913680Z","title":"Peters, K","venue":null,"work_id":"c9766510-f082-4cf7-864f-5f5db489d6aa","year":2010},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.751813Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:c3a4f114160b2cccf174fc697393cf3a40ab91ff0efb2bf3cf96c72f77bb51e9","observation_id":"fa584de8-e969-4035-84af-959a13e2f10c","resolution":{"observed_at":"2026-08-06T16:44:55.960423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.08967","last_updated":"2016-12-28T19:53:08Z","snapshot_observed_at":"2026-07-06T05:24:22.256948Z","submitted_at":"2016-12-28T19:53:08Z","title":"Efficient iterative policy optimization","version":1},"cited_work":{"arxiv_id":"1612.08967","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.08967","snapshot_observed_at":"2026-08-06T16:44:51.773550Z","title":"Efficient iterative policy optimization","venue":"cs.AI","work_id":"5186b2f2-c39d-440d-bb08-8c031df684e3","year":2016},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.819948Z"},"links":{"cited_paper":"/paper/1612.08967","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:7067447d8d9879b67c4676db84ebd159c3e1639eb2aace3fd131027cc0151826","observation_id":"0c3b15e6-3dbd-407f-982c-21099dd00054","resolution":{"observed_at":"2026-08-06T16:44:51.818563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.09202","last_updated":"2016-12-28T19:54:19Z","snapshot_observed_at":"2026-07-06T05:01:46.714126Z","submitted_at":"2016-06-29T18:01:15Z","title":"Tighter bounds lead to improved classifiers","version":2},"cited_work":{"arxiv_id":"1606.09202","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.09202","snapshot_observed_at":"2026-08-06T16:44:51.598505Z","title":"Tighter bounds lead to improved classifiers","venue":"cs.LG","work_id":"32c6f11d-5dda-4721-8d0c-670952e5a0e4","year":2016},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.885875Z"},"links":{"cited_paper":"/paper/1606.09202","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:81080a3b5c4d2b79330c2133e0f5b8d1598f9bd7e7cc06e2179f164d1bfe918c","observation_id":"4c08c25d-820a-4ef7-9dae-a1be44beee82","resolution":{"observed_at":"2026-08-06T16:44:51.678790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:55.788973Z","title":"Process for adapting language models to society (palms) with values-targeted datasets","venue":null,"work_id":"38041287-7b38-4edc-ade8-e58a08c1b6a0","year":2021},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:47.960817Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:1cd6ff61c42be18152eb9895364a93c6a82a4276f956443090893d36723edb1e","observation_id":"7997a69a-b90a-4623-8aca-0ab0520792b4","resolution":{"observed_at":"2026-08-06T16:44:55.847173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:55.603283Z","title":"Self-consuming generative models with curated data provably optimize human preferences","venue":null,"work_id":"1e7d0164-6d75-4022-9179-79cf97a54106","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.055088Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:1597baa5a569dc78d193e358b3a2bf59460add35f9cc4f53049bdcdf43327c31","observation_id":"c11d96f1-3267-4067-9e90-17b4b8c3e13d","resolution":{"observed_at":"2026-08-06T16:44:55.709899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:55.429404Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":"fa917264-7c9a-4178-a2af-632c8cd4f98c","year":2018},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.153226Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:348cccfd63c4206f246a4250222d7854369006eb3f65d38ee5a57a82568cf829","observation_id":"a97c8070-9390-4a67-b0ff-4be30d82d30a","resolution":{"observed_at":"2026-08-06T16:44:55.501691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08199","last_updated":"2023-08-01T12:02:58Z","snapshot_observed_at":"2026-08-06T05:04:03.524247Z","submitted_at":"2021-06-15T14:59:14Z","title":"On Multi-objective Policy Optimization as a Tool for Reinforcement Learning: Case Studies in Offline RL and Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08199","snapshot_observed_at":"2026-08-06T16:44:48.223183Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.223183Z"},"links":{"cited_paper":"/paper/2106.08199","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:584e94eb7374affb60a4d3626ee141302057174a59d3fe2063dd054430aa4db4","observation_id":"45f416fc-0333-48e9-97be-f7b45475e876","resolution":{"observed_at":"2026-08-06T16:44:48.223183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-06T16:44:48.304660Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.304660Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:8f55f0c1757c2a842fa4c4e7fa3435f79f8461c27b83661dc18685c70d72b6b8","observation_id":"29d5868e-4a55-4112-ad0a-c0eea351d23a","resolution":{"observed_at":"2026-08-06T16:44:48.304660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T16:44:48.492080Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.492080Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:a39db77a5dcc7549d888a291464e3de69dbe61d73989aa747c1a17839009961f","observation_id":"c4f35b25-c428-4649-b9d0-a82cccd0435b","resolution":{"observed_at":"2026-08-06T16:44:48.492080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T16:44:48.588072Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.588072Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:747f3cd477a5a4693d7b434f4712064a7f58264dd79a223ad8e75ce9d2144bdf","observation_id":"7d4a7ba3-4f64-4919-8e9d-09a6ea8441d3","resolution":{"observed_at":"2026-08-06T16:44:48.588072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:55.293430Z","title":"When does return-conditioned supervised learning work for offline reinforcement learning? In S","venue":null,"work_id":"ff7bf868-2867-4453-a091-d6923b0854ba","year":2022},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.689749Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:3cfb389ceffe63e8fe6da4c2bb42f8b9ce59ac62d3877ac80755c20c5aeff18a","observation_id":"6b54d76e-aa16-4dc0-9478-4302dc1c0d4b","resolution":{"observed_at":"2026-08-06T16:44:55.354255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:55.034755Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"cfa70b57-c08f-4c2f-a857-6ae042442c4d","year":2021},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.748441Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:67ce69a60da93c90b3958395b003a29e7ec4e46d0c8b2c9f69dd54fa99f682b3","observation_id":"57d6da3f-8e75-4292-9d15-21a48fb37d5f","resolution":{"observed_at":"2026-08-06T16:44:55.137459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:54.875529Z","title":"Kahn and Andrew W","venue":null,"work_id":"fabb727f-b4e1-47f4-846d-d6a4afa49361","year":1953},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.854732Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:35ac92d1ea758d0e9200086fa42e77404cfe32b66b05e0dd844a347887255b8e","observation_id":"fdd94b3f-bdf5-4ec4-a8a4-7e990cac77b1","resolution":{"observed_at":"2026-08-06T16:44:54.952638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:54.678875Z","title":"Rubinstein and Dirk P","venue":null,"work_id":"ea88798b-611e-4632-b145-2117a0b5919e","year":2016},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:48.934050Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:488568338bd2d2dd9d08a3482ee86fdbcb717848f98c4e7a29aa1412f5595546","observation_id":"a0d9b5b8-8fbb-4d1f-baef-1e95294083a1","resolution":{"observed_at":"2026-08-06T16:44:54.740440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:54.521032Z","title":"Stochastic simulation","venue":null,"work_id":"2afc74fa-4a76-4703-8abf-08c577858bcb","year":2009},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.002793Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:03d0cfa3a0f8ccee7018d0c6f4072714e0f0ba75d55df3e9a8c0c8f74a804f1d","observation_id":"88f4b4b9-f99e-4300-aeea-dd32ec107cd3","resolution":{"observed_at":"2026-08-06T16:44:54.569844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:49.093487Z","title":"Doubly robust off-policy value evaluation for reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.093487Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:9c1a50e81bbec05b3b1e91c18e598991622c8b87943405224e9d4dfaeff83426","observation_id":"d1290aa6-45e6-4f4f-bdb3-f7946219a033","resolution":{"observed_at":"2026-08-06T16:44:49.093487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:54.265757Z","title":"Policy optimization via importance sampling","venue":null,"work_id":"1339b7aa-9608-4d97-a2e8-e9956cc377d8","year":2018},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.206149Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:bb33e15b9aaa9edfec6deaa284b77d441235c26e3ca09a682340bafce9850fc2","observation_id":"a26b3599-c974-47b4-808f-22057a1eaf14","resolution":{"observed_at":"2026-08-06T16:44:54.382252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:54.152324Z","title":"Andrad\\'ottir, D","venue":null,"work_id":"43f2c4c2-b0ba-40f8-a36e-8ee7e596a160","year":1995},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.260480Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:bca895dd250d7f678bc36e4a18669eeafcd3e8a634c56863cd13096430f296b1","observation_id":"f2d7eba5-97db-40d1-8f10-b4034d166bbe","resolution":{"observed_at":"2026-08-06T16:44:54.218210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T16:44:49.354945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.354945Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:00f177d8361754ebc0e80e87cffe385905c056dd45424a6f976387f3d654225f","observation_id":"cced70b8-1f35-4901-b3c6-883f2bf2c9db","resolution":{"observed_at":"2026-08-06T16:44:49.354945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:54.006687Z","title":"Numinamath, 2024","venue":null,"work_id":"7398c4cb-662a-45c8-952a-13e1127556f5","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.442132Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:c797199419d1bae1d969c842bbf1f48ea13bb93c8609ab9d103a4ead5a95eebf","observation_id":"9d50992c-f704-45d8-853f-9a1058b752be","resolution":{"observed_at":"2026-08-06T16:44:54.057836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:53.788587Z","title":"Aime, February 2024","venue":null,"work_id":"78ba1b4a-a857-455d-a18b-a185fcc71a0c","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.572838Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:c8128c3d846008b8c0acd09974c4f84a870f152365ffec22dc5c9e57cc93f78b","observation_id":"a673c9d4-9d75-4660-8609-a19683a7ce93","resolution":{"observed_at":"2026-08-06T16:44:53.913396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T16:44:49.647176Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.647176Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:42e6c3b76ccb564d2b6e89359fee893f7fc78b30aa2ca37cb2242c833e11bf00","observation_id":"0c4b594e-f0a2-43cc-8651-0f6f4b6a0a1d","resolution":{"observed_at":"2026-08-06T16:44:49.647176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-06T16:44:49.735291Z","title":"Agieval: A human-centric benchmark for evaluating foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.735291Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:879279c75b068fc33658a9f691b2293ca9ea8480452229b6e96f1c59a1021c79","observation_id":"336f7a07-a1a9-4885-9ce8-204c9c234a51","resolution":{"observed_at":"2026-08-06T16:44:49.735291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:53.592255Z","title":"Gemini 2.0 flash thinking mode (gemini-2.0-flash-thinking-exp-1219), December 2024","venue":null,"work_id":"4b256c8f-9f31-47a9-b19a-fb28e13cbfaf","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.816139Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:4e928e803553316c666b233fa4f671e759f4c267be8faecaf2bc7bbf9759e1fa","observation_id":"ae6dc2d4-66ed-44d4-9409-536ced3b8c14","resolution":{"observed_at":"2026-08-06T16:44:53.691885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:49.880551Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.880551Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:e31dcd731622489bda1e8f2e8f031c9156c26cd790f9fb7fc85144a301f8fcce","observation_id":"4ee868a3-7f94-42d6-b3e0-f291b78a9a62","resolution":{"observed_at":"2026-08-06T16:44:49.880551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:53.402501Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":"4b007dfd-ae61-43fe-a66a-a243fdbaee42","year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.948834Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:31f7339fcd7dd3c9d8ee034ba03817e08e7d1d4d602a5480ce222d10b18b72c7","observation_id":"f4d49f26-0a3f-4942-8c82-e2dd23e1a758","resolution":{"observed_at":"2026-08-06T16:44:53.487524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:53.227701Z","title":"Bespoke-stratos: The unreasonable effectiveness of reasoning distillation, 2025","venue":null,"work_id":"20fcf335-b48b-407b-b7ac-ed5fa1f12144","year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.031931Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:7e5dd84b52800f45976a7b3f471912731d428c976352cdcc1d815f5a158eefd2","observation_id":"7470890e-5934-4df4-85ca-ca63db0f7f60","resolution":{"observed_at":"2026-08-06T16:44:53.298736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:53.081049Z","title":"Sky-t1: Fully open-source reasoning model with o1-preview performance in \\ 450 budget, 2025","venue":null,"work_id":"e5c13e62-07c7-4e50-9ef8-d2c3fd0eebad","year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.135012Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:86549c5f825ffae5ba7c6a18bf4c035df2b2cbc94922bc613980e2f6ddad6924","observation_id":"668ec223-1aa3-4844-b3d9-059bb8fb9e58","resolution":{"observed_at":"2026-08-06T16:44:53.146540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:52.901891Z","title":"Gemini 2.5: Our most intelligent ai model, March 2025","venue":null,"work_id":"40ed8ce0-2d48-4348-a9f9-94f102d182f1","year":2025},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.200843Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:2d5fe165f679bdcf1c680d272e0d7d45dcd063a3215a33682ac4ae36e91ad6e5","observation_id":"a47ffc63-3e48-4a2b-a199-8c7edfecea5b","resolution":{"observed_at":"2026-08-06T16:44:52.995163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T16:44:50.258889Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.258889Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:41ccd4c26b17b2e55a15dcebbe9ab9b07f8fb89e869d9deaaf9f5609240909ae","observation_id":"d4722487-92ec-4734-942d-1a862edfe79b","resolution":{"observed_at":"2026-08-06T16:44:50.258889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-06T16:44:50.353512Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.353512Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:60b80c0580dbc5a7ebabe866117668919890e16373ed810b3d78e9c5e3ed71b7","observation_id":"2ee6a2d9-e86e-4377-8003-f89dea17118c","resolution":{"observed_at":"2026-08-06T16:44:50.353512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:50.436962Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.436962Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:cf4ea2130967d892292046c37d048ad8759af77fb00db7cef10bd441450fb740","observation_id":"151b4ce6-8c6f-4147-9149-2611c709b90f","resolution":{"observed_at":"2026-08-06T16:44:50.436962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-06T16:44:50.531632Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.531632Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:3c8480d8d54c2417a08a46892b4502f606fc1603146d15a86fe71a80c0e99813","observation_id":"5f45d04a-2659-4dcf-a7de-a64126f29578","resolution":{"observed_at":"2026-08-06T16:44:50.531632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:50.671535Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.671535Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:b448e88cae3632edae6467ce11aa877f03c21cfe52c88fa04b8e4f99681e518a","observation_id":"9adab734-26de-496a-b29b-9eb92f25db63","resolution":{"observed_at":"2026-08-06T16:44:50.671535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-06T16:44:50.738027Z","title":"Yang, Zach DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.738027Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:af52b69473c573b0e63fd13ae5ad16d498310ec957223e0b57f71a7c0cd69a2a","observation_id":"5eb94329-e8c1-470b-b550-a4b008815cab","resolution":{"observed_at":"2026-08-06T16:44:50.738027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:50.830477Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.830477Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:3ee5f9b8a32f6c35885fe24d7af717d516c17a186c6643d21463193f53f58506","observation_id":"f70e476b-efaf-42b7-a1db-205748ae26fa","resolution":{"observed_at":"2026-08-06T16:44:50.830477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:44:50.909102Z","title":"SGDR : Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:50.909102Z"},"links":{"citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:30553b16bf718f60d4fdd41dd7118b2bdb4f84b82cb2281d09faa855cf12e625","observation_id":"c5d0cf3f-3ad7-4711-a8e4-f2ea0bb0b5a9","resolution":{"observed_at":"2026-08-06T16:44:50.909102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T16:44:51.047658Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:51.047658Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:0885bfdfceb84e1314e1d8b9abaad76e8d9e0a42c2e8313eb953afcb0e5d62ef","observation_id":"c37973e0-39b8-43df-a3d4-68712b60c06e","resolution":{"observed_at":"2026-08-06T16:44:51.047658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 12 inbound Pith citation observations for arXiv:2507.12856."}