{"as_of":"2026-08-07T15:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3df30425c09b016253a84147032906f60bf043bb0b736d5df5637b2a745f0f0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:48.101782Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:1bf6b29e1f3e7fd5671072f61086983e5fa01e51dd04198604a21697886213d6","observation_id":"9ce80c5e-b8d2-4b1e-8cb6-e72c91dd252f","resolution":{"observed_at":"2026-05-12T08:41:23.526899Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2508.07809","last_updated":"2026-04-20T09:03:51Z","snapshot_observed_at":"2026-08-02T08:22:04.058996Z","submitted_at":"2025-08-11T09:49:01Z","title":"EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T23:56:47.274169Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2508.07809"},"observation_digest":"sha256:44de5f1872c0ab78960c0eadb41fb233f05d05f778ed7fb2c58f85c2629dd053","observation_id":"3f2dbca8-2b50-4732-998c-73f84649e9bb","resolution":{"observed_at":"2026-05-18T23:56:55.045505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T20:49:33.169961Z","title":"https://huggingface.co/blog/open-r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09883","last_updated":"2026-06-29T07:30:26Z","snapshot_observed_at":"2026-08-05T20:49:31.838349Z","submitted_at":"2025-08-13T15:32:25Z","title":"Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:33.169961Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2508.09883"},"observation_digest":"sha256:cd019cc6ee0914a17dd308bda660a72e367998c13143513800bb5ca009937eeb","observation_id":"f9961d65-2c5c-4622-923a-f528de674486","resolution":{"observed_at":"2026-08-05T20:49:33.169961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2508.13755","last_updated":"2026-04-12T13:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-19T11:51:40Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","version":8},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T22:33:01.074518Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2508.13755"},"observation_digest":"sha256:74657bf52f77e257278861dfde72efaf9f39c0092874837ff491d9fe5b6b0f67","observation_id":"e36dad10-0739-4a45-b78b-9b7028f14b24","resolution":{"observed_at":"2026-05-18T22:36:53.701052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":148,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:de53ee9d2f493b57f40ed7d0f6422b172c15374dec066e3cd4288e05913ca0ea","observation_id":"2d21066e-700b-4b6d-a68f-377c3c099a3a","resolution":{"observed_at":"2026-05-18T00:02:25.405749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T14:42:33.241269Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24088","last_updated":"2026-06-08T21:46:49Z","snapshot_observed_at":"2026-08-07T00:06:07.043188Z","submitted_at":"2025-09-28T21:47:20Z","title":"CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:42:33.241269Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2509.24088"},"observation_digest":"sha256:78a00b03ffbb8055804c49e6a66709329d8215c9d6c25d2213f453aad21db523","observation_id":"975e4c8d-006c-480c-b21b-c252f9e63794","resolution":{"observed_at":"2026-08-04T14:42:33.241269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T10:39:26.597119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-04T10:39:20.309514Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:26.597119Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:e36296ea7288532c25b04956be23a938c50e9ab54d2e63ad983b4d4e55b89aae","observation_id":"a44f1f16-1fbc-4dc5-bee6-5a444af496a9","resolution":{"observed_at":"2026-08-04T10:39:26.597119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T09:33:38.707015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-05T04:35:32.361585Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.707015Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:ee2c1e1c5e7693487e90be4427aaa25054cf9ced798337c829438e5abaa05cb7","observation_id":"95a5c8a6-8a44-46ff-b8ce-25da8195f68b","resolution":{"observed_at":"2026-08-04T09:33:38.707015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T08:15:50.322424Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-04T08:15:30.884838Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:50.322424Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:54fcbf088479bff82b6b2cff213d8dcb06d8cf930378331b6f37775d7559c03b","observation_id":"336fcfdd-e5d7-437a-87d2-d788895f128a","resolution":{"observed_at":"2026-08-04T08:15:50.322424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:16fc0aa8a6d1020fc080ab1309a023f818083722f2a551fa0841c86e28558a2d","observation_id":"50b95321-bffc-40e8-867f-d8c974c23178","resolution":{"observed_at":"2026-05-16T22:43:37.638943Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-03T05:28:11.662347Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02244","last_updated":"2026-07-14T10:18:39Z","snapshot_observed_at":"2026-08-07T11:20:54.293788Z","submitted_at":"2026-02-02T15:53:55Z","title":"Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T05:28:11.662347Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2602.02244"},"observation_digest":"sha256:69c51fbfb2ff4bca4061a9d7e85afdf593363839cde51c03362810175faf8c93","observation_id":"5853afe1-a468-491f-b111-8e395ab4a9a5","resolution":{"observed_at":"2026-08-03T05:28:11.662347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2603.11321","last_updated":"2026-04-04T03:49:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T21:33:41Z","title":"Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T12:44:50.752937Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2603.11321"},"observation_digest":"sha256:b529fa5699e915dbdbfb82acf3849a26a086ba6dac055f8036d6a9750bf6e8ca","observation_id":"b00e54c2-0f98-4160-835d-a032820f5cf6","resolution":{"observed_at":"2026-05-15T12:45:37.356079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2604.14054","last_updated":"2026-05-25T13:50:41Z","snapshot_observed_at":"2026-08-02T01:13:47.904200Z","submitted_at":"2026-04-15T16:34:39Z","title":"$\\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:43:09.581054Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2604.14054"},"observation_digest":"sha256:e88251be2a92da3677a487384dc0efa330e61a6a4c71ccb65808dc3f5af0dfd2","observation_id":"587b056d-a5f2-41cc-93fa-1a211b8b1ed3","resolution":{"observed_at":"2026-05-10T13:45:27.829704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2604.20733","last_updated":"2026-04-22T16:20:41Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:20:41Z","title":"Near-Future Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:36.580600Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2604.20733"},"observation_digest":"sha256:e96de8e23cf75ed55a6bfef1eb65029910b34f12ebab8b067e8fdec77cf6a8f6","observation_id":"3b331609-45b2-472c-b100-ac69b4472109","resolution":{"observed_at":"2026-05-10T00:54:48.662477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.00610","last_updated":"2026-05-01T12:20:44Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T12:20:44Z","title":"Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T19:05:51.423427Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.00610"},"observation_digest":"sha256:334f082fcafcb6f698f1af330cb046365ee0da658e2a44aea1a726db6a8d8cfa","observation_id":"7c4bd75f-8c56-4966-a086-5eedfcbb4d73","resolution":{"observed_at":"2026-05-11T15:51:44.011351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:448504668ab61a6d5eb6e9ada377198da44fec6a039c2912d6dcb7842f6cd8f1","observation_id":"285b16b3-efde-4ca8-89b8-1e5350cd1871","resolution":{"observed_at":"2026-05-12T08:06:31.724069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:9e5a45562bbe9311aa88711522c6759b8fe4fe842a387e5755a3544f3d3d4a57","observation_id":"83613a1d-44e0-467f-8c7c-ef40c35fc3ac","resolution":{"observed_at":"2026-05-19T18:07:42.235985Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-07T08:55:02.984200Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:4c03e5e862aedaa44695e1b9a74d881a33c115bd64db2871f0a6b6aeca804d9a","observation_id":"859ffaa4-7137-4c9d-bc2d-2b543d12052e","resolution":{"observed_at":"2026-05-13T05:07:17.645623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.22567","last_updated":"2026-05-21T14:47:52Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:47:52Z","title":"LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-22T06:19:44.377733Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.22567"},"observation_digest":"sha256:b9f5df8384c22970402a455fa1fffc316c010d57e6faa25345fd982487b72b1e","observation_id":"96a80a11-f43d-46f4-a21d-eb95fc43ec92","resolution":{"observed_at":"2026-05-22T06:21:10.377765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.26184","last_updated":"2026-05-25T07:52:29Z","snapshot_observed_at":"2026-08-07T11:30:00.607943Z","submitted_at":"2026-05-25T07:52:29Z","title":"GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T22:29:05.467252Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.26184"},"observation_digest":"sha256:6c3650facb07ac77fb429725c4295cfd36ad6024dff7a0049cf0f74808797077","observation_id":"c60b7a7d-435d-4f00-bc9e-a0ce27f0fe67","resolution":{"observed_at":"2026-06-29T22:34:01.719169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:fa09b81a2281b497f286692e509898c7d7c58fef9f59760141bfd64825e61df1","observation_id":"21f8c1db-3f48-42ea-9da4-fb704c60b231","resolution":{"observed_at":"2026-06-29T08:03:13.496547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:4a49592fbfce21761ff64634e3c95962e3c144529f2b11a4552edfd9b932bb40","observation_id":"967da951-9120-4295-8a7c-68731a45b4d7","resolution":{"observed_at":"2026-07-04T09:09:43.590285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2606.24064","last_updated":"2026-06-23T02:14:12Z","snapshot_observed_at":"2026-08-01T19:53:34.208327Z","submitted_at":"2026-06-23T02:14:12Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T00:39:29.703711Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2606.24064"},"observation_digest":"sha256:0bc699bbaee80448b96c3f2334a1edf6e1dc1b5de938d92f0d02673b6e6ec495","observation_id":"ee13d56a-e9c9-4aa0-9614-253e730673ff","resolution":{"observed_at":"2026-07-04T16:29:56.991869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2607.01191","last_updated":"2026-07-01T17:24:26Z","snapshot_observed_at":"2026-08-02T15:51:49.700376Z","submitted_at":"2026-07-01T17:24:26Z","title":"Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-02T13:24:17.538850Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.01191"},"observation_digest":"sha256:02607b8df3f18fa3c94908490eca25063539bb9fd99acc783b8a03f702c33ca6","observation_id":"94116e2e-ed12-4903-acf6-fe4865d5320d","resolution":{"observed_at":"2026-07-02T13:26:58.442808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-07-14T11:23:30.063231Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-14T11:23:30.063231Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:82dae9eb61c8730b600ea2acdc88797ef0830dfbe65d3c97c847600beaca27f9","observation_id":"151eb895-fbf2-4d7d-ba72-a03c726fcb31","resolution":{"observed_at":"2026-07-14T11:23:30.063231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-02T07:23:28.545828Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.545828Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:93174a58fb529959ea00d55185efe153faa0ac7ded49f035269cc192fad76662","observation_id":"e7b7907b-ccc5-4b9b-be3f-b7943ba9f25f","resolution":{"observed_at":"2026-08-02T07:23:28.545828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-07T00:13:48.101782Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning.arXiv preprint arXiv:2506.19767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01755","last_updated":"2026-08-04T02:59:32Z","snapshot_observed_at":"2026-08-07T15:15:14.350565Z","submitted_at":"2026-08-03T06:24:36Z","title":"Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.101782Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2608.01755"},"observation_digest":"sha256:e7e63174791796f53d534184c1e67ec57693609ea73bc8f796024c14469a0862","observation_id":"b13a36df-6e61-4002-bd65-f7408ccdc670","resolution":{"observed_at":"2026-08-07T00:13:48.101782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19767/citation-record","integrity":"/paper/2506.19767/integrity","json":"/paper/2506.19767/citation-record.json","paper":"/paper/2506.19767"},"outbound":[],"paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2506.19767."}