{"as_of":"2026-08-01T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be9521ec362737d540f65467866a360ce145691d46987ca586ecef4f626ac9d9","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:25:59.056181Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:36:19.656189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T00:35:48.710213Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"cited_work":{"arxiv_id":"2605.07725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-07-09T00:35:48.710213Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","venue":"cs.CL","work_id":"5919760d-bb63-46e0-9cbd-799eb53f2f45","year":2026},"citing_paper":{"arxiv_id":"2605.07711","last_updated":"2026-05-21T08:28:27Z","snapshot_observed_at":"2026-07-30T13:45:02.553757Z","submitted_at":"2026-05-08T13:16:17Z","title":"SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:11.309910Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2605.07711"},"observation_digest":"sha256:54b0b631bbfc301a27e241e9074d06d0dec969111df038ca2eb81983962193e4","observation_id":"2d033aab-3719-44d3-b4af-1b427e359efe","resolution":{"observed_at":"2026-05-22T10:31:25.020076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"cited_work":{"arxiv_id":"2605.07725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-07-09T00:35:48.710213Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","venue":"cs.CL","work_id":"5919760d-bb63-46e0-9cbd-799eb53f2f45","year":2026},"citing_paper":{"arxiv_id":"2606.27814","last_updated":"2026-07-30T04:08:29Z","snapshot_observed_at":"2026-08-01T14:59:46.491603Z","submitted_at":"2026-06-26T07:56:32Z","title":"ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T04:30:43.424100Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2606.27814"},"observation_digest":"sha256:7daf731fbd16c5348d2932ebbb5a06d2f674befc0c154a558280fc0b6611765b","observation_id":"6af974ae-4e7a-4354-926b-45edfd26ca2b","resolution":{"observed_at":"2026-06-29T20:03:57.356711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"cited_work":{"arxiv_id":"2605.07725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-07-09T00:35:48.710213Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","venue":"cs.CL","work_id":"5919760d-bb63-46e0-9cbd-799eb53f2f45","year":2026},"citing_paper":{"arxiv_id":"2607.05804","last_updated":"2026-07-07T03:56:35Z","snapshot_observed_at":"2026-07-10T23:17:29.125941Z","submitted_at":"2026-07-07T03:56:35Z","title":"TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T00:29:35.583300Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2607.05804"},"observation_digest":"sha256:c296544cfc946b9a535130b12607b16f56f25bf3a3bf9b40c92958376de4357c","observation_id":"1a3bf83e-6221-4a24-9c75-3282cdfdba3c","resolution":{"observed_at":"2026-07-09T00:35:48.712044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-07-31T06:35:52.597753Z","title":"Sod: Step-wise on-policy distillation for small language model agents.arXiv preprint arXiv:2605.07725,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24731","last_updated":"2026-07-30T05:33:15Z","snapshot_observed_at":"2026-08-01T15:00:09.563699Z","submitted_at":"2026-07-27T17:57:02Z","title":"Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T06:35:52.597753Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2607.24731"},"observation_digest":"sha256:eee46a1acdb52adaad2ebce1f250b84a43e97a24dd87e1e75da703449e7b7452","observation_id":"1c9dc3f0-37b5-4dc9-9a73-420cf8b81308","resolution":{"observed_at":"2026-07-31T06:35:52.597753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-07-31T18:36:19.656189Z","title":"arXiv preprint arXiv:2605.07725 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28076","last_updated":"2026-07-30T11:49:46Z","snapshot_observed_at":"2026-08-01T15:04:09.730007Z","submitted_at":"2026-07-30T11:49:46Z","title":"Group-Reflective Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T18:36:19.656189Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2607.28076"},"observation_digest":"sha256:792259271fab44f940046e35f4aff58b78824e242a6cd3de46d1fe01943c5ec1","observation_id":"a825be51-2b0e-434c-abc2-4677470ea796","resolution":{"observed_at":"2026-07-31T18:36:19.656189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.07725/citation-record","integrity":"/paper/2605.07725/integrity","json":"/paper/2605.07725/citation-record.json","paper":"/paper/2605.07725"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":"2309.07864","doi":"10.1186/s12912-025-04245-9","metadata_source":"pith","pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","venue":"cs.AI","work_id":"985ca219-7e34-4c4f-bdc5-ccd39763ad61","year":2023},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:71f6035fe62233c5b4c488ddd04434130106fa7fe08144f8f4c156762f37dbdf","observation_id":"387058b7-0712-420c-b4f0-57f4cc8c728a","resolution":{"observed_at":"2026-05-11T10:48:03.736032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17612","doi":"10.48550/arxiv.2505.17612","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Distilling llm agent into small models with retrieval and code tools","venue":null,"work_id":"eb4c1cfe-9cdc-4f5b-8acb-9cc5051652fe","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:93b9b2d43a2e0a48bff88cf142b723cd9f30cf76d1f4daec52b5ed64665a8e5c","observation_id":"beb73551-eb2d-4192-8626-c56a05dfec20","resolution":{"observed_at":"2026-05-11T03:40:54.392401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Narasimhan, and Yuan Cao","venue":null,"work_id":"88bae163-dc75-474e-bf1d-8e2aefc8e163","year":2023},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:e2d90c82eb04ad9f6d0f94c6b132e7de2ea038edac35cce97b184039535888a6","observation_id":"df63bdf5-522a-4aa1-810b-3571257e9a95","resolution":{"observed_at":"2026-05-14T12:40:17.356444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"e9c2ed44-e51f-42d0-bc79-afa77f8ca58e","year":2023},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:65bf6b659857aa5859f1667a1be84ada496674ac91ad936151d234e65add5f40","observation_id":"23c89fc3-b040-45c0-b960-65ee38d9a09a","resolution":{"observed_at":"2026-05-14T12:40:17.361447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-07-06T21:18:11.756526Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.01441","doi":"10.48550/arxiv.2505.01441","metadata_source":"pith","pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"6d9faf3b-cd39-48ff-8918-a9379716abd2","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:52d7348a19420fb68d9d2eb420be573ccc144f06e0ba22383ecb3557639ea62d","observation_id":"4c94ae1f-2a38-492b-9b90-cf5594b2b0f7","resolution":{"observed_at":"2026-05-18T02:58:56.460093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixed distillation helps smaller language models reason better","venue":null,"work_id":"28acb38e-4fbf-4bc2-85fb-2aab9fdd6ffb","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d70e0c82b6b194326dd92786b9d9ea894cfa8cffd541d2b03db0f1ea080bd0b9","observation_id":"855ef61a-7595-49f8-b181-799fd44a9543","resolution":{"observed_at":"2026-05-14T12:40:17.284002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14465","last_updated":"2026-06-01T10:03:07Z","snapshot_observed_at":"2026-07-14T21:12:47.241355Z","submitted_at":"2026-03-15T16:13:58Z","title":"AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents","version":2},"cited_work":{"arxiv_id":"2603.14465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.14465","snapshot_observed_at":"2026-07-03T14:18:22.398669Z","title":"Agentprocessbench: Diagnosing step-level process quality in tool-using agents","venue":"cs.AI","work_id":"0d51a672-e0fa-47b5-9ad6-38ba08a5ea10","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2603.14465","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:9ec1a82cd205dc099677fd1e31448da1f27d9de15bcda9a57ed3409b360b51e3","observation_id":"29e19b0a-d9ad-4791-bc49-3f8139fcb030","resolution":{"observed_at":"2026-06-02T03:04:40.253850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00088","last_updated":"2024-09-14T04:01:09Z","snapshot_observed_at":"2026-07-06T19:08:26.637143Z","submitted_at":"2024-08-26T03:33:36Z","title":"On-Device Language Models: A Comprehensive Review","version":2},"cited_work":{"arxiv_id":"2409.00088","doi":"10.48550/arxiv.2409.00088","metadata_source":"pith","pith_arxiv_id":"2409.00088","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"On-device language models: A comprehensive review.arXiv preprint arXiv:2409.00088","venue":"cs.CL","work_id":"6cd5ccef-aadd-459f-a58f-453ae35f4520","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2409.00088","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:fceaeca485cc850723c01ebc21f35b83050df7842d1e303978f43d601baf70f9","observation_id":"11cae7de-8f7d-42f5-9db1-2518e889257a","resolution":{"observed_at":"2026-05-11T03:40:54.363916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":"2402.13116","doi":"10.48550/arxiv.2402.13116","metadata_source":"pith","pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-07-11T12:15:01.025339Z","title":"A Survey on Knowledge Distillation of Large Language Models","venue":"cs.CL","work_id":"b1dcdadf-875e-4695-8fcf-0907c69302f3","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:36a870084d6d91e8efc49062e0b5869dd3eec2e001cf722dd068ab5056205568","observation_id":"5874f411-31f7-41df-9fe7-93bde841b2df","resolution":{"observed_at":"2026-05-17T23:31:12.027711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:49:12.049248+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:49:12.049248+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14728","last_updated":"2025-06-17T17:08:32Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:08:32Z","title":"AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes","version":1},"cited_work":{"arxiv_id":"2506.14728","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14728","snapshot_observed_at":"2026-07-04T13:39:50.583619Z","title":"Agentdistill: Training-free agent distillation with gener- alizable mcp boxes","venue":null,"work_id":"cdbcddc9-75ef-44de-8735-629463effa85","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2506.14728","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d4980d32adf22ff61af3a5200405990852e37682f8a73b0f65d9ffe094d6dc4a","observation_id":"78e615e7-2449-4ac4-aa66-e2da5269144a","resolution":{"observed_at":"2026-05-11T03:40:54.398511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"O-researcher: An open ended deep research model via multi-agent distillation and agentic rl","venue":null,"work_id":"65a56136-9ee9-4692-a95f-519d7915380c","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:059c0231213c51c6772ee507dd696cbc7d43605f62d5b92c3483d76d20e5a74e","observation_id":"926ac0a8-bc32-4a68-91f0-e76bcab2e798","resolution":{"observed_at":"2026-05-11T03:40:54.409941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-07-06T22:14:35.142771Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"cited_work":{"arxiv_id":"2508.13167","doi":"10.48550/arxiv.2508.13167","metadata_source":"pith","pith_arxiv_id":"2508.13167","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Chain-of-agents: End-to-endagentfoundationmodelsviamulti-agentdistillation andagenticRL.arXivpreprint","venue":"cs.AI","work_id":"141bc3ea-6f2e-439d-ada6-ffa0902bf68f","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2508.13167","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:9e5733c6b92bc3d30317a298e6c55b623ad2fc2b21565389a172d281d5ae728d","observation_id":"1e23cc51-8da2-4836-a10b-219e68569a74","resolution":{"observed_at":"2026-05-11T03:40:54.388059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:e4a2689b0ff106027ffd4ccef96627de67d696d5cf3358e8b28139b2025574bc","observation_id":"d5a8dc9d-55e9-4b10-9237-374ab7b93e3c","resolution":{"observed_at":"2026-05-14T00:26:48.594660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05065","last_updated":"2025-07-07T14:49:18Z","snapshot_observed_at":"2026-07-06T21:53:18.377520Z","submitted_at":"2025-07-07T14:49:18Z","title":"Replacing thinking with tool usage enables reasoning in small language models","version":1},"cited_work":{"arxiv_id":"2507.05065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05065","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Replacing thinking with tool usage enables reasoning in small language models","venue":null,"work_id":"387b0805-b951-4087-b7d4-663b96267f47","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2507.05065","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:c86154b8d5c4cc57171ddf8fbc28b0767b512fe3ade2bb3550805da4c3816e97","observation_id":"2eb7cbae-7bad-446d-a269-775a3c3e9e82","resolution":{"observed_at":"2026-05-11T03:40:54.443222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-07-06T22:22:21.808673Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:783bc56ef563c92924c0cf7e177977807347751ae6b0bd7f893d0613c2b0229d","observation_id":"31f4b51b-df37-4077-ba13-c1f579eaefd2","resolution":{"observed_at":"2026-05-11T03:30:58.767379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13820","last_updated":"2026-05-27T17:51:12Z","snapshot_observed_at":"2026-07-06T21:26:44.745710Z","submitted_at":"2025-05-20T02:01:55Z","title":"Structured Agent Distillation for Large Language Model","version":5},"cited_work":{"arxiv_id":"2505.13820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13820","snapshot_observed_at":"2026-07-03T08:17:45.036042Z","title":"Structured agent distillation for large language model","venue":"cs.LG","work_id":"53e04311-62d8-4495-8f48-29d058351918","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2505.13820","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:9b5e216567d85757812ddc97c1bfec09653301784c46d0529076914a4b648d4d","observation_id":"f89fdfb4-7e0c-438f-bbc0-a5aedf41b9c1","resolution":{"observed_at":"2026-05-28T03:04:41.842017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-07-06T21:01:00.397040Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":null,"work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:9bd8389c2d257ad9bf843758aa50bdc9dc2e8db5956bbfe3fb167883a66f4cc2","observation_id":"2001a2f7-cab5-4e06-993e-153caaf1c8bb","resolution":{"observed_at":"2026-05-11T03:30:58.761107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:4283054df7842ae2c856322dfeed17401d7f9dda4647967d5eab54763fa831b4","observation_id":"beef77d6-6fe2-43eb-b68a-87c2f95821bd","resolution":{"observed_at":"2026-05-11T03:40:54.416063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05592","doi":"10.48550/arxiv.2503.05592","metadata_source":"pith","pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"f5ed73d2-f2ff-4cf6-853d-3586333e44ef","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:00626ff511cb29098678ea9e2cd3f0cb60ea695cb3825b23e543d57de84b361a","observation_id":"7686b27a-49c1-479a-a0b6-312c162e2e0e","resolution":{"observed_at":"2026-05-13T18:37:17.866238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:868be694d44596878e074cfb84cf5a126265014391a54282a909b6d7cc2248db","observation_id":"23f75ed2-d476-4844-9b51-79f526810541","resolution":{"observed_at":"2026-05-11T03:40:54.422229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:caa516b33bf315174ede542211c060620b6c26a79aed0f977e41538cdf1130d9","observation_id":"3eecbc68-9747-4ded-a5fd-07abd909f807","resolution":{"observed_at":"2026-05-11T03:30:58.717508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00400","last_updated":"2026-05-11T21:10:07Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T23:28:37Z","title":"KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA","version":2},"cited_work":{"arxiv_id":"2602.00400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.00400","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kepo: Knowledge-enhanced pref- erence optimization for reinforcement learning with reasoning","venue":null,"work_id":"ca04f998-9756-4392-bc37-79324af807d4","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2602.00400","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d75e8ccc2c27ec30852192589e7a81db08ab9c1dfb10520323c2242322d30b56","observation_id":"47e026fd-5b20-462c-8edd-9895967bc0b6","resolution":{"observed_at":"2026-05-13T01:45:20.706329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.522565Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"3733ff2d-cd95-4776-9fa9-1b2328326749","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:b8ca43101487cc92b9d9a8c55006419437398ee58936c4a57f87dd35cf8e1cb0","observation_id":"7b6694bd-55df-4c1c-bba9-4116d3cfb541","resolution":{"observed_at":"2026-05-14T12:40:17.331988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.575750Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"b1e6b0f6-8514-45e3-8ada-200c47bc849c","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:ae54a0017fb080bba999e07dda211bd030859f13afb2480e4be200f1578cc2fe","observation_id":"9a63733c-d9bd-4e83-88dc-acf17807d0ee","resolution":{"observed_at":"2026-05-14T12:40:17.287809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:7a4ddf4f870bcb11e7a96f39f5f41bbf62e3a98ca36ed22e106ab996557356d8","observation_id":"d5d8abe9-5ccc-44ed-b3de-de977da1bad6","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:35:48.689101Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":"5e961f0b-b20e-4580-965d-15fb63ec8965","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:f01355af48e09920272da072e0118c5722b24527d7596efae5c193d74c034dfa","observation_id":"f5126f51-8d44-4e58-a339-d567eb72a11c","resolution":{"observed_at":"2026-05-11T03:30:58.700899Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":"2604.13010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-07-04T10:19:47.155186Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","venue":"cs.LG","work_id":"7dae1a56-9dfd-4f59-a836-8c62d7da923d","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:30abeba6f19e85297fe3c7007a04d26bc5aca22c15e32d5ed862fb07660fed3c","observation_id":"cb307289-c7a3-4025-b26e-a7473d5e8e3e","resolution":{"observed_at":"2026-05-11T03:30:58.645663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:f0f37f0aae88be21d1d9ce71dee532993a334093f0bfd991033e0db3db28915e","observation_id":"edc8b8d2-f5fe-4ff9-8217-b0442b85d68f","resolution":{"observed_at":"2026-05-11T03:30:58.637592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":"2604.13016","doi":"10.48550/arxiv.2604.13016","metadata_source":"pith","pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","venue":"cs.LG","work_id":"42b43df0-4c82-493f-9d9b-1be8c116d9af","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:4d737c0d900fd0d13d3ff0dee9b57fb6afae3fe4a50b7a053689233015d22f78","observation_id":"23a42cb7-8442-4368-b85d-fee896d4f1d3","resolution":{"observed_at":"2026-05-11T03:30:58.651270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlkd: Distilling llms’ reasoning via reinforcement learning","venue":null,"work_id":"8e72a060-3d5b-4a98-8ac2-8727590ce508","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:1b89f8d6ab7140d548d6a3f1dc12c28134205c4e256d71108d59bf278759a149","observation_id":"72d33e95-19a6-408b-877d-0fd22a7d21d2","resolution":{"observed_at":"2026-05-14T12:45:15.823707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.02288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.050266Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing","venue":null,"work_id":"6dea6cb7-a4e5-478a-ab3c-eeeb335abd51","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:5574092b9b29e48e7cfb461a76b328f1d255ca2a399141302461f9e74e8002a6","observation_id":"9da3d397-d60f-4dad-b43a-2b0d990d1715","resolution":{"observed_at":"2026-05-11T03:30:58.659483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":"2604.03128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-07T12:33:45.187943Z","title":"Self-Distilled RLVR","venue":"cs.LG","work_id":"935a34f3-b83d-4214-b6a0-ae2395b3d107","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:316e8cc8aa68d135f44764e772f35ff381080dfe499812cbe7ca7c1c6523c989","observation_id":"9fd0ddf1-23d1-4275-a3a9-da68959a41de","resolution":{"observed_at":"2026-05-11T03:30:58.671489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.23497","last_updated":"2026-06-03T18:11:47Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-27T16:32:12Z","title":"VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation","version":3},"cited_work":{"arxiv_id":"2510.23497","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.23497","snapshot_observed_at":"2026-07-03T20:48:55.919394Z","title":"V old: Reasoning transfer from llms to vision-language models via on-policy distillation","venue":"cs.CV","work_id":"56ea2486-5f72-48b2-a7ed-54115936d552","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2510.23497","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d7d80d2a2027388f84ab983c4dd9bd54ccaa340ecfd29b02d7d67a20de3e1ff5","observation_id":"cd7b84f1-02bd-47d0-bc5d-1a4ac02fd924","resolution":{"observed_at":"2026-06-05T01:14:30.340920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10165","last_updated":"2026-05-11T10:03:41Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:59:01Z","title":"OpenClaw-RL: Train Any Agent Simply by Talking","version":2},"cited_work":{"arxiv_id":"2603.10165","doi":"10.48550/arxiv.2603.10165","metadata_source":"pith","pith_arxiv_id":"2603.10165","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OpenClaw-RL: Train Any Agent Simply by Talking","venue":"cs.CL","work_id":"78607317-8305-4515-8dc3-20b4ff5b8f3a","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2603.10165","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:bce98fb418631e11c3db0d8b1df49d477fe4ccbb710251ad7f37f161b01893c1","observation_id":"aa642c6a-7684-46d0-9e09-54e20b7bdac5","resolution":{"observed_at":"2026-05-11T03:30:58.731803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":"2603.25562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-07T12:33:45.227324Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","venue":"cs.LG","work_id":"8e059321-d6e4-4359-89eb-83ecbb93b657","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:a93f36821294fb26a5acae293b29ba387ab818ba6c41ac068122a169181a9ad4","observation_id":"8c64a382-1919-40d1-9c8d-c6d215e01efd","resolution":{"observed_at":"2026-05-11T03:30:58.665532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:b742c59badf11ddf2772f569dbb3ec2132c8083f584ce160eb666b7580079285","observation_id":"4e0097b7-59c4-4418-ba8d-b16f8aec5f5e","resolution":{"observed_at":"2026-05-13T02:47:19.238105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gordon, and Drew Bagnell","venue":null,"work_id":"0cd24557-fbc4-4ad3-8c5a-187190614c5b","year":2011},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:fa490d871b2f87a06ddd04d2e581049712b12c5163e9d04d3d0e44c2193674dd","observation_id":"64e62c2a-e126-4abb-9d5e-164b900f48f8","resolution":{"observed_at":"2026-05-14T12:45:15.818675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":"2305.15717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-07-04T05:09:36.906364Z","title":"The False Promise of Imitating Proprietary LLMs","venue":"cs.CL","work_id":"f843d86a-7fd6-4b0d-bf8b-f1ad3fbc3f04","year":2023},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:4f60e8e0c8b2719733344bcbfac0e9ebc214252d718c402e1714d8a3e921313a","observation_id":"0f6b9d9e-c074-43df-a60f-7103d8d1622b","resolution":{"observed_at":"2026-05-18T06:54:31.902059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":"2604.24005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-07-09T00:35:48.719604Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","venue":"cs.LG","work_id":"7791193f-5a6e-4212-b020-07c79fe6e58b","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d503737eb44c548f9eb5db7ee2a7250e0f1db19b215134d48f29f2c56f94f54f","observation_id":"e21d29eb-c765-4c6b-87e3-d433cc682f34","resolution":{"observed_at":"2026-05-11T03:30:58.690400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07155","last_updated":"2026-07-11T08:43:13Z","snapshot_observed_at":"2026-07-16T23:17:45.652859Z","submitted_at":"2026-01-12T02:57:39Z","title":"Stable On-Policy Distillation through Adaptive Target Reformulation","version":3},"cited_work":{"arxiv_id":"2601.07155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.07155","snapshot_observed_at":"2026-07-09T00:35:48.734855Z","title":"Stable On-Policy Distillation through Adaptive Target Reformulation","venue":"cs.LG","work_id":"d26b1f29-c96d-46cf-bf68-688d16583c89","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2601.07155","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:bce81ac33127c7f6017074895983794b2899f3cb0c971e13cfecf52b0710c02b","observation_id":"399b77e4-ff4b-421f-88c7-caa536af039e","resolution":{"observed_at":"2026-05-11T03:40:54.452232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":"2604.14084","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-07-09T21:06:34.840057Z","title":"TIP: Token Importance in On-Policy Distillation","venue":"cs.LG","work_id":"6509a633-b810-4a8d-9de9-8a9b59a768d0","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:4a88bbcbeb8b6a34a41906333ce2944904c52feaae0a889eb65f54922299ff86","observation_id":"cfbe5751-f9fc-473e-91ad-8609a9615974","resolution":{"observed_at":"2026-05-11T03:40:54.419097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.040609Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30","venue":null,"work_id":"a63ca98b-8916-47bd-bd9b-d0c693024f4c","year":2017},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:416c09715ee82dffb6a94eb0881961f5a6a3aa591f68c5a8436325da8ef15a6e","observation_id":"e32f4091-39c5-48bb-9eeb-20851908a470","resolution":{"observed_at":"2026-05-14T12:45:15.814230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-07-10T19:37:34.037876Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:f40b9c6c6f993b38ddb58d28d9ff39a195b44d8f0a4d8885446d4c7cb04651c7","observation_id":"de8e4467-84a9-432f-ade2-78b797f71d54","resolution":{"observed_at":"2026-05-11T03:40:54.456154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:74733af3b9cda989c3b99dca5b53f04bf13013e1d7455536dd7c5bff98974a41","observation_id":"5d9a04a2-6c28-439c-bd9b-52794975e857","resolution":{"observed_at":"2026-05-11T03:40:54.481179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-01T07:39:12.092512Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":"2310.05915","doi":"10.48550/arxiv.2310.05915","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Fireact: Toward language agent fine-tuning","venue":null,"work_id":"382904a8-a33f-42d0-ae77-b61c9f0cb7cb","year":2023},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:f0e4e76917bb1e5ca0fa9f276228305cc51d939858ba0f043df3e9e3a7da0d74","observation_id":"414876f4-f394-4d5f-ae80-fb49c6d560d0","resolution":{"observed_at":"2026-05-11T03:40:54.506607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.955583Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652","venue":null,"work_id":"0621aa9d-3c5d-4171-ba59-3d6fb78d570d","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:6764963b34efaa00c2b39a86898f569ca3698d193a12da2cddcd21bb9b73f993","observation_id":"9c81871f-9215-4d1e-8c71-5d595e9883ca","resolution":{"observed_at":"2026-05-14T12:45:15.809847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":"2504.11536","doi":"10.48550/arxiv.2504.11536","metadata_source":"pith","pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","venue":"cs.CL","work_id":"6da510e4-e55c-4412-b7c8-839984508e99","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:73c29192f9ebbfe0a9296ba06f33eef0fe8c9aa5e53c65d7730146b999cd64b7","observation_id":"a77abe9c-843d-4664-a59f-8614182031ed","resolution":{"observed_at":"2026-05-13T18:42:39.160125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":"335fdb09-5367-4de3-921c-613d567a0c53","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:799631f9fd629fadc2918d1df0117ff31d59a514b4bbb97790a8482ca6618c18","observation_id":"4efebc59-7037-405d-8524-6744e16f0995","resolution":{"observed_at":"2026-05-14T12:40:17.366234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:a2955ae71a91dbd7ec77385fe141ba4acc96fd20e4a5b7e2ec5d8a9a973c7be0","observation_id":"11ce60e9-4099-45ee-8ddb-43cd23bb6da5","resolution":{"observed_at":"2026-05-11T03:40:54.542352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:1c53571bc381ee1164bb3e20507b50d0f419c500efbcb1d118fb1e9c8c25fb94","observation_id":"830e555e-e74d-40ef-84fb-4290fa4652ad","resolution":{"observed_at":"2026-05-11T03:40:54.475555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-07-06T20:30:26.881629Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":"2502.01600","doi":"10.48550/arxiv.2502.01600","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reinforcement learning for long-horizon interactive llm agents","venue":null,"work_id":"7e929792-6a2a-42ff-a1db-763f890d8b4e","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:bf15954fdb554c1c2d4798aac5afd2441c9ba24b374b12534bd82fc6800d09f2","observation_id":"f4304d3e-0096-4a0d-9b56-6c8036d8642a","resolution":{"observed_at":"2026-05-11T03:40:54.478495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:37.001617Z","title":"Demystifying reinforcement learning in agentic reasoning","venue":null,"work_id":"d53b8c16-48ac-427a-83a6-31ca0addca9b","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:c96cb7573ca6651a5a2b8a78c9b5ade326be655cda542cc1143753a5b826398f","observation_id":"73c0740e-bc66-468b-a498-943e5494ab26","resolution":{"observed_at":"2026-05-11T03:40:54.496029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02488","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T18:48:49.510756Z","title":"Rlanything: Forge environment, policy, and reward model in completely dynamic rl system","venue":null,"work_id":"6d0116cf-2531-41e0-a250-af72f29c9448","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d223dbad58addf617225c01306011f0a5daf3175513b34394acbf394707f6377","observation_id":"2cc8d805-46bc-4f27-8e89-1c239d8a5be1","resolution":{"observed_at":"2026-05-11T03:40:54.488729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03136","doi":"10.48550/arxiv.2506.03136","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Co-evolving llm coder and unit tester via reinforcement learning.arXiv preprint arXiv:2506.03136","venue":null,"work_id":"62814e75-f541-485a-9707-8e48d14708f7","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:5586a22a79cba59c542aa21d157ffcf3d9aeeb1fc7bd2f179b551abccccecc60","observation_id":"8335d5dd-2469-4c5f-a4ea-591b10668fca","resolution":{"observed_at":"2026-05-11T03:40:54.514453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":"2602.12275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-10T00:26:39.252472Z","title":"On-Policy Context Distillation for Language Models","venue":"cs.CL","work_id":"b56a7e15-d864-43f4-9212-59bc7ec70d21","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:157cb95f82d510ca1db22ab9e9c043083d53af29c26ed149418e4df2f5fc91a8","observation_id":"1df2d2f0-9e89-40ad-8337-899c60069ee7","resolution":{"observed_at":"2026-05-13T20:48:41.492604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10643","doi":"10.48550/arxiv.2511.10643","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Black-box on-policy distillation of large language models.arXiv preprint","venue":null,"work_id":"1e58a1be-9294-4bd3-8040-3516dcebcd4a","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:e123c4d26196399a8f79f9f355118d68e03b591cdc73a1a670bc5965075d0885","observation_id":"5c1881bd-45b1-464c-a3b3-e9b09c88dcc2","resolution":{"observed_at":"2026-05-11T03:40:54.551709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20244","last_updated":"2026-04-22T06:46:22Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T06:46:22Z","title":"Hybrid Policy Distillation for LLMs","version":1},"cited_work":{"arxiv_id":"2604.20244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20244","snapshot_observed_at":"2026-07-01T22:36:17.393903Z","title":"Hybrid Policy Distillation for LLMs","venue":"cs.CL","work_id":"b1475ac8-edb2-4b76-b530-ea04a959f566","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.20244","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:e5e31ac77292c6df952a0339d9c3282d307772aef49f757ee671578c3a3962c8","observation_id":"81440573-cb7e-4fe5-b359-ad3e7c5a5fca","resolution":{"observed_at":"2026-05-11T03:40:54.531672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-07-12T22:24:50.116694Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":"2604.10688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-07-04T16:09:56.987062Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","venue":"cs.LG","work_id":"c31baac4-7cbe-4749-92ac-4d4051d62ec2","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:ec1a45dedf0d33fd02d015e37b83ca16fa32169f2c48c3330b373351763caa76","observation_id":"1a1229c6-63d0-4ef8-a2e8-ef3f7b015bc5","resolution":{"observed_at":"2026-05-11T03:40:54.538197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03873","last_updated":"2026-07-17T01:46:42Z","snapshot_observed_at":"2026-07-22T23:19:06.066385Z","submitted_at":"2026-04-04T21:38:22Z","title":"SODA: Semi On-Policy Black-Box Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.03873","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03873","snapshot_observed_at":"2026-07-03T00:57:29.928930Z","title":"SODA: Semi On-Policy Black-Box Distillation for Large Language Models","venue":"cs.LG","work_id":"17e2e473-94f6-4592-a733-95ed0ef23970","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.03873","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:fb43be70a71634916744cf14cb3db6346a8aa1d6f4882dc20e26f670524bddea","observation_id":"019ee0cb-692a-4c8c-8c7b-cc7f51187955","resolution":{"observed_at":"2026-05-11T03:40:54.517741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":"2602.12125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-09T00:35:48.740330Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","venue":"cs.LG","work_id":"bb968107-1f43-4bf4-aa52-cc58000a6e89","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:3c45db9db2b1dbeb5a1f74723e6d4e27c582db5bf35b0693b0291b21e8b1fbdc","observation_id":"61b0c8b4-a0e2-4045-8dc7-d3430afc24cd","resolution":{"observed_at":"2026-05-16T05:11:07.754859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d491c28b11476b3ce3d194b3da7fe4fde5b5e0851bdcbea90720197c3dcee97e","observation_id":"28f76bcb-17ac-48ef-a40e-23b074abbde9","resolution":{"observed_at":"2026-05-12T03:54:31.187112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:3d9b4be7c99eddc4211a5d936dde1de037c1b73a2bd2265f180e60bd300d4e29","observation_id":"b1e518f7-5015-4e73-8957-0c918aa3f206","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:fe9eca9116209af2e38d4b8cb54e1a1ddeffa8c73adc367e33221b59efc55e0d","observation_id":"0dce8468-16a9-4efd-822f-7d08368f4c1f","resolution":{"observed_at":"2026-05-12T04:29:18.795354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-10T16:57:24.571259Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:ff3ca96b00be6bba53d85727eb6a1a27c541efde8a448bdef67239e07acc5536","observation_id":"5e3f0643-4f42-40f2-b21f-cade4f97822e","resolution":{"observed_at":"2026-05-12T05:31:52.723793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":"2604.12002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-07-10T01:46:41.091851Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","venue":"cs.CL","work_id":"075fcc48-23c0-4231-bf6e-c629eb2a169b","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:057d7c4533be6a89bf75beeec799854293e26ce9638dc4980d9edabccbe55a96","observation_id":"0d8b62f4-f970-43a0-8743-3cf917334732","resolution":{"observed_at":"2026-05-11T03:40:54.563012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":"2604.10674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-07-04T13:39:50.103028Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","venue":"cs.LG","work_id":"97dc38ac-2adb-4aaa-9fa4-16929254604e","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d1d523eb9a66525b4e0d26256eeac4f3395e92c0048e29768a25eca2a86838cc","observation_id":"7e4dbbc3-1559-41b4-b645-4368493b19a8","resolution":{"observed_at":"2026-05-11T03:40:54.463182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml.20251026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:24.393084Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism","venue":null,"work_id":"bb76b11f-d59b-421e-88c6-fa0920ed09c3","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:49d7779a84033138f7f787bf897571ab1790a7b683cb46965b2d0836c3c787d7","observation_id":"8f63b949-d0fc-410e-acb1-7657a83b2a75","resolution":{"observed_at":"2026-05-11T02:30:53.275162Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T07:08:02.609025+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:43:39.521871Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"a3e7b62a-fe52-4fbc-9830-9d6adb0d60c3","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:b0c6b08a74b47a16dea37f80752f66f02431bcc184f83a9f0516081bdaaef6d9","observation_id":"204e1e9e-7f5a-41fa-a845-8a5c60ff7e9a","resolution":{"observed_at":"2026-05-14T12:45:15.800279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:aed388b064b561d1baf9b842143424be6c13a703c6bd91a91127e4b671e840f1","observation_id":"a652af40-8885-414d-b31f-fab7ff4f8893","resolution":{"observed_at":"2026-05-11T03:40:54.502449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":"2505.22312","doi":"10.48550/arxiv.2505.22312","metadata_source":"pith","pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Skywork Open Reasoner 1 Technical Report","venue":"cs.LG","work_id":"27740ebb-6704-4ef9-8878-5b81d4269869","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:654531305520277f9e5e2349a35f6bf82b95286d780b025e11f36e7ed3eec678","observation_id":"222de1d9-2cac-4ee5-8a52-ed3b652667bd","resolution":{"observed_at":"2026-05-17T04:26:47.432522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16812","last_updated":"2025-08-27T03:10:49Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:59:03Z","title":"MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning","version":2},"cited_work":{"arxiv_id":"2507.16812","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16812","snapshot_observed_at":"2026-07-05T15:11:10.807862Z","title":"Megascience: Pushing the frontiers of post-training datasetsforsciencereasoning.arXivpreprint","venue":"cs.CL","work_id":"d21e62b1-0689-4840-b3b4-eea8eb829a15","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2507.16812","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:877a31fee7f0557dd8eadeda43ad7004c823ff83300b539432f546749015a1b1","observation_id":"6683b0ae-5a2a-4ff1-bc95-d89a5a8bb99c","resolution":{"observed_at":"2026-05-11T03:40:54.499255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:14:00.898380Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"1a65f421-2e48-4c87-8f62-4057a79265f3","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:68f347203aefef43dcd6d109c09f4a236f0c7f0fc77666365cddd7d7a1f3b8fe","observation_id":"71dbaed3-d187-45ef-9b4f-d5c89cf25ebf","resolution":{"observed_at":"2026-05-14T12:40:17.352075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:33:45.982531Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"26e36bd3-6b66-472b-9fd3-24aff0845dda","year":null},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:21d9773570845aa46ac7d3ca692ab937461782ae1bf744e4b61fdbf14f396e13","observation_id":"b727a3d1-5a32-47cb-b835-92cd5b622f19","resolution":{"observed_at":"2026-05-14T12:40:17.336221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasonflux-prm: Trajectory-aware prms for long chain-of-thought reasoning in llms.The Thirty-ninth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":"84d67287-a354-4c02-8eec-ebfc34509848","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:f7f8a53c468a435c2e5c95e7dc4855e8648ff889f0802cb27993d35ca5cb5b6a","observation_id":"8f5af7ef-36d8-4eea-83d3-c8e54f24ec26","resolution":{"observed_at":"2026-05-14T12:40:17.327393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-07-06T21:12:12.799570Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":"2504.14655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-07-04T18:30:01.590053Z","title":"Leetcodedataset: A temporal dataset for robust evaluation and efficient training of code llms","venue":null,"work_id":"fa4f9b7e-a077-4016-9e1e-920df8d601b6","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d73c123558d430801ffd8fc34b66ab08dea740148972b412a5cdfac0d12f15f2","observation_id":"fe0f54f0-85b2-46d0-b37e-68742d50efe2","resolution":{"observed_at":"2026-05-11T03:40:54.525214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Google-proof","venue":null,"work_id":"f26cd60c-3766-4993-b298-2e39c4f6c804","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:3815a8eb67de77e341a0cd85e90db5dd6fb98922f54b75c0d319692c8a486e6e","observation_id":"008ff677-4787-48fe-b2bf-68abdbc4b69f","resolution":{"observed_at":"2026-05-14T12:40:17.319367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The maximum prompt length is set to 2,560 tokens and the maximum response length to 20,480 tokens","venue":null,"work_id":"2be45a7e-ee0f-4ebb-bbb9-d4cd35ae5157","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:c2eab6541ae203474d2b35f50e923d9ff1e197dfad9f2537b80af38ec9ae6d93","observation_id":"0cef3d08-67c9-4bda-8942-b3772d3e0c51","resolution":{"observed_at":"2026-05-14T12:40:17.323281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This already introduces a divergence jump substantially larger than text-only drift ( Ω(m·η tool) vs","venue":null,"work_id":"4ef0832b-ca5b-446a-8f01-17b05c3099bc","year":null},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:1dd4454e146d5843fdeca22662245941f95e31ed97cc00729a289474595dfdb5","observation_id":"24d4001e-5d5f-4a8f-ae83-53989b50f71c","resolution":{"observed_at":"2026-05-14T12:40:17.315121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8cdd1900-9114-4dd8-8a8f-daa2d35a7c7a","year":null},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:d9a259749fb3c803339623ef26e84df3579d1132c2248ff7f51e0e7d38c19c19","observation_id":"bf207ca7-6bbb-4179-ab9f-cd198129964f","resolution":{"observed_at":"2026-05-14T12:40:17.310420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Updates become dominated by uninformative, high-magnitude contributions from tokens where the teacher provides no meaningful guidance","venue":null,"work_id":"b85061f6-a98e-422b-a666-1bd50dc36410","year":null},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:5f5106e38cead1df3de79a88e64ec4f3ae565b15f6a644093e5305ce74bec992","observation_id":"84286c90-ee92-41c8-a4e4-ce1442914c7d","resolution":{"observed_at":"2026-05-14T12:40:17.342690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"36”, changes to “\\boxed{66}","venue":null,"work_id":"ef1d5b6a-3017-47b7-b3a1-52643ca7406d","year":2022},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:a203805514f197d2c2c7747b061f3ff245345fb4ac2b9597bbc47a98509dd460","observation_id":"8ca1ccc9-8c17-48b1-af18-98abebe27f3b","resolution":{"observed_at":"2026-05-14T12:40:17.347410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07725","last_updated":"2026-05-08T13:30:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-31T17:52:54.144620Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":60,"verified_fuzzy":19},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 5 inbound Pith citation observations for arXiv:2605.07725."}