{"as_of":"2026-08-14T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:189de099247c6ba3a5d1274e7ffa86e69a52768a187444f3e43957bcc16023e6","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:59:15.208890Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24720/citation-record","integrity":"/paper/2607.24720/integrity","json":"/paper/2607.24720/citation-record.json","paper":"/paper/2607.24720"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:14.873544Z","title":"On-policydistillationoflanguagemodels: Learningfromself-generatedmistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.873544Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:3cf535443b89841692a639ce6ad5fc6122ceefec48d19ac7b32ff1a23e146f68","observation_id":"16bf0b82-4f8e-47d9-a0e4-0eefd0935772","resolution":{"observed_at":"2026-07-31T06:59:14.873544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-13T22:06:58.555085Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19683","snapshot_observed_at":"2026-07-31T06:59:14.883715Z","title":"Large language models for planning: A comprehensive and systematic survey.arXiv preprint arXiv:2505.19683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.883715Z"},"links":{"cited_paper":"/paper/2505.19683","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:0368583c66c0f47bc331fb3f8c96746629a591b55496444c0dd46c5b48374aa1","observation_id":"6c4888ed-fc61-4432-b14c-145e9db723cc","resolution":{"observed_at":"2026-07-31T06:59:14.883715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14465","last_updated":"2026-06-01T10:03:07Z","snapshot_observed_at":"2026-07-14T21:12:47.241355Z","submitted_at":"2026-03-15T16:13:58Z","title":"AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14465","snapshot_observed_at":"2026-07-31T06:59:14.907995Z","title":"Agentprocessbench: Diagnosing step-level process quality in tool-using agents.arXiv preprint arXiv:2603.14465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.907995Z"},"links":{"cited_paper":"/paper/2603.14465","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:e3604d9278b54bfb3fc5426236d3453bcd65d76d3731d2c6a651ad3e924f6bc2","observation_id":"82416f95-36f1-44c0-9a27-f2cb38b140c2","resolution":{"observed_at":"2026-07-31T06:59:14.907995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-07-31T06:59:14.911227Z","title":"Weak-to-strong generalization via direct on-policy distillation.arXiv preprint arXiv:2607.05394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.911227Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:661ec0e10cdf2da5cd5332340a2babc05414e862163a84c87f1ab90e74f9290c","observation_id":"9e45157b-2721-467a-bed1-ad066595600d","resolution":{"observed_at":"2026-07-31T06:59:14.911227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-31T06:59:14.914845Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.914845Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:1ea72dd0373132e00c524ba0b63ea245cdd1dc4762b99de4bd6ab0ca3678dfe9","observation_id":"a277c381-ed47-4fa7-b03c-e399c8af5ac9","resolution":{"observed_at":"2026-07-31T06:59:14.914845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07709","last_updated":"2025-06-17T09:23:02Z","snapshot_observed_at":"2026-08-05T04:46:28.424354Z","submitted_at":"2025-02-11T17:08:00Z","title":"MAGELLAN: Metacognitive predictions of learning progress guide autotelic LLM agents in large goal spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07709","snapshot_observed_at":"2026-07-31T06:59:14.917904Z","title":"Magellan: Metacognitive predictions of learning progress guide autotelic llm agents in large goal spaces.arXiv preprint arXiv:2502.07709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.917904Z"},"links":{"cited_paper":"/paper/2502.07709","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:a38cddad7e4b68e5cecc1125fd1d6c9a287abbc56763758dca9df173c5dfaf97","observation_id":"9e836083-1e7c-45f3-ad44-e227f2ecd23b","resolution":{"observed_at":"2026-07-31T06:59:14.917904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27083","snapshot_observed_at":"2026-07-31T06:59:14.920841Z","title":"Co-evolving policy distillation.arXiv preprint arXiv:2604.27083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.920841Z"},"links":{"cited_paper":"/paper/2604.27083","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:4dcd3bf6fcd0cb34effcad37a2530cef670d0182c7480219bb7204abad3f7f20","observation_id":"791b8509-062b-4da4-8a16-583ffbff6c0a","resolution":{"observed_at":"2026-07-31T06:59:14.920841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:14.923552Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.923552Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:c89a6d211a11eb61c65c02d4f65671df8278f20f0d005f71c0437f19cfebcbef","observation_id":"993cf3aa-df86-4a6e-bf54-8da691da4a8e","resolution":{"observed_at":"2026-07-31T06:59:14.923552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:14.926673Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.926673Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:9dcd862991bfee99adad00081cfff3a9392c0f0c6924862353d3869b562e0e50","observation_id":"90d96df3-1b9d-42e8-acd5-0898fb8e0d3e","resolution":{"observed_at":"2026-07-31T06:59:14.926673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-12T12:02:18.586804Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-07-31T06:59:15.011598Z","title":"Uni-opd: Unifying on-policy distillation with a dual-perspective recipe.arXiv preprint arXiv:2605.03677, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.011598Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:d69de8adbfcca760958e3a465ac73867083f58faa084b1fde4d671c1c609cb93","observation_id":"25238d1b-0ac7-4b82-92e6-9eec9cdd4dfb","resolution":{"observed_at":"2026-07-31T06:59:15.011598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.044749Z","title":"Stable on-policy distillation through adaptive target reformulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.044749Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:5b008e4320280b9fed4ed48a2f2f00c04a9cf23059520b1f0dbe5e143ad3f3d3","observation_id":"e5434bfa-165b-4ea1-ad5c-e9c0b6fdfefd","resolution":{"observed_at":"2026-07-31T06:59:15.044749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.089974Z","title":"Rag-rewardbench: Benchmarking reward models in retrieval augmented generation for preference alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.089974Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:dc718a6c1219785f39e3340364ec9e018ba2b1e28485d9d90b1c237a07734e32","observation_id":"cc85a82a-ef9a-4e67-80cd-9eb096c1bdf9","resolution":{"observed_at":"2026-07-31T06:59:15.089974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.134752Z","title":"Scaling reasoning efficiently via relaxed on-policy distillation.arXiv preprint arXiv:2603.11137,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.134752Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:5897a744af59a870357b84d496320f35b2b0ba36a5af7cd6cfc3516a3088701e","observation_id":"cfc026a5-6244-44de-8492-e6db46745902","resolution":{"observed_at":"2026-07-31T06:59:15.134752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.159156Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing.arXiv preprint arXiv:2604.02288, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.159156Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:14c26ad7dec53197ad9b6edb1142601654ca6d48305f6e2f542f7c125c241c2b","observation_id":"b9d4bf5b-0352-47b0-8310-7fe651227173","resolution":{"observed_at":"2026-07-31T06:59:15.159156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-08-12T12:31:22.878512Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08678","snapshot_observed_at":"2026-07-31T06:59:15.161670Z","title":"https://thinkingmachines.ai/blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.161670Z"},"links":{"cited_paper":"/paper/2605.08678","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:4a41230cc1fc5164741c21ba123a44d7d9323e36986582f7e26885fc810dee22","observation_id":"5fe9de7e-21af-4fdb-b42a-ee37a8a0e882","resolution":{"observed_at":"2026-07-31T06:59:15.161670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.164590Z","title":"Unlocking the future: Exploring look-ahead planning mechanistic interpretability in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.164590Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:216846914edaf29ed701313b7e73ed159e4c7afcd76b6b3ff5ecfcead7de43d3","observation_id":"a8967c0f-f30f-43cd-8ae4-1ac988eed026","resolution":{"observed_at":"2026-07-31T06:59:15.164590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-31T06:59:15.167530Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.167530Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:accbc0b97b715a72335b44a5fd1d1fadef7c985ed10c95cc00fe8c50d99d8be9","observation_id":"2925f4a0-efba-41b0-9bf5-0385742deb9b","resolution":{"observed_at":"2026-07-31T06:59:15.167530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.170697Z","title":"Pope: Learning to reason on hard problems via privileged on-policy exploration.arXiv preprint arXiv:2601.18779,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.170697Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:af08368289cf2462f094ace47be1c956d59911aac3ee8bf984188bf67d29719b","observation_id":"f1f6f190-0a52-4073-af01-d3e5c8f4b24a","resolution":{"observed_at":"2026-07-31T06:59:15.170697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-12T16:06:41.904690Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-07-31T06:59:15.173154Z","title":"Rl’s razor: Why online reinforcement learning forgets less.arXiv preprint arXiv:2509.04259,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.173154Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:ef1697dd5cb994428a8d93a59bc61a2645f1943e6bc1c902af36a977a80f7f0a","observation_id":"cfe573fb-9d52-4881-b841-f3ef30f99529","resolution":{"observed_at":"2026-07-31T06:59:15.173154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-12T23:12:20.245349Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-31T06:59:15.175710Z","title":"Self-distillation enables continual learning.arXiv preprint arXiv:2601.19897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.175710Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:7154322548170f3f78befe5ea31eea568ad2dba8a9544a9d5baa9af34140ce41","observation_id":"f5d29081-45c2-4793-8c14-da75e205a861","resolution":{"observed_at":"2026-07-31T06:59:15.175710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-13T15:44:43.257202Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-31T06:59:15.178315Z","title":"A survey of on-policy distillation for large language models.arXiv preprint arXiv:2604.00626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.178315Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:2caad38435f5f47d826c3b98eb1f13540572a9264ad7819150acabcf92b5c30d","observation_id":"cc8c05bc-dc42-4c9b-82e9-5a241445fbc8","resolution":{"observed_at":"2026-07-31T06:59:15.178315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-07-31T06:59:15.181371Z","title":"Skill-sd: Skill-conditioned self-distillation for multi-turn llm agents.arXiv preprint arXiv:2604.10674, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.181371Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:810e86a6159b949323b381d03bab62a9b00a809cb02d4b00e9277d58a07d1a90","observation_id":"689d5f84-04fd-4bde-9d77-4818006ac36e","resolution":{"observed_at":"2026-07-31T06:59:15.181371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-14T07:48:23.313445Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-31T06:59:15.184145Z","title":"Mimo-v2-flash technical report.arXiv preprint arXiv:2601.02780,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.184145Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:3094cd2d7e4a81eae5aa913e6daa0feade1bf4a85f0dccebc2407b45b2f15637","observation_id":"41165b66-84c3-480d-a89e-d0edc0d8059d","resolution":{"observed_at":"2026-07-31T06:59:15.184145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01249","snapshot_observed_at":"2026-07-31T06:59:15.187338Z","title":"Trust region on-policy distillation.arXiv preprint arXiv:2606.01249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.187338Z"},"links":{"cited_paper":"/paper/2606.01249","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:dc17f325605a752d8ba2b9faf55081902f296eee6bc12a41c1c1047bd2d0493f","observation_id":"03cac1b0-4a77-45db-8cf2-a9bc2e5f6294","resolution":{"observed_at":"2026-07-31T06:59:15.187338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.189967Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence.arXiv preprint arXiv:2606.19348,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.189967Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:ea04dbc9f3472b4b10812452a5a75d26f784ae527c1c3acf0b079e1996c918c8","observation_id":"c45225d9-c962-4d0b-9068-acaee1725a96","resolution":{"observed_at":"2026-07-31T06:59:15.189967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-31T06:59:15.192803Z","title":"Self-distilled rlvr.arXiv preprint arXiv:2604.03128, 2026a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.192803Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:7ed1d5ecbeda4772c773d2dab9877d2cc2ea3cf338f7306de137a06b7221aca4","observation_id":"16f790e2-4841-4574-ae82-48ae17764488","resolution":{"observed_at":"2026-07-31T06:59:15.192803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.195656Z","title":"From𝑓(𝑥) and𝑔(𝑥) to𝑓(𝑔(𝑥)) : Llms learn new skills in rl by composing old ones.arXiv preprint arXiv:2509.25123,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.195656Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:259f5f4f0c859b11cfaed70a2e7f956ce4c4b439ad4f2eed1d94967d9faeefaf","observation_id":"cc1a627d-9072-4c93-8cd4-93f42b3694c9","resolution":{"observed_at":"2026-07-31T06:59:15.195656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-08-14T04:58:24.703062Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.29537","snapshot_observed_at":"2026-07-31T06:59:15.198026Z","title":"Osworld2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.198026Z"},"links":{"cited_paper":"/paper/2606.29537","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:edf31aea435e2ea64c77170ea5d0ca2eae51286ee44de2c9e61ff6acc5d49e27","observation_id":"05a40bfd-2784-4590-a07b-851eae744fe3","resolution":{"observed_at":"2026-07-31T06:59:15.198026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-31T06:59:15.200541Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.200541Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:f6aaf43b872443524ec0547e7f1306817aaeffb4c0092e909d7665a6b16873a3","observation_id":"34b05c67-3f4e-4f84-bae7-38312f8180cd","resolution":{"observed_at":"2026-07-31T06:59:15.200541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.203153Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models.arXiv preprint arXiv:2512.07783, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.203153Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:02bdcac22154c1f2b512b6a72616fa683082fd4d9739fa88cfede98cb3195777","observation_id":"2cb24b19-1589-4847-8660-84d175fa4b34","resolution":{"observed_at":"2026-07-31T06:59:15.203153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-07-11T07:57:39.948830Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-07-31T06:59:15.205579Z","title":"Edgebench: Unveiling scaling laws of learning from real-world environments.arXiv preprint arXiv:2607.05155, 2026a","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.205579Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:98a131bab47561dbaa03b8351807274bfee1ad5f52e96ab844630105b3ea9b2e","observation_id":"4e34d1c5-958c-46d1-ae55-e7b29e03fa3f","resolution":{"observed_at":"2026-07-31T06:59:15.205579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:15.208890Z","title":"The row label Category gives the synthetic domain","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.208890Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:561d0c32e2f79d2c5314bd1ddd081564d2887bfef1778ad7525335b922c17bff","observation_id":"454ac1e0-413e-430d-b634-fa8d45812554","resolution":{"observed_at":"2026-07-31T06:59:15.208890Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-08-11T06:47:39.541564Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-07-31T06:59:14.974745Z","title":"Self-distillation zero: Self-revision turns binary rewards into dense supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.974745Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:ac977c54aec2ee008f1c3eca1d2abecfa5ea1e517d3cd6ef5269e824fafdf137","observation_id":"fe12c3c0-4dd9-4eb4-b3d5-ce5bbf7f5f65","resolution":{"observed_at":"2026-07-31T06:59:14.974745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30616","last_updated":"2026-07-13T13:01:42Z","snapshot_observed_at":"2026-08-13T22:59:04.854866Z","submitted_at":"2026-06-29T17:50:54Z","title":"Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30616","snapshot_observed_at":"2026-07-31T06:59:14.877055Z","title":"Scaling the horizon, not the parameters: Reaching trillion-parameter performance with a 35b agent.arXiv preprint arXiv:2606.30616,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.877055Z"},"links":{"cited_paper":"/paper/2606.30616","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:17be419042d25860a6bd8441c78c87f91006343dd6155d4a59b017001cd8d455","observation_id":"b1d1a489-2701-4d79-b64b-ec9676dc5494","resolution":{"observed_at":"2026-07-31T06:59:14.877055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:59:14.904753Z","title":"Internalizingworldmodelsviaself-playfinetuningforagenticrl.arXivpreprintarXiv:2510.15047,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.904753Z"},"links":{"citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:64acf53c4eb2bda7dc6fbe3de1da8978f7df4902030e58f43857cb7061bb3104","observation_id":"ada1fc28-ca80-4cb8-8d4e-407cdebbe162","resolution":{"observed_at":"2026-07-31T06:59:14.904753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11739","last_updated":"2026-05-21T08:50:47Z","snapshot_observed_at":"2026-08-02T09:40:14.018328Z","submitted_at":"2026-05-12T08:19:15Z","title":"Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11739","snapshot_observed_at":"2026-07-31T06:59:14.880496Z","title":"Learning to foresee: Unveiling the unlocking efficiency of on-policy distillation.arXiv preprint arXiv:2605.11739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.880496Z"},"links":{"cited_paper":"/paper/2605.11739","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:7628a153cf59a17dad0ac852ca1ecbbf160d2afbb3e0ba0c3393ae04564fce04","observation_id":"989fb6e4-b1c9-447b-bb7c-d86e6fb4b460","resolution":{"observed_at":"2026-07-31T06:59:14.880496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2607.24720."}