{"as_of":"2026-08-07T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee54b8c7a5b0b4c403a3d211a8e64b59da35ab484f87e7c77681c79c1330504e","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:01:56.628017Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:07:43.400511Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-07-14T05:09:00.865375Z","title":"Weak-to-strong generalization via direct on-policy distillation.arXiv preprint arXiv:2607.05394, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11505","last_updated":"2026-07-13T12:56:21Z","snapshot_observed_at":"2026-08-07T04:38:42.145329Z","submitted_at":"2026-07-13T12:56:21Z","title":"Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T05:09:00.865375Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2607.11505"},"observation_digest":"sha256:a9d678e22d450ac0848fb75c1089c39b79c410c7a72afbd1f323632db673272a","observation_id":"d3bc2ed4-398d-4cbd-b8e9-451f2561bf49","resolution":{"observed_at":"2026-07-14T05:09:00.865375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-08-01T07:07:43.400511Z","title":"Warmer colors indicate stronger image-dependent preference, and the bottom row shows the additional contrast learned by VCSD over OPSD","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21556","last_updated":"2026-07-23T17:37:37Z","snapshot_observed_at":"2026-08-07T03:52:02.241300Z","submitted_at":"2026-07-23T17:37:37Z","title":"Visual Contrastive Self-Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:07:43.400511Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2607.21556"},"observation_digest":"sha256:216a0a745c2feeadb1a10354f77df90de7909bd9bd573323aa324d3b7f8246a2","observation_id":"fc5e68fa-d86f-46ee-8b20-62d69c403240","resolution":{"observed_at":"2026-08-01T07:07:43.400511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-07-31T06:59:14.911227Z","title":"Weak-to-strong generalization via direct on-policy distillation.arXiv preprint arXiv:2607.05394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:14.911227Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:661ec0e10cdf2da5cd5332340a2babc05414e862163a84c87f1ab90e74f9290c","observation_id":"9e45157b-2721-467a-bed1-ad066595600d","resolution":{"observed_at":"2026-07-31T06:59:14.911227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-08-01T00:26:21.345094Z","title":"arXiv preprint arXiv:2607.05394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-03T10:50:56.850549Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.345094Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:75c31694c5f622bb9c8a2b21803d0e91ddd6243cce20577287ea0ae29d24f1f1","observation_id":"2acfd7d2-a822-474e-a4f4-f0410f2bead1","resolution":{"observed_at":"2026-08-01T00:26:21.345094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05394/citation-record","integrity":"/paper/2607.05394/integrity","json":"/paper/2607.05394/citation-record.json","paper":"/paper/2607.05394"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:3e993b0433b1853d2f5c01b176faa3a4dcb782566dee862bf661ffd225bad799","observation_id":"6384b32f-a969-43f8-a826-5270904df0ff","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"JustRL: Scaling a 1.5B LLM with a simple RL recipe","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:c136b64989c3416da424bf99a6cf88aaba5f4e2db5e3fd6ddb6653189994eca9","observation_id":"781713bd-26e9-4bf9-a4c7-0a8c157c27ad","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:c53e9e9b61851261de53dd48994a1f34fc048d43b79e5b11da1007009dae0667","observation_id":"7d872834-608d-47e3-bd86-2822c9332ba4","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"POLARIS: A post-training recipe for scaling reinforcement learning on reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:44f2507b6cd0bd7dd1deb14cfddc5256e21c2c13f45c28ae9bcb2e9a43f95378","observation_id":"5aa5a17f-54ca-4445-8b18-565ae2510235","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:e98db766f7693261ac2b8712a7d6eb23abd9baa4e86ef5af80a73c81af476781","observation_id":"84c1681c-4087-4f32-80df-36b75dd0da39","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:45c52ae1d8dc15b17e7f7d43e49922f690940ffbd92ecdb9b267e554f887fdb1","observation_id":"36d5cf22-a34d-4ab9-91ff-2a758cec96f9","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"QuestA: Expanding reasoning capacity in LLMs via question augmentation.arXiv preprint arXiv:2507.13266, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0c78d78e50a2fcbc87d364fda1c2d2a92d7bb400c7fd1eb2da1acd8488b69c03","observation_id":"9653133b-8622-4b08-8a47-917e10dfefc3","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Lyng, Sanjit Singh Batra, and Robert E","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:5d583777a189e49027e30a1d969dc0637e3657e5d6bb11e171bdbb4c75afe12c","observation_id":"e94af6ad-635d-4f35-9448-7b73035eb864","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:758e67c25f0e5fa9f771ad573759ca02f162ff4e05f578f9cb1cd5b0178b375f","observation_id":"50deb921-7e82-4e45-a46f-85698de79d12","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:77f36086e539fffbf9d33e449c0aa46e7dbac94c9624a856640d69cb243281b0","observation_id":"a4d3987e-c861-479b-96b7-fa783a730760","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Kimi k1.5: Scaling reinforcement learning with llms.arXiv preprint arXiv:2501.12599, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:2e66cf5d22d89d0217eeeb5d6fb471ab7ab620771a61312098c57fe6ba72a269","observation_id":"94210e6c-4e52-4c8f-a8a9-bf63ba3344f3","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"QwQ-32B: Embracing the power of reinforcement learning.https://qwenlm.github.io/blog/qw q-32b/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:00c619a4dd3a79119ce3d7fbe38e59f39dc4368b0df8c460467308e14ec2dbeb","observation_id":"f3eee08c-fcbf-4d05-9472-662838886b63","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Open-reasoner- zero: An open source approach to scaling reinforcement learning on the base model.https://github.com/Ope n-Reasoner-Zero/Open-Reasoner-Zero, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:ea4fde099a5b6c4478338beb43246af30b29c140dcf200c2a49634c06926a475","observation_id":"fd5107ec-5293-491b-8077-284ae9ad5976","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DAPO: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:2bfd0056abb0fd4511f84771c0454f5cb6795adb9be27edf5449cda799240921","observation_id":"79b534cb-3bb6-4c11-b93f-3ea3b04600c4","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Skywork open reasoner 1 technical report.arXiv preprint arXiv:2505.22312, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:e36d3cae6eb9d0f4231800cde52d0a56f86b604864b1fa81c62a05c78f26bf84","observation_id":"c2ee0745-8e4e-40a9-a859-7f17b88c5fba","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:bbb24953efdf49d57bc1819e4f43fe0beea2fb9feafdf84173f8ad8dc1a63764","observation_id":"6cf49e12-3bfb-4301-9504-f6cef34cf187","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"How far can unsupervised rlvr scale llm training?arXiv preprintarXiv:2603.08660, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:2185f791f79fabf2839b33e768dc24d2dfc19c234998972e54791515e0d36043","observation_id":"a95b12cb-86f7-4ad0-a343-52cd6930c9cd","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DeepSeek V4 preview release.https://api-docs.deepseek.com/news/news260424, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d54fe944809d74b9794ad2d74524ec5724855b640cd06af1d085a205a06cc353","observation_id":"9a4c5fb1-4e19-45f4-aa99-5a4411c09190","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"GLM-5.2: Built for long-horizon tasks.https://z.ai/blog/glm-5.2, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:bd0ad21f56d0873420db2edbce69f9ac0d17c9884789180c454ea4bd7160ff69","observation_id":"3b2f48df-f0f0-49ee-8791-83023a08cf92","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-07-06T21:13:45.700548Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"AIMO-2 winning solution: Building state-of-the-art mathematical reasoning models with OpenMathReasoning dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:8a6f7e64fc18ba56c801aa645153b9352c0d2a7deb14e7c1e91ac5a38cfff08d","observation_id":"75e7e64b-cea9-457a-b420-8432ff36543f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Openthoughts: Data recipes for reasoning models.arXiv preprint arXiv:2506.04178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:c15a6ab4158eec68a98c376adb41c7bf73d7d10362af7c41bff85ee5db9aad52","observation_id":"1b8404f6-722a-4ebb-a24f-a5ac0a817d8d","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d24f141632fbb7077b82f1e865728300412e85d998d39a7469cea318496437a1","observation_id":"4581e08f-2d0a-40d5-9a7c-43a41ba0900a","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:ddb194a85dcd16e520560da92ba5c72dfae8c073e5f82f2fe2f17ea9a55dcc77","observation_id":"ecc0a348-7280-492a-985b-560af29ffa29","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0610df3ce6ecaa624480b5cfb179ef7c10b5f977253357be87dcf2a391ba66da","observation_id":"2adf695e-99c8-4162-a617-959b9e5f835d","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:6e12b9a006fd35cc216c0abf81e997dd084c1613fc100816ed2f16cf35b61aba","observation_id":"0b6e95a5-65dc-4b9e-bde8-07b4ce1c8e55","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:e9118a9033d1eb3de157588b6672c345c20d333e08bf7e6b78c5180312396bd2","observation_id":"a69c8719-5814-4132-ace2-c08798ad8e0f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:7f6e8384bdd74caf34b551f4fd6264037a8ef6e2aa9e46ddca933f95ab742701","observation_id":"1008496c-3766-4143-be47-59767fdbbf98","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Improved knowledge distillation via teacher assistant","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:35b9c968f128f894b24749a05dd70e7beb9a7cd7e30f1145547b7ed30d2f0faf","observation_id":"05b37e31-2aab-44df-b3a7-9cbacb74238c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"On the efficacy of knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:8f910f9272c19c23d6d3b385c93d761bfcebbcf105f1242a2be9ea64cabae3c7","observation_id":"6923504a-4d05-46ff-b1e0-b178db0f4a6f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08606","last_updated":"2025-07-25T16:55:43Z","snapshot_observed_at":"2026-08-06T06:09:00.258656Z","submitted_at":"2025-02-12T17:52:47Z","title":"Distillation Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08606","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Distillation scaling laws.arXiv preprint arXiv:2502.08606, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2502.08606","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:22ae11cd44551a42fc74e16bb1f21ba53ac4287e8152d67495086f3216961d36","observation_id":"39e87fb7-d8c1-4488-a56e-e9092c417205","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"MiniLLM: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:b7f03f9dfebd1ae7c316ebfb7ebfe8468993d102c69bef888fd6a5c70626093f","observation_id":"50f424f5-2513-4320-b553-1367fbc27c14","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15190","last_updated":"2023-07-27T20:39:06Z","snapshot_observed_at":"2026-07-06T15:59:30.956483Z","submitted_at":"2023-07-27T20:39:06Z","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15190","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2307.15190","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:61c2239d39a901b0e2ebc6078611f2c753ffd2ecc9f89864a7a77d9f1176d7b8","observation_id":"41d7ce90-7def-4c90-9ae3-971c097dea1f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11890","last_updated":"2024-06-17T02:44:28Z","snapshot_observed_at":"2026-08-04T07:02:38.134015Z","submitted_at":"2024-02-19T07:01:10Z","title":"Revisiting Knowledge Distillation for Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11890","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Revisiting Knowledge Distillation for Autoregressive Language Models.Proceedings of ACL, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2402.11890","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:9c125e0925b3dea0b16049ea6ed56c2aa37262cce39c61cce8f03504a41847a5","observation_id":"06919646-9ff1-4cdd-b87a-59e50e152d61","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02657","last_updated":"2024-12-08T13:03:38Z","snapshot_observed_at":"2026-07-06T17:55:03.561275Z","submitted_at":"2024-04-03T11:40:17Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02657","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Rethinking Kullback- Leibler Divergence in Knowledge Distillation for Large Language Models.Proceedings of COLING, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2404.02657","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:8b409d52887056268722676e0eb889bb6964144e265886d2f8c45df16711b14f","observation_id":"5cbe331a-0496-4e58-9684-cd0b1ebcb88c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-05T01:48:55.895470Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models.Proceedings of ICML, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:08cb27ac9f22d81888efe39d48343b27146e32c0570db9c86eb03e8498c37532","observation_id":"e193e4c4-d4be-4125-9b9c-a5b283fa6f3b","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07067","last_updated":"2025-05-30T04:41:12Z","snapshot_observed_at":"2026-08-06T09:31:37.382364Z","submitted_at":"2025-03-10T08:51:32Z","title":"DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07067","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2503.07067","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f05e6bb135c5613decb4254f90ce140f279015c689c6f174effb012689751223","observation_id":"02d101de-8bd5-4513-a448-a79bafb8a2e5","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17215","last_updated":"2025-03-19T00:03:30Z","snapshot_observed_at":"2026-08-01T16:26:33.917672Z","submitted_at":"2024-10-22T17:40:32Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17215","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models.Proceedings of ICLR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2410.17215","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:b621d9249828335677b8769acafa7da0ef1ee770d03ec81ece894706ae6c5862","observation_id":"ae0c877e-fa71-480a-bd99-fb47ceb9b5e6","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08461","last_updated":"2024-03-31T03:06:51Z","snapshot_observed_at":"2026-08-06T22:36:42.010627Z","submitted_at":"2023-10-12T16:21:04Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08461","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2310.08461","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:6891379ef7c780d204a505c8bceaecbb2cfe280e4752efa7ffaf8f7fab80f1d6","observation_id":"fe7aab0c-affa-4812-afc1-8f3420495a68","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11325","last_updated":"2025-04-27T23:18:29Z","snapshot_observed_at":"2026-07-06T19:33:39.134036Z","submitted_at":"2024-10-15T06:51:25Z","title":"Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11325","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Le, Dhruv Madeka, Lei Li, William Yang Wang, Rishabh Agarwal, Chen-Yu Lee, and Tomas Pfister","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2410.11325","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:5d29f54e3ecf4964148ee832ee0facc4dcd6b3afdf56b757e6848568b08b1061","observation_id":"f77a8127-b322-463a-9b50-9174f09f7466","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"On-policy distillation of language models: Learning from self-generated mistakes.arXiv preprint arXiv:2306.13649, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f5bcf53351175913619dc6fd28d1823ddd1f6139c096a147997272b268d937f8","observation_id":"024037ba-1aa8-4095-a577-2a05dace3ead","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"On-policy distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:3a54af8afd5b8db52fadb5d1134a64d1f6854d7de0081a8ee5031513b85b9c57","observation_id":"728b120e-b2c7-4ebd-8f93-6ed3e04fcb5d","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"A survey of on-policy distillation for large language models.arXiv preprint arXiv:2604.00626, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:8a52f186f785d3c4061b5faac7ae76c3749174e2367b30f82d2161c56379dce3","observation_id":"f79f2454-7766-4eb6-a227-81f81e99d52c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d41052c8eed8668f8635968410ff0168fa368463b65ee98fc41d9fdd5ef7f709","observation_id":"4e3d80cd-222f-4bf9-8239-ce5b1f2ac704","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Entropy-aware on-policy distillation of language models.arXiv preprint arXiv:2603.07079, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f966345acd0570c6f0c620e8c280c79e7fb82546968eb5a6131bd1d5ecd391b5","observation_id":"10e7219c-baa6-428c-ada3-027eeaf43a71","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07155","last_updated":"2026-07-11T08:43:13Z","snapshot_observed_at":"2026-08-03T11:14:50.541582Z","submitted_at":"2026-01-12T02:57:39Z","title":"Stable On-Policy Distillation through Adaptive Target Reformulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07155","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Stable on-policy distillation through adaptive target reformulation.arXiv preprint arXiv:2601.07155, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2601.07155","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:ef18e0ac3cf08585eac8c89caf3ea5c0fb7065a8e57af256a5ab885524b257ba","observation_id":"047a9d32-1acc-419c-a421-c27d9081f21f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:b3feed9b7aae245c7a75446239315a3d00aefdd142d58175e843ecb6a8c29aef","observation_id":"634d9d0a-0f4b-4104-87d3-a211920d3e77","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"On-policy context distillation for language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:590aa9ee065e81d762f7344c973664ba8b93d5d38fd726edbaa4811b8e0969d1","observation_id":"590650dd-5a62-415d-917c-4b7c0c073182","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16856","last_updated":"2026-06-29T12:13:29Z","snapshot_observed_at":"2026-07-13T23:28:27.562632Z","submitted_at":"2026-03-17T17:57:49Z","title":"Online Experiential Learning for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16856","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Online experiential learning for language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2603.16856","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d0ba04c8be0168c40c141843d6b6fcbb38ac08a0dd769d24811f7cdcdc3d6d16","observation_id":"18c662a1-119b-458d-96fd-5c585807adb7","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-06T08:49:57.295985Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models.arXiv preprint arXiv:2601.18734, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f5bf8b5036e37325296fbcf98cb36ad4ca849db98cd9532b902789431f707ebe","observation_id":"edc387dc-4cc2-4c0f-b0e1-d663a455cabf","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-distillation for multi-token prediction, 2026.arXiv preprint arXiv:2603.23911, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:fff7ced62f9a5fb159cc51a08d4aa192e0c2c2c778f7101344fa80d0202e3416","observation_id":"f80e56c1-8224-4c47-a94f-165fd0dd53b4","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Reinforcement Learning via Self-Distillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:bcca562ab41e1c289997089b86c6c0b8537a45a9994b126d1859d733fa836381","observation_id":"97a91287-e81b-447f-ba55-06cc450123c2","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-distillation enables continual learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:36f9131958fd25ac04e48207d617d311a5ede51463afad45d5c46379f17905a9","observation_id":"90474726-e136-48de-9e3b-6e4428f2baf5","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11178","last_updated":"2026-04-09T18:32:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T18:00:05Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11178","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence.arXiv preprint arXiv:2603.11178, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2603.11178","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0905fff0836730f92fa2a85409d0f1e88c569366dbda12905e85e084886b4219","observation_id":"ee600dd5-d64a-4e2f-b6f9-592d71db122c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Scaling reasoning efficiently via relaxed on-policy distillation.arXiv preprint arXiv:2603.11137, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:3047f5eb065adb2ea1f01d1ed8ba18eaeebc4d1a6ff8031ba78c27312de60058","observation_id":"4348ce7b-e70f-47d8-80a7-4351fa53540f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Why does self-distillation (sometimes) degrade the reasoning capability of llms?arXiv preprint arXiv:2603.24472, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:40b4e728632ba178f8d5af079886a94122e12cbe10d038c3c830b80f50c83cf9","observation_id":"c5cc2cab-e0d2-4d53-a4cd-ec2741f3039b","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Black-Box On-Policy Distillation of Large Language Models.arXiv preprint arXiv:2511.10643, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0d20be4e4f5daee262d680451bfdc9975f6c28cd944c0a00f653bfc886644073","observation_id":"e211856f-990b-4702-8110-4a7c6b1588a3","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Mimo-v2-flash technical report.arXiv preprint arXiv:2601.02780, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d9bdc27d8434d7a56f276542739a794fac545f6f9d771f3ce1f5257c370fbc88","observation_id":"0d55ba62-ba98-4143-9c40-df5269453ede","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d04b80ff5eaebc64c243b9251e3800b6d807df52ba2381bd93b2a2f1ba1b070f","observation_id":"276f615d-744d-43a4-9f4a-e18d4b387fe2","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-07-06T21:35:22.208213Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning.arXiv preprint arXiv:2506.02208, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:5dc9bf05acd2a7666a317f91167690f53ec2b87fbbdc769603f83ef9c3c41126","observation_id":"64d41ed5-9b4c-4adb-a93e-dcf3a9891769","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22495","last_updated":"2026-06-17T23:32:06Z","snapshot_observed_at":"2026-08-07T05:05:50.314879Z","submitted_at":"2026-02-26T00:20:39Z","title":"Reinforcement-aware Knowledge Distillation for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22495","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Reinforcement-aware Knowledge Distillation for LLM Reasoning.arXiv preprint arXiv:2602.22495, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2602.22495","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:1f12df2479cf7b5dab25a415f76912a51412f4d7d22f7bd11d6d14db79a96fa5","observation_id":"468560f9-9e50-4064-8267-4f0333143a5f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02832","last_updated":"2025-07-23T04:59:45Z","snapshot_observed_at":"2026-07-06T20:46:41.601428Z","submitted_at":"2025-03-04T17:57:09Z","title":"AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02832","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2503.02832","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f775266013e425be25b94275e32a04d23c80cf84441743405b25045b1460ee2e","observation_id":"dae33936-2343-424a-a54f-d8b6cb275983","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-distilled rlvr.arXiv preprint arXiv:2604.03128, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:74ccf9648fa2d19e43c83c43bd79cd6f2712e16e85b4669cadc9f541a7d5f28b","observation_id":"199e62b2-4e82-4319-b42c-2c9f4923472e","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:e845ad3b74e0a0e98a947459220b82dfb7858f7a114dccba12ac92fa7bb3229e","observation_id":"90af5db4-293a-48db-b8ee-8fcac00d6648","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Learning beyond teacher: Generalized on-policy distillation with reward extrapolation.arXiv preprint arXiv:2602.12125, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0f130a60748fc5641b412e9896c2137b59469da8b20364d137055f9fb4feef6f","observation_id":"7f6fa9c3-f691-4d54-bab7-22445a3644f7","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision.arXiv preprint arXiv:2312.09390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f527b0abcf8d63f0731c9641c7871b47463ddb3726d315659fe00eac5e164271","observation_id":"d4278c51-8044-46dd-8869-3e9a187f8195","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Introducing Superalignment.OpenAI Blog, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:96bc8e359b519bf7486330859d52214b5e71f03b3c519bbb45616138e600ee7c","observation_id":"85d9953a-31c0-4406-b7bc-bab71cdbf235","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Semi-supervised learning by entropy minimization.Advances in neural information processing systems, 17, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:8f1ddb372798b96a912d9a65de727bace5c18933f601ee8e0aeab20193864699","observation_id":"8fff07fb-add9-4446-8386-8f388a8a2e3b","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Semi-supervised sequence learning.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d93d9114c68330a4a66f9f454e0b7f585a42bae2e50b8e8a71ac49ab78f46bca","observation_id":"7bcd7216-249b-4b3a-a233-65f4d84875b7","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02242","last_updated":"2017-03-15T14:22:41Z","snapshot_observed_at":"2026-08-01T18:35:12.430501Z","submitted_at":"2016-10-07T12:15:42Z","title":"Temporal Ensembling for Semi-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02242","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Temporal ensembling for semi-supervised learning.arXiv preprintarXiv:1610.02242, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1610.02242","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:050e75399327ad1c480db45119e9083962c170ffb1c83f64c814e7c5260bf5b2","observation_id":"34d855c2-7bc0-4846-aeed-7732e5b6d353","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05594","last_updated":"2019-02-21T15:26:31Z","snapshot_observed_at":"2026-07-06T06:44:53.896543Z","submitted_at":"2018-06-14T14:58:36Z","title":"There Are Many Consistent Explanations of Unlabeled Data: Why You Should Average","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05594","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"There are many consistent explanations of unlabeled data: Why you should average.arXiv preprint arXiv:1806.05594, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1806.05594","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d77b217aa1ed72df606b905d20b1223ec1e1d6262d77e33349f223507fbadacd","observation_id":"3028b6e0-7e46-4822-97ff-68d65d743ec6","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Co- teaching: Robust training of deep neural networks with extremely noisy labels.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:aa5f5b9553633268d07ecdf3cd5ebd65fac2f2996c3532531c3879183e5a9726","observation_id":"82abf378-ab71-4341-8a32-0c2805e6112f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Mixmatch: A holistic approach to semi-supervised learning.Advancesin neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0d74e3641b388348416e51e6a3beaa717fa4343fa920b8560b1671d5afaa4b72","observation_id":"00ead182-98ff-4c1c-88df-9ae548532948","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07394","last_updated":"2020-02-18T06:20:06Z","snapshot_observed_at":"2026-08-06T03:18:08.960708Z","submitted_at":"2020-02-18T06:20:06Z","title":"DivideMix: Learning with Noisy Labels as Semi-supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07394","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Dividemix: Learning with noisy labels as semi-supervised learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2002.07394","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:369bead770a477d0b45a5c0a721b8efc6783ec56402383225b55284be37a2067","observation_id":"f07f7858-d323-44b4-b4d7-2cbf87c19d7a","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Big self-supervised models are strong semi-supervised learners.Advancesin neural information processing systems, 33:22243–22255, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f755f241a83d4d02f1e66baca47e215e938d5f50f64ad6544c612f6c77a048c0","observation_id":"950dff98-1d8e-443f-b012-6690f257a3cc","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-training avoids using spurious features under domain shift","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:6b572eb838a3516ca762890305b601d167dbfc4a97f85db76e32ae604c90ac57","observation_id":"2c27b717-4ded-4395-9db9-0e282e795c8c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Debiased self-training for semi-supervised learning.Advances in Neural Information Processing Systems, 35:32424–32437, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:6e66f3de59691a15250afa6fd7dd122bf0da63bd7d63cb673b95fe7e38c1c2c9","observation_id":"64ef02a0-7147-45f0-8af1-8039bc4c3f2c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Supervising strong learners by amplifying weak experts","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:87ecb4e2ad89e217efbcecae0f4b16c26864644295c9a46c9b17a3ddf6c4aeb7","observation_id":"ec5da4bb-bd31-4da6-89f0-be1b9fc965bf","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Scalable agent alignment via reward modeling: a research direction.arXiv preprint arXiv:1811.07871, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0d0360ae82edaee6c87c1452e34e0aad981b230f3ed2c413e93b0901eb336b7c","observation_id":"0fbe11a8-925b-4d49-8365-804d4389dcb3","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-02T15:33:17.783178Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"AI safety via debate.arXiv preprint arXiv:1805.00899, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:911a258ab69d2a44fbb40f27e1e140fba2729aefe2bc97529e8fe2f4b416776b","observation_id":"c784bae3-20a2-41a5-974b-8598dea0a1d0","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Measuring progress on scalable oversight for large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:011e4319fa1f59521f13fc4c1fead1edf38184e310518c985d0e4f5a972b5f5a","observation_id":"efc4af27-2ee3-4a29-9127-9092046319d2","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Artificial Sandwiching: When can we test scalable alignment protocols without humans?AI Alignment Forum, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:32e785c314c82447a40543a68272baa09323869f226c80a94ff9b196476273fd","observation_id":"0ea91f91-1b4b-4cb1-a103-43bccd9bc4dc","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Constitutional AI: Harmlessness from AI feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:6d7d3725678d730f50c48653bf45a618a71daa329216f924a8b14f510767bde4","observation_id":"99441c2c-ca2f-4586-bf71-7c1011ce5e6f","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Eliciting latent knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:360da3cf0e20f86defbdc8deee1d36a89fa045f5ed1ee8e2a9dd7b38eed8378f","observation_id":"f2a85736-198b-47e0-94f0-3c6478938af2","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-03T01:53:33.505931Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03827","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2212.03827","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:2904913bf1a72513733cd570333a4100778d3086611e9996a67731ae90c845fd","observation_id":"5ddb4ac6-1bdc-4ba8-918d-16f06d406da1","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Can you learn an algorithm? generalizing from easy to hard problems with recurrent networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:b7b715e5afeff7172323ef502c36f58f15264f29409b422ecc71eef5905a813d","observation_id":"d59ddbb5-b5d1-453d-8626-7b68dba12af6","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06011","last_updated":"2021-09-25T15:08:36Z","snapshot_observed_at":"2026-07-06T11:37:59.129170Z","submitted_at":"2021-08-13T01:11:53Z","title":"Datasets for Studying Generalization from Easy to Hard Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06011","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Datasets for studying generalization from easy to hard examples.arXivpreprintarXiv:2108.06011, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2108.06011","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:50c9a71242bd65ca7de90a8ffcbccfafb61cc70e2eaddb33ef4df5fb43d5cfe6","observation_id":"e7e164f9-b7ce-4033-aa45-6d8ad297595e","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01252","last_updated":"2024-09-03T07:07:59Z","snapshot_observed_at":"2026-07-06T18:24:21.774341Z","submitted_at":"2024-06-03T12:10:26Z","title":"Towards Scalable Automated Alignment of LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01252","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Towards scalable automated alignment of llms: A survey.arXiv preprint arXiv:2406.01252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2406.01252","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:202796e20f5ce4c2103cc5fa49e54147a0a63b2f9a016fc71d4f386252cbf57b","observation_id":"1e73740b-de68-4537-b9e3-29f49fd9d5fe","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11107","last_updated":"2025-05-28T08:43:07Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T12:50:20Z","title":"Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11107","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Revisiting weak-to-strong generalization in theory and practice: Reverse kl vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2502.11107","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:1227c2e861b499b59b52ddf818ed177eb553bc5288bbdcd1a00adc388388e0c9","observation_id":"0e6647ff-7514-4774-80c3-60e33af2a2fc","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03109","last_updated":"2025-06-03T17:40:08Z","snapshot_observed_at":"2026-08-06T21:24:30.574833Z","submitted_at":"2025-06-03T17:40:08Z","title":"On Weak-to-Strong Generalization and f-Divergence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03109","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"On weak-to-strong generalization and f-divergence.arXiv preprint arXiv:2506.03109, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2506.03109","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:16848f362e5d82318e775bce5f71a368e7d1997a223ca3b4f9592cef860935b2","observation_id":"e7fe6e15-85a8-4a3d-97e2-033207bc1c2d","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00667","last_updated":"2024-02-01T15:30:19Z","snapshot_observed_at":"2026-07-06T17:23:47.717199Z","submitted_at":"2024-02-01T15:30:19Z","title":"Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00667","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Improv- ing weak-to-strong generalization with scalable oversight and ensemble learning.arXiv preprintarXiv:2402.00667, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2402.00667","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:0fa7587181b300007ab7b66d6284183161b885e62cb7be52604dc3f9588fb636","observation_id":"f24e9d31-ee6b-4b32-8a90-579283d1a286","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Incentivizing strong reasoning from weak supervision.arXiv preprint arXiv:2505.20072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:142ef5fc0ffcdc6b390e830918bed6a765050fb0a3902c7602438cf0d638581d","observation_id":"05cc7a6e-dcbc-43d6-84f6-477e05ee8cee","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:f97ce4cbfbe9bc18c585a25a289509e687ba049f70bdffd633753b82855590df","observation_id":"36f27840-916c-40e0-a746-c4ccd5e21f1b","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18640","last_updated":"2025-03-06T11:45:40Z","snapshot_observed_at":"2026-07-06T19:39:01.657517Z","submitted_at":"2024-10-24T11:06:29Z","title":"Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18640","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Weak-to-strong preference optimization: Stealing reward from weak aligned model.arXiv preprint arXiv:2410.18640, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2410.18640","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:b122d7bc91fb94532fd63bc8d87262f147110364c66c8ca8ca8c7ae7fc206fa5","observation_id":"30059df4-9f93-4e88-8475-7f9ccd21f731","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"A general theoretical paradigm to understand learning from human preferences.AISTATS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:5731267fca67f23afe6089ee9cb4459522f0318a45573812b9ea9df39070679d","observation_id":"6a17ee42-4f29-47d8-9461-8c67c3ee4b4c","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"KTO: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:90e02531e06841ef041293b0900735153ccfd4387fef0ba6b2f1cc615a2c1450","observation_id":"0b6b0ef9-469d-4174-ba8c-81a441375b34","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"SimPO: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:65e195bf026ab05d0fbd5b58b9fdaade552007f9b90e1fec7ce6626cdf60f120","observation_id":"7a573a63-9006-4612-9cca-b45b8d2aab0a","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:3550c0ec276c11f4cc3cca18ae73919d80ca4962c171e86fe9edc505776758b1","observation_id":"61393b5f-49b2-49fd-bfbc-66143ca88918","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Math- shepherd: A label-free step-by-step verifier for LLMs in mathematical reasoning.arXiv preprintarXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:d59ab829a4086ad69dfbef9f48be13fb803a8867f59931a518abbe0db9f7c3ba","observation_id":"6efae79e-95ab-44cf-9b7b-66b1143a3634","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:b2e5860cf1d9b8e31be41bec693fc60a500170316c9d7090b1b55a8cd63e1f6c","observation_id":"9130062e-7c6d-431d-b775-576e47f93f5d","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"VinePPO: Unlocking rl potential for llm reasoning through refined credit assignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:78a6ad9e9b5a4cfcf5dd622724b5868c130438049057cdbe04f89f4cbf835643","observation_id":"e68e1632-e745-4550-a34c-fc003f8ded03","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 4 inbound Pith citation observations for arXiv:2607.05394."}