{"as_of":"2026-08-13T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97f5bd18414e68582a04fca7b38ad6dac5328e00fcd1c6d9f1ee5c8cb18669f2","coverage":[{"denominator":142,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:26:27.540391Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26246/citation-record","integrity":"/paper/2607.26246/integrity","json":"/paper/2607.26246/citation-record.json","paper":"/paper/2607.26246"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:15.117357Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.117357Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:e4bb3f29c6ac632abf962bd579f2457a1d98d3ff50ad9d3952e8f3d2b1686cf5","observation_id":"a55e3b13-c499-41f3-a9df-7c98c08bb6a7","resolution":{"observed_at":"2026-08-01T00:26:15.117357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:15.190883Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.190883Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:f34d0cff0fdcd66bebc12091e4bdf7346dcf94d25f9f05003d5e4c93bcb22947","observation_id":"0b98eabb-a83e-43af-a504-59cfa30af337","resolution":{"observed_at":"2026-08-01T00:26:15.190883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-08-01T00:26:15.291280Z","title":"arXiv preprint arXiv:2605.12474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.291280Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:d3e843fe5c82e5707a57730af1f1e2814063597216e40779abfa06ddf790dca1","observation_id":"1c864ef5-01f8-437b-acff-74d61ed00ec4","resolution":{"observed_at":"2026-08-01T00:26:15.291280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:15.430305Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.430305Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:50ec61e56c015e3dcd8fe4e81eb028036b60d3954bc0fed73b94bfb3449a2b01","observation_id":"1a908c5d-8948-4ca4-9a96-a873126f5d7a","resolution":{"observed_at":"2026-08-01T00:26:15.430305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:15.528458Z","title":"arXiv preprint arXiv:2602.05125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.528458Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:1e220ac0b74bc2721d522e83625ece746aa48b0aa17c934203c6e653ee8aff1d","observation_id":"677d4984-feb0-4f21-a993-5c8643224f4f","resolution":{"observed_at":"2026-08-01T00:26:15.528458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T00:26:15.656759Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.656759Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:3ca6e3bc1c018af902858c8407b7d62341c31205885dc1985f568af299a89cbb","observation_id":"006f6611-7d5a-4803-bf55-5ebf1a46730c","resolution":{"observed_at":"2026-08-01T00:26:15.656759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:15.773782Z","title":"arXiv preprint arXiv:2602.21628 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.773782Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:56f104ea4e896f3df52efc34aaa0370c94d24835f048998fe1393adb85c13b7c","observation_id":"639f0405-e45b-4a12-a8e3-6223f89ce915","resolution":{"observed_at":"2026-08-01T00:26:15.773782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00846","last_updated":"2026-07-07T15:26:45Z","snapshot_observed_at":"2026-08-06T08:31:05.751232Z","submitted_at":"2026-01-31T18:20:45Z","title":"Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00846","snapshot_observed_at":"2026-08-01T00:26:15.884060Z","title":"arXiv preprint arXiv:2602.00846 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.884060Z"},"links":{"cited_paper":"/paper/2602.00846","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:851b88669ca11db013be3ec8265bfbbea2bd9772d3f7176e67dcdee7d371dbfa","observation_id":"9cda11fd-c187-4577-8691-28bea1c15d20","resolution":{"observed_at":"2026-08-01T00:26:15.884060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:15.984931Z","title":"arXiv preprint arXiv:2603.16600 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:15.984931Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:63e2c3b296cdd0b1a37600ac94def708e35d7b6971a5018adf8b13d0bf9ddcb1","observation_id":"0871ec89-fb5b-463e-99cb-29e8befd5f31","resolution":{"observed_at":"2026-08-01T00:26:15.984931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-08-12T20:15:17.290437Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13029","snapshot_observed_at":"2026-08-01T00:26:16.096591Z","title":"arXiv preprint arXiv:2604.13029 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.096591Z"},"links":{"cited_paper":"/paper/2604.13029","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:b579c1b9197563b965f8877085e9692b50e0b205ef438215b2edc2b4b683d688","observation_id":"da442d1f-fc9d-49ad-8ffc-c454aa514be0","resolution":{"observed_at":"2026-08-01T00:26:16.096591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14738","last_updated":"2026-04-18T22:41:52Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T14:40:02Z","title":"AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14738","snapshot_observed_at":"2026-08-01T00:26:16.199370Z","title":"arXiv preprint arXiv:2510.14738 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.199370Z"},"links":{"cited_paper":"/paper/2510.14738","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:5bce3780c997e4196f11da00cbed96e7a5a90918d1d9f75e8e4c2b9f65e27da2","observation_id":"d429081d-d486-4714-9c52-292a569175ca","resolution":{"observed_at":"2026-08-01T00:26:16.199370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.296021Z","title":"arXiv preprint arXiv:2602.04649 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.296021Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:41c8db6c4e7b84a3fd15a4ed587c1d2dcae286750b47f40eff48f5b8432063fd","observation_id":"e4fe1920-783a-4f79-ab11-06a492ee180f","resolution":{"observed_at":"2026-08-01T00:26:16.296021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.367121Z","title":"arXiv preprint arXiv:2602.01511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.367121Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:92a5554944272be24b678b55e1180a041575739217180d9042550d850d2b658a","observation_id":"7b15dc30-8edf-48be-a0b3-3e8fa9f599d3","resolution":{"observed_at":"2026-08-01T00:26:16.367121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.447882Z","title":"arXiv preprint arXiv:2510.07284 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.447882Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:361b7e1d98082263fe7a77cab0cf24012e66697ee9d7a7e5174d17bf108fb6bf","observation_id":"76b69197-bb43-49de-8bb2-a74ca4509762","resolution":{"observed_at":"2026-08-01T00:26:16.447882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.497395Z","title":"arXiv preprint arXiv:2602.10885 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.497395Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:a2fbb2fe30b5bcb3aff08d4f0fef4b1329e8ee7b2a280617355e82050034ea51","observation_id":"62685b6b-c711-40df-8f86-94c4f5657f9b","resolution":{"observed_at":"2026-08-01T00:26:16.497395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-08-01T00:26:16.576394Z","title":"arXiv preprint arXiv:2511.19399 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.576394Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:84a125b52114f174119f20481d4e16123b05668160106a4fa579ff21c7fdaeb2","observation_id":"a03b8643-3e72-4672-ad6a-613268853c67","resolution":{"observed_at":"2026-08-01T00:26:16.576394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.649501Z","title":"arXiv preprint arXiv:2508.16949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.649501Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:f6221fe4183dc0f0d36ec155b39fd3280eddf3c057cb1ef538d3b2c75b1db796","observation_id":"299cef2e-f7a1-4c40-a823-698df32a7ad4","resolution":{"observed_at":"2026-08-01T00:26:16.649501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.725825Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.725825Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:3a74ab0278b42d4d8424c42fc2a65f6db914f7bf7d0aa6fba2b6861469c3ca29","observation_id":"39a7433e-7c50-4e95-97dd-de4d767ba954","resolution":{"observed_at":"2026-08-01T00:26:16.725825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.809547Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.809547Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:cc807505574a3d45b21780b057b3972a6a6f0bc43dee2c33eb5e3498aad58639","observation_id":"8923774d-4bab-4dfa-a16f-ae65f4622edc","resolution":{"observed_at":"2026-08-01T00:26:16.809547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.920466Z","title":"arXiv preprint arXiv:2510.07743 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.920466Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:528f6b33ad848383743801c7a1360828e17762ec5a39ccd952104659657b38a1","observation_id":"ec8c4125-4bb0-43ba-ae08-fcd8b4bf7ad1","resolution":{"observed_at":"2026-08-01T00:26:16.920466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:16.997032Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:16.997032Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:08e3d3d372e59fd08572bcd0eb10b69a8918e2ff31a1f1289a43933bdada1561","observation_id":"e3000590-d0fd-4309-b7fb-988c6e303879","resolution":{"observed_at":"2026-08-01T00:26:16.997032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:17.072636Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:17.072636Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:b45cdd6eb63f1dbb06b3d7f9bcd0463752578c323f7033016020e61002b8f6b2","observation_id":"ffec460e-c4e1-4ddc-bfb3-2b4b6d1f12cd","resolution":{"observed_at":"2026-08-01T00:26:17.072636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:17.155022Z","title":"arXiv preprint arXiv:2512.20061 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:17.155022Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:bb517b73f20914a29bfe30a8308b97221bac2dd699bcfdf4b500bfa06db24143","observation_id":"65e970fa-7d0a-46fb-b353-40a2e1e26338","resolution":{"observed_at":"2026-08-01T00:26:17.155022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-11T10:27:58.772493Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02994","snapshot_observed_at":"2026-08-01T00:26:17.251886Z","title":"arXiv preprint arXiv:2602.02994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:17.251886Z"},"links":{"cited_paper":"/paper/2602.02994","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:37e35b03918c3b536050a9ebf6d33a2ad0734e844185e4dcdb9ba5d4de0c19d6","observation_id":"f6a70df5-0642-4629-8189-8893c9b177de","resolution":{"observed_at":"2026-08-01T00:26:17.251886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-08-01T00:26:17.544081Z","title":"arXiv preprint arXiv:1810.08575 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:17.544081Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:4a071b1ca967ff78a92ab5cf76690fc522caa7e42e745cd0c9cd68af1554a954","observation_id":"1be3d6c8-d0e9-4690-9568-74779c25ffba","resolution":{"observed_at":"2026-08-01T00:26:17.544081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T00:26:18.074258Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:18.074258Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:261ea8b978bcf8ea49897631fea2e0ac08f3ffaba59da3c8cb7a5e70935f74a1","observation_id":"db40f63f-2d42-4e8f-93b3-12156ddc3a35","resolution":{"observed_at":"2026-08-01T00:26:18.074258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:19.591846Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:19.591846Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:6eff72eac5df5291c7e7df2f03686b656a15005f9194e0ab77733f93feef8019","observation_id":"69862301-f537-479d-aada-98241c185954","resolution":{"observed_at":"2026-08-01T00:26:19.591846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-13T05:02:02.370925Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-01T00:26:19.991996Z","title":"arXiv preprint arXiv:2312.09390 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:19.991996Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:7edfb319052b2e010f2f678e0fd77bb60b920e662b4f7b9980a7880987d530a6","observation_id":"db04f71e-3553-4fa2-b3bc-94c389c63824","resolution":{"observed_at":"2026-08-01T00:26:19.991996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-08-10T02:33:45.391037Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.00564","snapshot_observed_at":"2026-08-01T00:26:20.076885Z","title":"arXiv preprint arXiv:2606.00564 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.076885Z"},"links":{"cited_paper":"/paper/2606.00564","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:4b7a2c845afc10e7cb28adc4b38f3c0cbbd0b52c7bd85dd02641d6f795272fa2","observation_id":"9464bd17-9fdc-4dbd-9619-35e7de9a558e","resolution":{"observed_at":"2026-08-01T00:26:20.076885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-08-12T23:31:46.075603Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21924","snapshot_observed_at":"2026-08-01T00:26:20.175720Z","title":"arXiv preprint arXiv:2605.21924 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.175720Z"},"links":{"cited_paper":"/paper/2605.21924","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:7ad8d46a90c9adeedc19bfa51e6424aff67c5aa0ce576ff674581d17d24b16d6","observation_id":"84301b1e-46b5-4694-b6b0-7c96d67735c7","resolution":{"observed_at":"2026-08-01T00:26:20.175720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-12T21:43:11.603622Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-01T00:26:20.229686Z","title":"arXiv preprint arXiv:2603.07079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.229686Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:9d13a065ea6e20b71f5d2d087211108a4aa59b3f9b184531ed2398ab69fa2e5a","observation_id":"36264d60-5706-4ffc-bb4f-46b3862198b3","resolution":{"observed_at":"2026-08-01T00:26:20.229686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:20.302842Z","title":"arXiv preprint arXiv:2603.11137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.302842Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:f2c6cfa0ad3e5aeea3dcff8e3fac7680d6e02775cbc41ab7fd63c53309d9fc42","observation_id":"b8ea40b1-dbf9-4830-9e99-001e47010cd4","resolution":{"observed_at":"2026-08-01T00:26:20.302842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:20.375260Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.375260Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:0e44116ffde300de277e8098c8cc06e21882c2f6399c8c251108070ce1b703ee","observation_id":"632eaca8-dd22-4823-8081-9582477f93a5","resolution":{"observed_at":"2026-08-01T00:26:20.375260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01249","snapshot_observed_at":"2026-08-01T00:26:20.424327Z","title":"arXiv preprint arXiv:2606.01249 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.424327Z"},"links":{"cited_paper":"/paper/2606.01249","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:b7ab5b1d6d06f40bb916b5666643b9ad6f3711196943faef768138774cd4c11b","observation_id":"0e964ad5-61da-4ce8-aee5-a9cf713c83b8","resolution":{"observed_at":"2026-08-01T00:26:20.424327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-08T15:46:07.719139Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-01T00:26:20.532339Z","title":"arXiv preprint arXiv:2602.12275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.532339Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:c632e8f35c713dca432a0b45c8703e6ddedbfb7d2a2580114882df83055076ce","observation_id":"51a7aace-0dae-4ea7-9aee-d81e65b0b1f9","resolution":{"observed_at":"2026-08-01T00:26:20.532339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-12T11:04:06.923686Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-01T00:26:20.620682Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.620682Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:d0139ca5ad4d9277bfdcfdfc90e10e470304f34836402d0c31c78fa8f25bfe7c","observation_id":"494cfeca-5b07-415c-a35c-f22e57f58bc9","resolution":{"observed_at":"2026-08-01T00:26:20.620682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-12T23:12:20.245349Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-01T00:26:20.684529Z","title":"arXiv preprint arXiv:2601.19897 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.684529Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:9704e1b080ae1269a83e9d44483d1f5e0b78e3900edb0cbcd0d31f4f4602bad5","observation_id":"28370f0e-353e-4643-8770-11392d2ec6a7","resolution":{"observed_at":"2026-08-01T00:26:20.684529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27115","last_updated":"2026-05-26T14:52:51Z","snapshot_observed_at":"2026-08-05T07:26:13.507498Z","submitted_at":"2026-05-26T14:52:51Z","title":"Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27115","snapshot_observed_at":"2026-08-01T00:26:20.783962Z","title":"arXiv preprint arXiv:2605.27115 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.783962Z"},"links":{"cited_paper":"/paper/2605.27115","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:0ef40e0da37ddd78f23ba1589fc49595b57315af0053c2f4f5e8bd71eb61b707","observation_id":"2b7daaf2-3ecf-42ef-a436-68fdfaad4df4","resolution":{"observed_at":"2026-08-01T00:26:20.783962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-01T00:26:20.893238Z","title":"arXiv preprint arXiv:2601.20802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.893238Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:9d748619b78437dd031bf8f171ae377be765b7726bd31e1a224773b6111a0f6c","observation_id":"209dfac0-a02f-4367-86b5-db31710fbe08","resolution":{"observed_at":"2026-08-01T00:26:20.893238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-10T11:34:20.766987Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-01T00:26:20.970441Z","title":"arXiv preprint arXiv:2601.18734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:20.970441Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:7a0a8979625913ced13ade92b4c49e8ce87e8141b462179fb30ab0c2e702b4a6","observation_id":"636c4765-8586-48d5-9811-753e16541890","resolution":{"observed_at":"2026-08-01T00:26:20.970441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20244","last_updated":"2026-08-08T05:05:33Z","snapshot_observed_at":"2026-08-13T05:10:24.949051Z","submitted_at":"2026-04-22T06:46:22Z","title":"Hybrid Policy Distillation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20244","snapshot_observed_at":"2026-08-01T00:26:21.077226Z","title":"arXiv preprint arXiv:2604.20244 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.077226Z"},"links":{"cited_paper":"/paper/2604.20244","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:13eb0e46aa8913c08aac66389e1de9e2438de4bfea6916d1fa67834a19944765","observation_id":"0f27cec9-87df-4c2f-afc4-bdaf1c935fa4","resolution":{"observed_at":"2026-08-01T00:26:21.077226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-13T04:19:36.304840Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-01T00:26:21.232534Z","title":"arXiv preprint arXiv:2402.08679 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.232534Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:bb5dda1768ed720113d5a59912f9a45be362bb1cbf9e921d2f7f948a1d35c8f5","observation_id":"e76c0b05-541f-4199-9896-e5336725ddf1","resolution":{"observed_at":"2026-08-01T00:26:21.232534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-08-01T00:26:21.345094Z","title":"arXiv preprint arXiv:2607.05394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.345094Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:17d9bf07f817a6494906d8efb2001ae0006b629ef05a982bfc7650c2763729f7","observation_id":"2acfd7d2-a822-474e-a4f4-f0410f2bead1","resolution":{"observed_at":"2026-08-01T00:26:21.345094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-08-01T00:26:21.484742Z","title":"arXiv preprint arXiv:2606.11709 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.484742Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:e7f18139a95f8c5988c1b699870a4e9f754fb1c2172e342b4c1028b4176a77d2","observation_id":"18a9142f-aa88-46cb-b5be-814ee3dece4b","resolution":{"observed_at":"2026-08-01T00:26:21.484742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-01T00:26:21.560326Z","title":"arXiv preprint arXiv:2604.03128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.560326Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:8d30482b630e9e45d33e13a27246bb8024284f672b2b86f62bb3e7b4c09c16fd","observation_id":"78f458b4-ce1c-4dcb-a495-b0aa78de20cb","resolution":{"observed_at":"2026-08-01T00:26:21.560326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:21.657173Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.657173Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:00f0c04d8d858e1172e994490b1d823a32cdbc002e807893d5460c442f40fb05","observation_id":"0d2af395-005c-485c-b510-1ae3584bd838","resolution":{"observed_at":"2026-08-01T00:26:21.657173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:21.730787Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.730787Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:45fa596d7751910a5d6ef83c63f1a3ed12adcbb3afd57d2c72aa868f9fffc2ee","observation_id":"06afe223-7a1c-4bcb-8860-6598bedfd0d8","resolution":{"observed_at":"2026-08-01T00:26:21.730787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:21.839566Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.839566Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:65bf87757b457f4a96ca451ce3e0c9698104707969e3ec699c72c862726f48f5","observation_id":"c85603ec-c901-468a-b644-c5089c74f37c","resolution":{"observed_at":"2026-08-01T00:26:21.839566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:21.941002Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:21.941002Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:2934c130aed455c30742f6a79a0ff1a928d8175083ed4a0b28d90abfc772d143","observation_id":"3a33cd26-26fc-420b-ba7f-df9a03ac50b0","resolution":{"observed_at":"2026-08-01T00:26:21.941002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:22.036112Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2021 , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.036112Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:2aed349e555b9de7b35d2e02d2853cb167e117d94d96a020f1d6ae899160e01b","observation_id":"07e9f883-f5a4-431d-861a-15f32f0390ec","resolution":{"observed_at":"2026-08-01T00:26:22.036112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:22.105162Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.105162Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:74d5085aa88609d518bcd13ab089a918d29b3decbbb2a9bfd6eeebc101af7d0c","observation_id":"93ec4a7f-4515-41f3-8d9c-571389d6a9e9","resolution":{"observed_at":"2026-08-01T00:26:22.105162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:22.214321Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.214321Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:f279a67c98c5697aa897fe67313e678c725047bfe2c72b7c8cb08f2556b8a65b","observation_id":"43156568-3c94-45cc-a0bd-a5ac98e111e7","resolution":{"observed_at":"2026-08-01T00:26:22.214321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03535","last_updated":"2022-06-10T03:58:27Z","snapshot_observed_at":"2026-08-10T06:46:03.370194Z","submitted_at":"2020-06-05T16:15:46Z","title":"CoCon: A Self-Supervised Approach for Controlled Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03535","snapshot_observed_at":"2026-08-01T00:26:22.290413Z","title":"arXiv preprint arXiv:2006.03535 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.290413Z"},"links":{"cited_paper":"/paper/2006.03535","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:fa563f116a18eaf0af66185ce983383a4e1f23d0e08dc47eace3b9589a540fef","observation_id":"253f5438-7de0-4c24-990d-9fdbf66d7a7f","resolution":{"observed_at":"2026-08-01T00:26:22.290413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-01T00:26:22.360205Z","title":"arXiv preprint arXiv:1909.05858 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.360205Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:9af6ccf3f93a79627cc41c03324729baa90ceae3b2ab597e6dd5d4c8e48a085b","observation_id":"e935d567-d00c-4e21-889d-501110686e46","resolution":{"observed_at":"2026-08-01T00:26:22.360205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:22.448551Z","title":"Proceedings of the 28th International Conference on Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.448551Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:2a7b9fd0d2498801c64153d190a3252ea4c271e0e4247a58f8f739484ea5c333","observation_id":"5ee0fe25-c22e-4f53-bd3f-919500e7e411","resolution":{"observed_at":"2026-08-01T00:26:22.448551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:22.563314Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.563314Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:7b3449a83f33edc31a0c87e6c399ff40438fa76f2e303f4d0d4d97c9380fd39f","observation_id":"bb56fba7-daac-4730-8568-69fe9a3d89f2","resolution":{"observed_at":"2026-08-01T00:26:22.563314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-01T00:26:22.644318Z","title":"arXiv preprint arXiv:2606.30406 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.644318Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:deb810e4539dedc1f64e3480557a7b4a4563c20438ab89ab756b63e9db9c94ea","observation_id":"dac88f3f-3967-4195-aa21-c0bc85aeca8a","resolution":{"observed_at":"2026-08-01T00:26:22.644318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-01T00:26:22.763779Z","title":"arXiv preprint arXiv:2602.15763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.763779Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:5bf757b8fec6993cbaae56a058635760874655b611126a84aff15b36e6c53d14","observation_id":"2f99256b-e251-4b69-a2ac-3f17cd92ca48","resolution":{"observed_at":"2026-08-01T00:26:22.763779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:22.869845Z","title":"arXiv preprint arXiv:2606.19348 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:22.869845Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:9e06e7edb4d190b5832ed4cfe364b884e28888ffde64ae5370afd847cb6ebed9","observation_id":"157ed573-e4cd-4d1b-889f-721a05705655","resolution":{"observed_at":"2026-08-01T00:26:22.869845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:23.018580Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.018580Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:fd4c826c521e54cb9057ca3f360bc561209e03bd16e86730304eb3d1c1757925","observation_id":"5827e367-6e79-401a-a52b-05cd9481865a","resolution":{"observed_at":"2026-08-01T00:26:23.018580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-01T00:26:23.123274Z","title":"arXiv preprint arXiv:2311.12022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.123274Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:023484299f611a8343728d4f35333f87f424b3ae233a0101ce6d93047dc5b004","observation_id":"1c61612d-ee26-4b4a-8e00-aa7796aa28de","resolution":{"observed_at":"2026-08-01T00:26:23.123274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:23.228289Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.228289Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:730bbe38b5e53b8d809775828d78d1610662873a0454169572f3281ebd9f8340","observation_id":"b2002792-b551-48b3-bd2e-d08f571dd581","resolution":{"observed_at":"2026-08-01T00:26:23.228289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08565","last_updated":"2024-08-23T05:21:44Z","snapshot_observed_at":"2026-08-13T04:41:48.552539Z","submitted_at":"2024-01-16T18:49:55Z","title":"Tuning Language Models by Proxy","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08565","snapshot_observed_at":"2026-08-01T00:26:23.349392Z","title":"arXiv preprint arXiv:2401.08565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.349392Z"},"links":{"cited_paper":"/paper/2401.08565","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:ad62a8d218179583b95dbbd7c729ac88e24cf64beaf7dbc0b50693c3fb52c71b","observation_id":"8d2eae3d-df45-4cb0-b8b3-41f5bfc8df15","resolution":{"observed_at":"2026-08-01T00:26:23.349392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:23.485869Z","title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.485869Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:0dcbcbe44db435e389d5244402ba60e779a0583b36aa72290a6076976e54c738","observation_id":"089f2637-e4c5-4abe-8244-3183a9e4b8ef","resolution":{"observed_at":"2026-08-01T00:26:23.485869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-10T22:09:31.548080Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-08-01T00:26:23.639872Z","title":"arXiv preprint arXiv:2604.00626 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.639872Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:4ea6b763328420799c2b67bb9fe4a5cfb816581b66497f6fb6c2ce159e47e292","observation_id":"9d36fda2-fe7c-4062-a652-e9c3230f42a5","resolution":{"observed_at":"2026-08-01T00:26:23.639872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-08-13T04:30:52.071366Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-01T00:26:23.761661Z","title":"arXiv preprint arXiv:2401.17256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.761661Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:c8c5a1bd21604b1866ae4a98e1dcc66bfbfdece637b3ac2b82cb9d541314ed7c","observation_id":"47529e3a-b68b-475c-a2c1-45808eaf61f4","resolution":{"observed_at":"2026-08-01T00:26:23.761661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-13T04:00:20.980341Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-01T00:26:23.854870Z","title":"arXiv preprint arXiv:2601.02780 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.854870Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:27b2d542f8afd9dce425a16b46376361e7b86f4aa05669a1fbb2e9624885b3e9","observation_id":"758799fa-3759-42e2-924b-4af9fd0f8e79","resolution":{"observed_at":"2026-08-01T00:26:23.854870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:23.981367Z","title":"Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:23.981367Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:be2f4c7611398e4b305c4cec26bfc7fd2b4d1ae95443ab30746f263d1656de36","observation_id":"0481d0ab-0c81-4ada-a26a-0a30a6c5ed41","resolution":{"observed_at":"2026-08-01T00:26:23.981367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03109","last_updated":"2025-06-03T17:40:08Z","snapshot_observed_at":"2026-08-08T19:52:36.095174Z","submitted_at":"2025-06-03T17:40:08Z","title":"On Weak-to-Strong Generalization and f-Divergence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03109","snapshot_observed_at":"2026-08-01T00:26:24.105193Z","title":"arXiv preprint arXiv:2506.03109 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.105193Z"},"links":{"cited_paper":"/paper/2506.03109","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:79cfbc17703cfe4e7f077039dec80641fddaec19ba34aff284fa63ae0708998c","observation_id":"6c4c09e2-dd65-4459-9260-675426845d9d","resolution":{"observed_at":"2026-08-01T00:26:24.105193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06021","last_updated":"2026-06-20T15:47:56Z","snapshot_observed_at":"2026-08-12T12:02:23.148968Z","submitted_at":"2026-06-04T11:13:01Z","title":"OPRD: On-Policy Representation Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06021","snapshot_observed_at":"2026-08-01T00:26:24.196739Z","title":"arXiv preprint arXiv:2606.06021 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.196739Z"},"links":{"cited_paper":"/paper/2606.06021","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:f1a3eec482ee0eac3d4bc1f438ad66f7bc35652e8323f0214932b600f68eecdd","observation_id":"a1f25405-7ce8-4f61-bde8-9050768d3c59","resolution":{"observed_at":"2026-08-01T00:26:24.196739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:24.281183Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.281183Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:7c7caa9279344b2f4dad15de12fe3f5d692ca676d7157db93acc0f75215d0ea3","observation_id":"a09903bf-b5fe-4800-a220-d29b7586c4b5","resolution":{"observed_at":"2026-08-01T00:26:24.281183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:24.364454Z","title":"forward KL , author=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.364454Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:63a93b398e6ca1ccdb3aac8f6a2e4625031ebdcdac00097dca9813393c4c4935","observation_id":"c823c9a8-9ad6-4bfc-90ff-6d8e63403ce3","resolution":{"observed_at":"2026-08-01T00:26:24.364454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:24.506888Z","title":"Thinking Machines Lab: Connectionism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.506888Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:0e23af4ac5c82565a68b53ec49bd8c199b1030767ce0a07cf48ed12dcab41918","observation_id":"0520c4a3-0016-4277-8f82-b08a4d8420d7","resolution":{"observed_at":"2026-08-01T00:26:24.506888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-01T00:26:24.653402Z","title":"arXiv preprint arXiv:2502.01456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.653402Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:18dfacb1d289bd0d6fe350c539d72e61f2948f4551fb2eeae1ee4b4fd51b3a39","observation_id":"16c884cc-ed3e-4ddd-82b3-af3c5fff7bfc","resolution":{"observed_at":"2026-08-01T00:26:24.653402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:24.768775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.768775Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:2f140c41ea3666d5274cbc5460b00c363f923222594006db08ea5d0453822972","observation_id":"88f7e6cc-8d1e-4b30-af61-8d381d919c6b","resolution":{"observed_at":"2026-08-01T00:26:24.768775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-10T19:38:46.551479Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-01T00:26:24.869605Z","title":"arXiv preprint arXiv:2504.11456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.869605Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:4a4aaf814ca27cab65a1117eef3c2071c575a186354338313e2b4a85d778fb42","observation_id":"3c36225b-6de3-4a63-8363-09d4bb8883ad","resolution":{"observed_at":"2026-08-01T00:26:24.869605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:24.970768Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.970768Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:a49c1e07dd6b16766df44bec0207402ce1174d390eab1954942af3ccd097ee9d","observation_id":"a3545e34-3207-4116-a722-9fa81021fc4a","resolution":{"observed_at":"2026-08-01T00:26:24.970768Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-13T04:25:16.368633Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-01T00:26:25.081268Z","title":"arXiv preprint arXiv:2402.03898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.081268Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:3db43a20c8df37dc04161c4d1d020dbf9860f5440949de72f4b89e6ad4b31dea","observation_id":"8ad81f8e-c470-4db2-ab72-2650a284f41f","resolution":{"observed_at":"2026-08-01T00:26:25.081268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:25.169140Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.169140Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:11046456c1f1fce6250bedd71771feb174d65264fda692abc5082bad0c8c0272","observation_id":"4f4b306e-70d4-4ba6-b213-8a912aec2beb","resolution":{"observed_at":"2026-08-01T00:26:25.169140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:25.288499Z","title":"URL https://matharena","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.288499Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:12fc28ddf7363e6b7c3fc5ffd4af6b23a0f75ee3d53caa144e8bb4728758f793","observation_id":"8ec05144-8310-486f-87ca-4951390c544d","resolution":{"observed_at":"2026-08-01T00:26:25.288499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:25.385382Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.385382Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:62e4dea0245ee128e779da25ee2ad3f4febfa4b77bd31f0afd4163179aff51c9","observation_id":"c7007b13-9e96-4e96-8c59-eaa8731a194d","resolution":{"observed_at":"2026-08-01T00:26:25.385382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-01T00:26:25.522384Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.522384Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:736152d268d127791528d0bc677f87d2ff0ace1d221bebcaf150ef6d4f080a90","observation_id":"fc9af86c-2049-46c8-8961-415335480d90","resolution":{"observed_at":"2026-08-01T00:26:25.522384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3616385","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , url =","venue":"ACM Journal on Computing and Sustainable Societies","work_id":"d4cc41c1-2185-47e9-8948-cfb33c686997","year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.667153Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:ac16ba31cedb740a88408d1e5194e9c3773f60bb9f585f596161be7037c164e0","observation_id":"9083144a-06bf-4bbd-8be3-d5e6c2285e44","resolution":{"observed_at":"2026-08-01T00:31:07.749637Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-01T00:26:25.777254Z","title":"Sakshi and Jaehyeon Kim and Wei Ping and Rafael Valle and Dinesh Manocha and Bryan Catanzaro , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.777254Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:ba2d07d455846a607a1471131b7a8431918f6f71ca1c970f9a1e60a3b3ccec43","observation_id":"c6893a8c-bff4-45e4-9398-5ea127d52293","resolution":{"observed_at":"2026-08-01T00:26:25.777254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-01T00:26:25.893734Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.893734Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:852134fbc3b27a0900468118dec427669701d67511cc43f72f620067dd948dac","observation_id":"eb2323cc-1287-40c3-8a37-80c2e4629719","resolution":{"observed_at":"2026-08-01T00:26:25.893734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.023285Z","title":"Proceedings of the 30th ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.023285Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:ed1db48b43c6434871b2fcee0e56b33265797e7bd65e8e744cf328fcb58f70c7","observation_id":"79532ab5-4cd3-4c0d-bd19-67e062b0a829","resolution":{"observed_at":"2026-08-01T00:26:26.023285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T00:26:26.156814Z","title":"Goucher and Adam Perelman and Aditya Ramesh and Aidan Clark and AJ Ostrow and Akila Welihinda and Alan Hayes and Alec Radford and Aleksander Madry and Alex Baker","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.156814Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:80937a884e07c278a4664da290f557647a8599415c0e9553fcb200ea5e7f672f","observation_id":"eb25a9cb-433e-4cab-8feb-472ff4b34a52","resolution":{"observed_at":"2026-08-01T00:26:26.156814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T00:26:26.284433Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.284433Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:bf490868fbe2df76a0c61d9fff63a1d005e888217b50fe0765cc26d93015dcc5","observation_id":"b5180e38-2847-4134-b0f5-909d126e32f3","resolution":{"observed_at":"2026-08-01T00:26:26.284433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.410915Z","title":"Wav2CLIP: Learning Robust Audio Representations from Clip , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.410915Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:b11b6b04edb1b0f3eddd34ea6c089325de16ebbf37e658ff2dc6da7bffa0c241","observation_id":"3da63c6d-a74d-4676-b508-94c041a0e928","resolution":{"observed_at":"2026-08-01T00:26:26.410915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.473503Z","title":"Pengi: An Audio Language Model for Audio Tasks , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.473503Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:ac2f8806c58f1bd03ffba49b74d0682b50150d2f9b3e8728da4a19836e4c06df","observation_id":"5e3257b0-76a2-4728-9ec5-65a4a13295e1","resolution":{"observed_at":"2026-08-01T00:26:26.473503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.552685Z","title":"Liu and Leonid Karlinsky and James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.552685Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:6910dc7825e6c1d09ba5ad036172c16d5dab024c994628bf39e644306f65bcb5","observation_id":"b947c43a-0fcb-454a-8c9c-301e68ef6763","resolution":{"observed_at":"2026-08-01T00:26:26.552685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.585832Z","title":"Optimal Transport for Treatment Effect Estimation , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.585832Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:e547cdf52469d5dd7acf3475af1103fb187089a6423527967eb1e6970816baee","observation_id":"6e396538-fabf-40f1-81ca-84b80593d622","resolution":{"observed_at":"2026-08-01T00:26:26.585832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04145","last_updated":"2023-02-27T02:09:25Z","snapshot_observed_at":"2026-07-06T12:16:26.510937Z","submitted_at":"2021-12-08T06:52:23Z","title":"A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04145","snapshot_observed_at":"2026-08-01T00:26:26.646865Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.646865Z"},"links":{"cited_paper":"/paper/2112.04145","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:55f8ce5f8a5521317456dc72d16c956a7642f2c5c78b67d8f728f5b4e676f838","observation_id":"13963a24-32b3-43d2-8240-2305c8148ca8","resolution":{"observed_at":"2026-08-01T00:26:26.646865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.784799Z","title":"Learnable Behavior Control: Breaking Atari Human World Records via Sample-Efficient Behavior Selection , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.784799Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:070a1e16e348d84c3ebf85dbc2308e6f810bb603165d549c030aa4a0a52e125f","observation_id":"7d5a76d6-8cb4-428a-b125-2269d5616a53","resolution":{"observed_at":"2026-08-01T00:26:26.784799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:26.902413Z","title":"Generalized Data Distribution Iteration , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:26.902413Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:3a419861e48906c00ec9c62fb87455a4913b5461e502468d45616e9aee82c675","observation_id":"b78ee796-4202-4f8f-b32e-934422834d0b","resolution":{"observed_at":"2026-08-01T00:26:26.902413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06232","last_updated":"2022-01-09T12:26:35Z","snapshot_observed_at":"2026-07-06T11:18:16.145357Z","submitted_at":"2021-06-11T08:31:12Z","title":"GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06232","snapshot_observed_at":"2026-08-01T00:26:27.063018Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:27.063018Z"},"links":{"cited_paper":"/paper/2106.06232","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:6f6203b61d6ce79ad990f4bc85b21ad2bad927d4f67d7f1a87c4e781e5b3028f","observation_id":"1d5146a5-1679-4da3-a8f8-e126d4c3fccd","resolution":{"observed_at":"2026-08-01T00:26:27.063018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:26:27.202175Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:27.202175Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:f931f1bc28d23d53981fedaf2991a09b842afb3ad1cb498a50b6b4bc35b29b95","observation_id":"aa07a1eb-f80c-46bc-8e96-57f92e94889b","resolution":{"observed_at":"2026-08-01T00:26:27.202175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02925","last_updated":"2023-10-08T08:56:56Z","snapshot_observed_at":"2026-08-13T02:05:29.767846Z","submitted_at":"2023-08-05T17:33:17Z","title":"ConvFormer: Revisiting Transformer for Sequential User Modeling","version":2},"cited_work":{"arxiv_id":"2308.02925","doi":"10.48550/arxiv.2308.02925","metadata_source":"pith","pith_arxiv_id":"2308.02925","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ConvFormer: Revisiting Transformer for Sequential User Modeling","venue":"cs.AI","work_id":"4e62b0c1-0491-4338-bb55-89527a1f621a","year":2023},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:27.325656Z"},"links":{"cited_paper":"/paper/2308.02925","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:c5e6767443216b6c6afeac17aedffafaa91798798fbb181589830325d378c952","observation_id":"687fa503-d69e-4af9-bc57-3db573a602a2","resolution":{"observed_at":"2026-08-01T00:31:07.611462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00707","last_updated":"2021-06-01T18:04:19Z","snapshot_observed_at":"2026-07-06T11:14:57.172488Z","submitted_at":"2021-06-01T18:04:19Z","title":"An Entropy Regularization Free Mechanism for Policy-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00707","snapshot_observed_at":"2026-08-01T00:26:27.446030Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:27.446030Z"},"links":{"cited_paper":"/paper/2106.00707","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:d07e6ad5c47d1f7f480918c2245c1b57148fe686dfb474cb6f1bbadb6eb4c62e","observation_id":"e8c97fdf-3f00-4a8d-8e9a-aa05912b2393","resolution":{"observed_at":"2026-08-01T00:26:27.446030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2210.11039","doi":"10.48550/arxiv.2210.11039","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR , volume =","venue":"arXiv (Cornell University)","work_id":"736403a9-3318-4a8a-80ae-b47d57d335e8","year":2022},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:27.540391Z"},"links":{"citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:86df90deefa8d78552446700b9eae66046fbbf1271d21b36ec84f926cd3c8971","observation_id":"6e213f62-0170-4e5d-a5de-2178c5515c25","resolution":{"observed_at":"2026-08-01T00:31:07.518318Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":142},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 0 inbound Pith citation observations for arXiv:2607.26246."}