{"as_of":"2026-08-02T18:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acddd798323e22d97b82e693eb6ac57c818fde908e5e94820f8497a1cfa711fb","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T21:11:56.772993Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:40:42.016315Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09725","snapshot_observed_at":"2026-08-01T13:40:42.016315Z","title":"On-policy distillation with best-of-n teacher rollout selection.arXiv preprint arXiv:2605.09725, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-01T13:40:35.820857Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:42.016315Z"},"links":{"cited_paper":"/paper/2605.09725","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:b8daf5aa34becf0332cb515c7bc39497314af7e1eb25d31deb829719b0f2e874","observation_id":"38755796-b319-4f5e-9c80-a0dbf5a873ee","resolution":{"observed_at":"2026-08-01T13:40:42.016315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.09725/citation-record","integrity":"/paper/2605.09725/integrity","json":"/paper/2605.09725/citation-record.json","paper":"/paper/2605.09725"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"ffb8afde-e329-4237-9fcf-00c5774a9945","year":2024},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:bb1e13421f57580f8102c45e4ecdbb07d94d3ef871359218d9266d7dd93d11e9","observation_id":"33b5251b-b9ed-413b-b16a-015f9e4f471f","resolution":{"observed_at":"2026-05-15T12:10:34.453644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":"2505.23281","doi":"10.48550/arxiv.2505.23281","metadata_source":"pith","pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","venue":"cs.AI","work_id":"61e8d872-ccc7-46b8-8ec1-94008704c941","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:742ac9c2404c15462572c9934eab4fa7db06f034042401ed2751cd169010ce0c","observation_id":"d4b2564c-a910-452c-8048-864f85a82aa8","resolution":{"observed_at":"2026-05-15T00:10:14.938194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks","venue":null,"work_id":"c0f72f51-f3a3-462d-ae89-f6e73b4ac81e","year":2015},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:2b19413476da8aa446be95ea9d5cbfdffd8f7478b31a2361821642abc0c5ee9f","observation_id":"5d60505c-8aa4-432e-b377-3647b4a590bf","resolution":{"observed_at":"2026-05-15T12:10:34.468997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18874","last_updated":"2026-06-26T02:22:44Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:59:41Z","title":"Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting","version":3},"cited_work":{"arxiv_id":"2510.18874","doi":"10.48550/arxiv.2510.18874","metadata_source":"pith","pith_arxiv_id":"2510.18874","snapshot_observed_at":"2026-07-10T14:07:06.660787Z","title":"Retaining by doing: The role of on-policy data in mitigating forgetting","venue":"cs.LG","work_id":"f2ef0f39-618b-4eab-9b97-ab014d830155","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2510.18874","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:25e2efdda361bbc55877a0df6aabe3c26750455b03b7d1fb6fed7a9578b0f153","observation_id":"fdf8c78b-9477-4dab-b4bb-f07ffaab32fb","resolution":{"observed_at":"2026-06-29T02:14:22.491699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:018ec6ec25cdfcb06d1bcb8a917fed38a16cc945a9f1e492602c9c8c8ea2a719","observation_id":"a0f870eb-4da2-4ac0-9b55-a932063805b6","resolution":{"observed_at":"2026-05-14T21:12:58.996247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:f4bdd7d025cc4cf1cdb99b5d32a39f22ef5df7ec2e101ce0fe244b7a4beb10f9","observation_id":"be5d799d-5d2b-4562-bf22-54c2b5517c1f","resolution":{"observed_at":"2026-05-14T21:12:59.029572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.23871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:12.711972Z","title":"Hdpo: Hybrid distillation policy optimization via privileged self-distillation","venue":null,"work_id":"e40578ea-e2a1-4ab3-a681-c6ee0356fb90","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:6a8a1beff4cc604b752155cb6e5fcddb36c4a9989c392fc572403d3d5f987841","observation_id":"aaa1408b-e8ff-4a8c-b606-b54a56cde74a","resolution":{"observed_at":"2026-05-14T21:12:59.015767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"757048a1-a673-4c12-aab1-323c7fc27e15","year":2023},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:15a456765c498bcd7f9722707b4da3bccb9b959d161eb68d10084e8f4f7a76fd","observation_id":"08bafd69-3abd-41d8-b64e-2556d68ba3cc","resolution":{"observed_at":"2026-05-15T12:10:34.491279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":"2301.12726","doi":"10.48550/arxiv.2301.12726","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Specializing smaller language models towards multi-step reasoning","venue":null,"work_id":"349d1339-23c4-4611-8834-3221afbdcb91","year":2023},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:4a175b4719f95ac2f10d93cb451be591f8ba9631035e77d7f5c7c39560fa22fd","observation_id":"31ed2a02-1463-4d64-9de4-ea2aeb46c4e1","resolution":{"observed_at":"2026-05-14T21:12:58.989926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":"2603.25562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-07T12:33:45.227324Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","venue":"cs.LG","work_id":"8e059321-d6e4-4359-89eb-83ecbb93b657","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:3d8842338c3abe457de079ee9c0894eb6987786f003a3bd23abe8ab2cce9722d","observation_id":"a1000f0d-0a14-455b-ac56-1b39e35bca3e","resolution":{"observed_at":"2026-05-14T21:12:59.069513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-10T13:57:07.038585Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:c7b092a39d1923f9a856a08197cf33c03d0406a8861ba1663afe4b90fd7251c4","observation_id":"e0d94931-438d-450c-a7e5-515c4fbb9486","resolution":{"observed_at":"2026-05-14T21:12:59.054182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maybank, and Dacheng Tao","venue":null,"work_id":"51e70140-94d1-4fc9-b308-1db1690d071e","year":2021},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:66c7fc7f490df3189b2be805425dbde4084bef3fc6dd35468719f5caa1693cdb","observation_id":"eb968ee7-51d5-40eb-9385-12f68860475f","resolution":{"observed_at":"2026-05-15T12:10:34.488607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MiniLLM: Knowledge distillation of large language models","venue":null,"work_id":"3abdb6f5-9247-4af7-bc66-f631686fa5fd","year":2024},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:6d5db50fcd50b73d2d06643b69d9febe646194b5e86cb9eb0addbc5c31b52c24","observation_id":"3e47c3de-9a3a-4ba3-ad9f-aba08a3b021c","resolution":{"observed_at":"2026-05-15T12:10:34.498994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-02T14:38:48.684120Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.04178","doi":"10.48550/arxiv.2506.04178","metadata_source":"pith","pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OpenThoughts: Data Recipes for Reasoning Models","venue":"cs.LG","work_id":"c7acbe41-27a0-4773-a7be-8f08d86cdf21","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:da232ac24e6a0b863879bc5cc3e6bbc77f777938432416f82a080fab32e14e35","observation_id":"6faa0da4-2ae6-42ae-b052-dd789a0f3894","resolution":{"observed_at":"2026-05-14T21:12:59.063295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.Nature","venue":null,"work_id":"19e46ba1-c5cd-4ad9-b918-d2072ea94292","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:3bfc73e8be36f1873f3c36a6ddb85b3268b6ffb4ab6c135746c307ce0a3d3e8a","observation_id":"7321ec7c-a00b-4c42-8dd5-a7c8b2c3e62b","resolution":{"observed_at":"2026-05-15T12:10:34.518215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:33:45.146128Z","title":"Justrl: Scaling a 1.5 b llm with a simple rl recipe","venue":null,"work_id":"fae7d2ce-42fc-469f-9b46-42b5103f2013","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:902d1140c5661cad2c27b4a083e8e26772842dd1a70194943f7c5440611e4fcb","observation_id":"3c4291d1-aa3b-4f78-bf7b-5906eb689fee","resolution":{"observed_at":"2026-05-14T21:12:59.051417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:6c4c6a3031ff45cca59090d63f92ee68505839f049084bd01e652d1cc6fd62e5","observation_id":"d9a85f44-3721-4a43-809f-27cb519d4743","resolution":{"observed_at":"2026-05-14T21:12:59.060394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:7052a154a49e972ea8adb692db34adf6d6d7e1986bac76829b7a1035d3f07bda","observation_id":"fbf8e0a0-ebaf-436e-ad9c-cfe9ef495edb","resolution":{"observed_at":"2026-05-14T21:12:59.036053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07155","last_updated":"2026-07-11T08:43:13Z","snapshot_observed_at":"2026-07-16T23:17:45.652859Z","submitted_at":"2026-01-12T02:57:39Z","title":"Stable On-Policy Distillation through Adaptive Target Reformulation","version":3},"cited_work":{"arxiv_id":"2601.07155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.07155","snapshot_observed_at":"2026-07-09T00:35:48.734855Z","title":"Stable On-Policy Distillation through Adaptive Target Reformulation","venue":"cs.LG","work_id":"d26b1f29-c96d-46cf-bf68-688d16583c89","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2601.07155","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:74443e39ecbb6b824c8ef38ef7498a2756a38ebd1c1e35a0ba2f2eed6c643565","observation_id":"8f6ff3d9-e8cd-4b22-b58c-907c90dcb7b0","resolution":{"observed_at":"2026-05-14T21:12:59.026355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TinyBERT: Distilling BERT for natural language understanding","venue":null,"work_id":"3e9b879d-19a2-43ee-ab9c-48acbe44086a","year":2020},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:9684f2bb1c0265488b325a0e6f8730a2239421f29752bb808964396719266369","observation_id":"a4e6f081-93e2-47b8-adb2-c1e669a2d710","resolution":{"observed_at":"2026-05-15T12:10:34.486531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:7c3595c4d71762a24c9e93a31bbe8c6eb636649328dc1dc0c0d3ce4a9815030e","observation_id":"1ffdee76-9c32-48b7-95b0-0b7b6ac5ffe3","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":"2603.24472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-10T00:26:39.269322Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","venue":"cs.CL","work_id":"8df6a2d1-d890-48ae-af85-c11643a91097","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:19e07bfb6f87c5eb017a7ad57813a339561319686c09ce9bbc61a24bdcb66b4b","observation_id":"2bd05964-0d53-4e10-8ae4-73fb5830aced","resolution":{"observed_at":"2026-05-14T21:12:59.057387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9be87a35-2f2d-4ca6-9149-2e268d70cf36","year":2016},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:abe6e87f061eec4c5fd711f133cd9a1e305f0a11d1ce3f8f4210507e0bec256e","observation_id":"b3da5ea7-7c45-4f1e-a604-5728500af02c","resolution":{"observed_at":"2026-05-15T12:10:34.481842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:35:48.689101Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":"5e961f0b-b20e-4580-965d-15fb63ec8965","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:7add9df95e75c5eeec240d559d1e71f42df55cca3de087001062b33cbd3ae4e5","observation_id":"51353a3b-b36b-4e3e-acaa-0d792f225525","resolution":{"observed_at":"2026-05-14T21:12:59.048163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jiang, Ziju Shen, Zihan Qin, Bin Dong, Li Zhou, Yann Fleureau, Guillaume Lample, and Stanislas Polu","venue":null,"work_id":"7f4cc741-dadf-4c94-9ccd-b77902938d81","year":2024},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:7b3483198c9ec8af881ae173e42c70c938e53fd580e05a6b0f07cf77c7da58ec","observation_id":"d20c781f-ed39-442f-b7bf-9457c77d025f","resolution":{"observed_at":"2026-05-15T12:10:34.484071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":"2604.13016","doi":"10.48550/arxiv.2604.13016","metadata_source":"pith","pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","venue":"cs.LG","work_id":"42b43df0-4c82-493f-9d9b-1be8c116d9af","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:992691e701b969ee2148f1fbed77d401c590caa9b623188b7a4b2d46c1698336","observation_id":"f75542ef-3cfd-4640-a639-6fc78f2763c8","resolution":{"observed_at":"2026-05-14T21:12:59.044937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":"43780165-2138-46f4-bc90-41866fdf32cb","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:e9eb88dfe5c30ca8d8b4179affa29ff0d656d668c428921c8b2e467bb16ce8f0","observation_id":"1e2d0c86-7104-4a32-b3b8-b56511d20b44","resolution":{"observed_at":"2026-05-15T12:10:34.493756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:44333a621e3b486e3b0198229fdaf92fff7a648308ee717c619159b353a237d7","observation_id":"0f5071df-7e60-4ac8-a032-a9b875b8d573","resolution":{"observed_at":"2026-05-14T21:12:59.032791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml.20251026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:24.393084Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism","venue":null,"work_id":"bb76b11f-d59b-421e-88c6-fa0920ed09c3","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:a665a6c41da2e61346cdde9caafee6aab21a066fab86a4e800f6a630af1dad14","observation_id":"cf5de36d-b2a4-4ac3-8e58-72852845a495","resolution":{"observed_at":"2026-05-14T21:12:57.794166Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of catastrophic forgetting in large language models during continual fine-tuning.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"2d11c4f1-8c52-488e-9276-e2e4fd38e584","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:2fbc7de6e362c10ac0b2998ff77018c6cb6cd5a13093d4ad127495317dc3dcfd","observation_id":"6ecf00bc-45b2-4ce9-9923-355168d3c607","resolution":{"observed_at":"2026-05-15T12:10:34.496352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-07-10T13:57:07.005292Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:4dd44e5e4edf3514d9af493ed7d36ef741fdb5c920eb1f8d563a0fa4cfa5965b","observation_id":"46233be4-8fb6-4d81-8051-7a67a0a6c608","resolution":{"observed_at":"2026-05-14T21:12:58.999913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Privileged information distillation for language models","venue":null,"work_id":"84692414-2185-439a-bd02-17e029c6bbf0","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:53ce2a6af68e4e3fbb91d30e8ae27d377b5e9c0b925d13185f665f19bc91a221","observation_id":"7607ee17-05e6-4070-a640-f9181d7464e0","resolution":{"observed_at":"2026-05-15T12:10:34.476754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"06858220-2019-4502-9e37-2f623e20af5e","year":2011},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:a743b57af94c5e081bbe5a4d06ce91ff664e1ccdfdb8f19446fac7b095d3a501","observation_id":"af8bb8c4-2e4d-44d4-8849-77ec9b29d380","resolution":{"observed_at":"2026-05-15T12:10:34.461044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter","venue":null,"work_id":"4af58420-d556-4a03-b146-f6b969594962","year":2019},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:984864a6629e1c68947ba9dc7cfb89e53694ae963e62dbfe99c1a427e58f13b9","observation_id":"5c0db343-f418-436b-9f4a-15b2d61bc7a7","resolution":{"observed_at":"2026-05-15T12:10:34.512289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:c2cfbf7b4ae041c4b7dc240407e44d804f634cba98b9c44f5a5bba9c93826411","observation_id":"cf909211-e443-42b4-8c4b-8088f68f8a32","resolution":{"observed_at":"2026-05-14T21:12:58.981301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-07-06T22:24:04.107920Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":"2509.04259","doi":"10.48550/arxiv.2509.04259","metadata_source":"pith","pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","venue":"cs.LG","work_id":"0bbcff83-fc2f-439d-a988-e38a72205dd5","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:321ed45b9587156216f7ea8033e77ec8b6f383b4dec1d760092a365557fb9a7f","observation_id":"07b27394-78b4-476b-949b-e0364a2cffed","resolution":{"observed_at":"2026-05-17T05:03:54.455790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-10T16:57:24.571259Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:f671ff1b264d418902bdc7b2f2d143bdc0b16ee3276e5b2a9ff1b5e54f58cfe7","observation_id":"109b6a53-f35b-4f9d-b93b-e5ef755de091","resolution":{"observed_at":"2026-05-14T21:12:58.992950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":"1eb43455-3fca-46fd-951b-8f65baaf8198","year":2024},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:0d7cdf907da0d9c6b2a56a8a23f892ba282a640b247b47199b3e34382f09f038","observation_id":"23bee9d7-64e5-46b4-b0f1-a43e959297b1","resolution":{"observed_at":"2026-05-15T12:10:34.503855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.023705Z","title":"Learning by distilling context","venue":null,"work_id":"d2a54b86-31e9-4a25-858b-1c94c84c0940","year":2022},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:838624a952da45a7c94629d07f047feef0e30ac3b5bb480c7437ace6aaf3f824","observation_id":"35fd46a9-9caa-4fad-9e68-aea5ccb063f4","resolution":{"observed_at":"2026-05-15T12:10:34.471634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Christiano","venue":null,"work_id":"fef4b9d0-17f1-4fb8-8d2b-2b662f8e8727","year":2020},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:e2ddeeb5225aa2192a91781e026e0c3d0ece0d797645bc911937b75825f31131","observation_id":"bd4969d8-fc64-4f4c-90e2-922ab5535483","resolution":{"observed_at":"2026-05-15T12:10:34.515144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers.Advances in Neural Information Processing Systems, 33:5776–5788","venue":null,"work_id":"106636e2-8ed6-49c0-b570-b1a586441bb0","year":2020},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:c6ccd820b1b08616f56cb68888c87eecc2dabfc1149ef420b20c0a34550b7927","observation_id":"7afd1895-a95c-4d93-9f0d-f914aceb00af","resolution":{"observed_at":"2026-05-15T12:10:34.466058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":"a3f7cc9a-328d-4048-b587-a7bf49e43c62","year":2023},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:335476f5664d018744fb1447a497d3b5c33d32decd714c32f000f9de06bc57a2","observation_id":"ec52dde5-9128-48f3-aea1-79bf27499118","resolution":{"observed_at":"2026-05-15T12:10:34.509242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:23426710d6814c5b41fe9cd6e214621d4805dbb2fc54204cb6add425137c48c5","observation_id":"567179b8-47d0-40c6-982d-d7a19a377aa0","resolution":{"observed_at":"2026-05-14T21:12:59.042170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error bounds of imitating policies and environments.Advances in Neural Information Processing Systems, 33","venue":null,"work_id":"25938da3-729b-4ade-9554-bbeb03a66237","year":2020},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:cd7843126a40e0612bc6e6a37785cf4a06abac450fc0da8a03607f9e24746483","observation_id":"8b1e0ad3-3003-499d-a51a-b549ae43c5da","resolution":{"observed_at":"2026-05-15T12:10:34.506494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11325","last_updated":"2025-04-27T23:18:29Z","snapshot_observed_at":"2026-07-06T19:33:39.134036Z","submitted_at":"2024-10-15T06:51:25Z","title":"Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling","version":3},"cited_work":{"arxiv_id":"2410.11325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11325","snapshot_observed_at":"2026-07-07T12:33:45.177059Z","title":"Speculative knowledge distillation: Bridging the teacher-student gap through interleaved sampling","venue":"cs.CL","work_id":"ea44f5cb-864a-432c-8890-136a97a37566","year":2024},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2410.11325","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:b30869a9ff9a8df8325b6848df0ca318bba07a6f51815f0077833e495c5a57d0","observation_id":"9d52d55c-7ef5-4a13-8cf3-af8594b7e0d7","resolution":{"observed_at":"2026-05-14T21:12:59.012162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:f82a774b4aa81d4d3afcbc9c93ad399c730410a6bfe505e62e57fae35e15bcde","observation_id":"522fe48f-c223-4eea-86f3-db5da151c74c","resolution":{"observed_at":"2026-05-14T21:12:59.003858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":"2604.03128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-07T12:33:45.187943Z","title":"Self-Distilled RLVR","venue":"cs.LG","work_id":"935a34f3-b83d-4214-b6a0-ae2395b3d107","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:c26c4a1011e0ea1f47dab1991d5461d61b90edf3540401c200ee1735556f5a24","observation_id":"e7f76d52-484f-42dc-9cb6-152434a7aa1c","resolution":{"observed_at":"2026-05-14T21:12:59.019206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":"2602.12125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-09T00:35:48.740330Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","venue":"cs.LG","work_id":"bb968107-1f43-4bf4-aa52-cc58000a6e89","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:a74ceaada817cf0f6c39f815741fa934664d8e4a5b24aebeaeac04e72623d203","observation_id":"46470e9e-6002-4ca9-9e4f-cb5869d8ab62","resolution":{"observed_at":"2026-05-16T05:11:07.754859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black-box on-policy distillation of large language models","venue":null,"work_id":"aeb03416-be21-492f-8c8f-27c426e056d0","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:2927600496dcd06f129b7bc6dd4cb9853648624566d20abbda8a06865b0bf803","observation_id":"228aa3df-a52e-41bb-abb0-c269f54eb743","resolution":{"observed_at":"2026-05-15T12:10:34.458443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":"2602.12275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-10T00:26:39.252472Z","title":"On-Policy Context Distillation for Language Models","venue":"cs.CL","work_id":"b56a7e15-d864-43f4-9212-59bc7ec70d21","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:2c235fa7746a81e0e75efe0563a19a1374afb763b990fe6168c3ec2a8770f9aa","observation_id":"3fad5a0f-d677-486c-93ef-2e516987934e","resolution":{"observed_at":"2026-05-14T21:12:58.986825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:502513e5ece4c8a4f1e2b46278bb7a9a762c2dafa117b60c98e8f38d59e1bee5","observation_id":"e72c8497-b433-41bd-9236-9e8949d68498","resolution":{"observed_at":"2026-05-14T21:12:58.984096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"STaR: Bootstrapping reasoning with reasoning.Advances in Neural Information Processing Systems","venue":null,"work_id":"f954406c-1dc2-42c7-bf33-723f9bec5d4a","year":2022},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:29dfd6e991c55bd36ee97fe7a2163f182be139ad7c9be55eb08a6d80adcde35d","observation_id":"48e88f44-d4e1-4f9b-84a7-b152916b69a1","resolution":{"observed_at":"2026-05-15T12:10:34.463431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards the law of capacity gap in distilling language models","venue":null,"work_id":"8704170d-5d6b-48e6-bf3f-88ed0f11d305","year":2025},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:a2600b0311c111b13be2cffb193b4739c1e86d8c1c4fb91cffa3006aedc80a0b","observation_id":"1673e108-308c-4548-9848-f1474f88a042","resolution":{"observed_at":"2026-05-15T12:10:34.479575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:65ac0c167e01498301e03664349b0437874bc005bd23b855674ee3d07d4e02a1","observation_id":"20edf877-2e00-4854-9165-80666f074963","resolution":{"observed_at":"2026-05-14T21:12:59.072341Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c3cf387f-77b6-46b1-9499-721dc9216ed1","year":null},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:5681d09d6d8bcf94f02071c5beae96d01e13c41eafdc61a3f8ac18a93bc42dcb","observation_id":"2b944b22-8b4b-47a3-8d5a-25b1309cd2b8","resolution":{"observed_at":"2026-05-15T12:10:34.521046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"04db992a-4f6b-4795-b886-75ee6074bd7e","year":null},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:db9a0193e4151361ff7e2e37b917a675442ac52c36ec816c242c3501d36f90b5","observation_id":"f50da723-c575-4651-b6ef-065fbe0cf00a","resolution":{"observed_at":"2026-05-15T12:10:34.501406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d6bb88fd-37e1-4f1d-8c84-7221cf9f4e7e","year":null},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:6c5e6613665b73a3ed0a6f0ed38215cee88e4347663fa323e2d795780819b1bb","observation_id":"8c1777fe-d217-43b6-bae1-4ce9d2543397","resolution":{"observed_at":"2026-05-15T12:10:34.474296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75a6bddd-b42e-472b-a7c9-820e7b7ab6f7","year":null},"citing_paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T21:11:56.772993Z"},"links":{"citing_paper":"/paper/2605.09725"},"observation_digest":"sha256:16085b93777a7a3767b161de956b5ae77cdac7fdf2dd89bebfdf0fc7e75b570e","observation_id":"2c76b486-ae0a-4391-8799-059784ea2247","resolution":{"observed_at":"2026-05-15T12:10:34.455957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09725","last_updated":"2026-05-13T03:08:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T09:07:09.437344Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":28,"verified_fuzzy":22},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2605.09725."}