{"as_of":"2026-08-15T22:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0414714ea493863573c83e59c4ea9f5dec423030889587b6d5b0e383ce4cc59","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:38:13.138616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:42:33.800620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":"2605.21606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-07T11:42:33.800620Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","venue":"cs.LG","work_id":"46b8ff35-4a75-451e-857f-4aaa8afb54db","year":2026},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T22:38:39.405040Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:32.520327Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:fe4a60489d2cfe79cc1427b3bd6bffd55f015acbe00345ef263863be3f630de4","observation_id":"5061a2e3-591a-4f50-b92d-a1d213c2eee7","resolution":{"observed_at":"2026-08-07T11:42:33.823181Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-15T14:38:13.138616Z","title":"arXiv preprint arXiv:2605.21606 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T22:38:39.405040Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.138616Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:8b0f1e4202e65edd89d6ca24951f6c23e5cd59febb3e6bf8c0d390af675610fe","observation_id":"658e2172-3811-4392-90c3-fc95df007c96","resolution":{"observed_at":"2026-08-15T14:38:13.138616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-14T04:33:46.012744Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08726","last_updated":"2026-08-09T14:20:12Z","snapshot_observed_at":"2026-08-15T04:48:08.344276Z","submitted_at":"2026-08-09T14:20:12Z","title":"PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:33:46.012744Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.08726"},"observation_digest":"sha256:da52fae252a960d1fbed68b180bb7fedd6692f956abb37719524e024969f3d7e","observation_id":"78962215-ea98-4859-997c-c87618b30e5f","resolution":{"observed_at":"2026-08-14T04:33:46.012744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-11T21:15:10.320052Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning.arXiv preprint arXiv:2605.21606,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.320052Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:68db1459c3bb173c49ba9fc24173bfdc0d2ce4e5af613431ca925dcbdfa3d650","observation_id":"93641fc3-d8f0-4cfa-92af-d7a1daac6cae","resolution":{"observed_at":"2026-08-11T21:15:10.320052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-11T11:37:45.789954Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.789954Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:4fab7f3f1b7410f8cb8d43bcbd3affd8b656ea65bfd28e650945685b365a80df","observation_id":"4d54da7a-fdd5-47db-851e-8a444ce38a9f","resolution":{"observed_at":"2026-08-11T11:37:45.789954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-12T14:39:46.133085Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.133085Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:ba27de3b96edc2ca923f5d5f813bb9f501aac178e5b0e45d785d4e5906e81e46","observation_id":"1f5625a7-c50f-4681-b4f2-681ab274df17","resolution":{"observed_at":"2026-08-12T14:39:46.133085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.21606/citation-record","integrity":"/paper/2605.21606/integrity","json":"/paper/2605.21606/citation-record.json","paper":"/paper/2605.21606"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-14T23:15:54.149500Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":"2306.13649","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-07-09T21:06:34.855301Z","title":"Yoshua Bengio, Jérôme Louradour, Ronan Collobert, and Jason Weston","venue":"cs.LG","work_id":"78b7a553-fd43-4995-b559-e95779797d3f","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:e45bda3942930c1865c2c9f5e7683450fdddacd47c49b0bc7326f9b8bd252bdd","observation_id":"e1b00854-c997-4f6d-8041-4e60a132fe5c","resolution":{"observed_at":"2026-05-22T09:26:20.558363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0071c381ac0eaa5beae043096191ce46f7167a0adf9a4b0ec394b4752e569d61","observation_id":"e9fc52a0-cbc3-44a6-b223-884d58d2d376","resolution":{"observed_at":"2026-05-22T09:26:20.675333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:d6c2216d6050ceee5a6bc4b6bce1fc829067c2a9c9630bb6bbf551c91a707587","observation_id":"084288b1-51c7-4bf5-83ce-1eb6c32e3436","resolution":{"observed_at":"2026-05-22T09:26:20.690907Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-11T13:24:32.272927Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":"2605.00674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-07-10T09:37:00.861422Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","venue":"cs.CL","work_id":"a302077a-ac03-4988-adce-c84a57db5425","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:4cae5f291d4323aecd3f2d629485740135749573cf4413f0ab4a3c58fad77b55","observation_id":"e45f07d4-d25b-426d-b98e-77a914080a57","resolution":{"observed_at":"2026-05-22T09:26:20.670596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02142","last_updated":"2016-10-04T16:50:26Z","snapshot_observed_at":"2026-08-14T22:45:32.724093Z","submitted_at":"2015-06-06T12:30:43Z","title":"Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning","version":6},"cited_work":{"arxiv_id":"1506.02142","doi":"10.48550/arxiv.1506.02142","metadata_source":"pith","pith_arxiv_id":"1506.02142","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning","venue":"stat.ML","work_id":"c73cadf6-1d84-47d1-8731-c654db78aee6","year":2015},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1506.02142","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:1071d948667c709d23ac8fdfb4cac3aae0119e4fd4badd4119d0801c21d17888","observation_id":"dac29bf1-2efb-49da-acf6-e100d904aaab","resolution":{"observed_at":"2026-05-22T09:26:20.612385Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:38:06.250866+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T06:38:06.250866+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-13T16:04:46.474244Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":"2306.08543","doi":"10.48550/arxiv.2306.08543","metadata_source":"pith","pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","venue":"cs.CL","work_id":"16edb291-dd18-41c5-8486-c6c715ec5311","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:ca4e2bda083c48fb6efe1933a26be7a6a70171e47e964a394b87adc3f1fb3043","observation_id":"397d10ba-79d2-4991-8df9-fe25b7e49aff","resolution":{"observed_at":"2026-05-22T09:26:20.635842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-12T18:39:37.539896Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":"2305.15717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-07-04T05:09:36.906364Z","title":"The False Promise of Imitating Proprietary LLMs","venue":"cs.CL","work_id":"f843d86a-7fd6-4b0d-bf8b-f1ad3fbc3f04","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:d5298c461422255f6d8d3c6eae394fbccca060cb05be480dc344f045291db93c","observation_id":"d00f2d7d-1451-4e7b-9f5c-43cf45b8ef17","resolution":{"observed_at":"2026-05-22T09:26:20.626055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-15T05:34:45.227001Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.04178","doi":"10.48550/arxiv.2506.04178","metadata_source":"pith","pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenThoughts: Data Recipes for Reasoning Models","venue":"cs.LG","work_id":"c7acbe41-27a0-4773-a7be-8f08d86cdf21","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:aa5b3792ddab144652e1eadb08535934c04bcf8289ea519a36db62a4bf828c80","observation_id":"168463f7-bac6-45b2-b23c-623b824da29e","resolution":{"observed_at":"2026-05-22T09:26:20.645826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:e2277dbd176b02c203109c3c4436ba69e48d0c5d55dc21589bd58f07c2ee70af","observation_id":"3b46e933-62bc-4b56-a674-9aaa3ffb1f1b","resolution":{"observed_at":"2026-05-22T09:26:20.120857Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:3994d0f1f19de3bd404537e26a8fd21c55602911977f09693c16cb06b682b7d1","observation_id":"224fe98b-bbe1-456f-bdd3-08947226e1cd","resolution":{"observed_at":"2026-05-22T09:26:20.650300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:c116163bed233b46c339ffaedf42bdbc906bf5bb822df77a2ef2dbbe4489ce33","observation_id":"6a7b88eb-fdab-41d0-8b6e-02777a670fe7","resolution":{"observed_at":"2026-05-22T09:26:20.680236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"180e4370-b552-4f39-894c-275430a87867","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:01f0becfbc4c8fcd3c14c070ae2f121b4d17a76929a3afa71b9c54a0bd555c9e","observation_id":"c37475fa-6569-4cf5-93d8-e53b7d8685ec","resolution":{"observed_at":"2026-05-22T09:26:21.014670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:2dc0fd8cdd69bb44b97e87c587d81433eb927eb40a5fd01c6926f0461a26039e","observation_id":"d2262f10-4819-4e5f-9040-e1360fbc0213","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:06:34.861145Z","title":"EMNLP 2025 (Oral)","venue":null,"work_id":"0b1eccee-481d-4561-8532-6dac9ed128da","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:25f08cf3f68224848a71a24cb04d4ba02a565c37f1ce6ecb3a2c5884e50386d7","observation_id":"203165bf-4adb-4c09-b9a8-6b4f7379d937","resolution":{"observed_at":"2026-05-22T09:26:20.603339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.07947","last_updated":"2016-09-22T01:17:12Z","snapshot_observed_at":"2026-08-14T21:51:10.458695Z","submitted_at":"2016-06-25T18:16:39Z","title":"Sequence-Level Knowledge Distillation","version":4},"cited_work":{"arxiv_id":"1606.07947","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.07947","snapshot_observed_at":"2026-07-04T17:40:00.736680Z","title":"Sequence-Level Knowledge Distillation","venue":"cs.CL","work_id":"81f47e08-b2fa-4722-9fab-dd97260b9002","year":2016},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1606.07947","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:175813b802c25957f010ec8d917d5ec751fd5b86256efcc61ef3f2ed29dd571c","observation_id":"3d9f19e2-0fb2-4c23-82d1-1e5dad80bbf8","resolution":{"observed_at":"2026-05-22T09:26:20.621419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-14T16:35:56.358724Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:18a581b306985e412bc38cbc55bafd6bbfe3adbda159afbe2454a0b194684f64","observation_id":"04227a4c-c5b2-412b-8eed-1fc2e91a6002","resolution":{"observed_at":"2026-05-22T09:26:20.581767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:35:48.689101Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":"5e961f0b-b20e-4580-965d-15fb63ec8965","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:b9d8cbc45ca51468b08caf75913de614b048c522ce9f99c3632a6ac7d1950dcb","observation_id":"9fddc1c8-0b74-4b04-a0fc-a0219e7497ad","resolution":{"observed_at":"2026-05-22T09:26:20.587894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:8402a17f4ea731cb1188dc73db9ed9d8c0bceb15e0513b29be4610fb1873c455","observation_id":"ccdd2310-86f0-4a47-a25e-e61b8922d932","resolution":{"observed_at":"2026-05-22T09:26:20.608066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:e3a8d9675621c18da094b906fc9b1fee69f40981f631efc07a1f4f4761f122cf","observation_id":"ecc40842-d050-42fe-b177-11204271031e","resolution":{"observed_at":"2026-05-22T09:26:20.655101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10501","last_updated":"2018-11-29T23:42:18Z","snapshot_observed_at":"2026-08-14T19:41:05.737672Z","submitted_at":"2018-02-28T16:06:19Z","title":"Predictive Uncertainty Estimation via Prior Networks","version":4},"cited_work":{"arxiv_id":"1802.10501","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.10501","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Predictive Uncertainty Estimation via Prior Networks","venue":"stat.ML","work_id":"a4bbbe04-21d9-4ab4-bf54-d0f33c59a631","year":2018},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1802.10501","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:47b6a67bed72e589563a9f31ae061193c851be3f9e0a3371fbc1039197c5091f","observation_id":"a56c2cd3-2102-4cb4-8f09-f626d15e2645","resolution":{"observed_at":"2026-05-22T09:26:20.665253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:2af01a0433a68fbdbfa9f0b74a74c6c3d4dba8dc5dfdd37ea4ece82806b8b533","observation_id":"d71dc866-8bcc-4891-a612-20525bf47952","resolution":{"observed_at":"2026-05-22T09:26:20.640717Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":"1912.01703","doi":"10.1109/92.335012","metadata_source":"pith","pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","venue":"cs.LG","work_id":"c30b6d2c-7bb4-4ab0-8ef8-2015313610a9","year":2019},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:803a380e2ea4e873c455008226ed72e1593c0b0e3f04949f99124689345dea73","observation_id":"ac4ea3e4-f23d-4854-9f20-39b6c8dc4ba2","resolution":{"observed_at":"2026-05-22T09:26:20.575338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1011.0686","last_updated":"2011-03-16T18:51:21Z","snapshot_observed_at":"2026-08-15T05:04:07.152443Z","submitted_at":"2010-11-02T17:55:55Z","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning","version":3},"cited_work":{"arxiv_id":"1011.0686","doi":"10.48550/arxiv.1011.0686","metadata_source":"pith","pith_arxiv_id":"1011.0686","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning","venue":"cs.LG","work_id":"73c02b0d-67bb-4f1e-900f-0241ff680534","year":2010},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1011.0686","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:83f37f9d1ce7eef8f27808a25f23ec82ff13f0f481c15f6ed07adbb333956d4e","observation_id":"f4579156-58ab-4351-9302-ea3c8fe35ef8","resolution":{"observed_at":"2026-05-22T09:26:20.631095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:01458e50285177d340938be5af0abd7162a90062a91826bc8e993e70b5028e4f","observation_id":"f0d3af37-0312-4451-b81d-26208eafa069","resolution":{"observed_at":"2026-05-22T09:26:20.569518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0c28ccd997a29a7a7f92990495ed054d39035952853e0294a1b412d4b0237906","observation_id":"98bcffc1-55b8-42bb-9c07-82fc5369f7fb","resolution":{"observed_at":"2026-05-22T09:26:20.563416Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15190","last_updated":"2023-07-27T20:39:06Z","snapshot_observed_at":"2026-08-13T10:45:53.268384Z","submitted_at":"2023-07-27T20:39:06Z","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","version":1},"cited_work":{"arxiv_id":"2307.15190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.15190","snapshot_observed_at":"2026-07-07T12:33:45.185387Z","title":"f-divergence minimization for sequence-level knowledge distillation.ArXiv, abs/2307.15190","venue":"cs.CL","work_id":"8584197a-8520-4989-baa0-929e4caf14a3","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2307.15190","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:54ee69f41e4106001a09017a3d810301580b4ff58621f6b7993bb56db3260b75","observation_id":"045b2994-a9b6-499b-a0d2-ebb8b8588c31","resolution":{"observed_at":"2026-05-22T09:26:20.660266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"46699579-9f31-4d7b-a61a-dcdc2a135181","year":2020},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:9460c56d6e44ba25a664fd78758a4df36d4dd1b36f2405678412f99506ded504","observation_id":"33934696-fb15-45da-9f2a-131f6d1f7fc4","resolution":{"observed_at":"2026-05-22T09:26:21.011444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-demos.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.046980Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations","work_id":"801601a0-1077-41ef-a947-ba81c0b7510f","year":2020},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:79cd23ee475bde840fabd9bac30cfcb872282a77aa6206b82ce406e3eb63965e","observation_id":"8ffb5dd0-9f32-4c74-bd7d-9d47220fe44b","resolution":{"observed_at":"2026-05-22T09:26:20.138447Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:48.412582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:48.412582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02657","last_updated":"2024-12-08T13:03:38Z","snapshot_observed_at":"2026-08-13T00:38:33.059372Z","submitted_at":"2024-04-03T11:40:17Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2404.02657","doi":"10.48550/arxiv.2404.02657","metadata_source":"pith","pith_arxiv_id":"2404.02657","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","venue":"cs.CL","work_id":"f39252a9-05e1-4512-8bd8-115180edf521","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2404.02657","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0fdd1583aaf1c8dcd5a2143069132d3b889b567cda885da0fc111fb5b2ecd4c8","observation_id":"60698539-fa86-44a7-9110-f704c6dfb277","resolution":{"observed_at":"2026-05-22T09:26:20.593154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:5566af1c9245d4a35de19c8a025e4503fdd46ea035c861d7fe626323f2578ef0","observation_id":"8634e864-6ec2-4ec1-a76c-44ed1be157fb","resolution":{"observed_at":"2026-05-22T09:26:20.616866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:1829353525e6f6f9bc8f9f333ed8c0c1c485919b514aee861732d85903c5fd0f","observation_id":"4c014472-8633-4e6b-a59f-28aed88e4919","resolution":{"observed_at":"2026-05-22T09:26:20.685869Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teacher” and “student","venue":null,"work_id":"f83c10f6-0dc0-43ff-9450-45498186d591","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:bcc8349c9e6b5403de93b85b905b6debbbf9ca7b5f8011b1b13714a9ecabdb06","observation_id":"26085573-124e-433a-a483-b1dc61ca8963","resolution":{"observed_at":"2026-05-22T09:26:21.031456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Problem attrition.Phase A samples 24 MATH-500, 30 AIME 2024, and 30 AIME 2025 problems (84 total)","venue":null,"work_id":"9aa698e4-6969-44a9-8cdb-d8c52feb251c","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:b0a6db4302d442fbdc8f4e5097251efbb35dd304fdbea308d257f7a613b0947a","observation_id":"cf33928e-d7ea-417a-a2c2-b6f8581ecb63","resolution":{"observed_at":"2026-05-22T09:26:21.039069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85619fe1-4f77-42ec-8906-1c5285f507f1","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:ac01f43f6acbda8b4cdd520d9fb1cf44a9d649f7ba07c56f9c6dd17c233d6067","observation_id":"9ea63ed9-cf64-45dd-a3da-e34fdd07da8f","resolution":{"observed_at":"2026-05-22T09:26:21.050522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2711ec6d-7998-44a5-b1ef-4c1eba290f35","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:b624568465d1f58c21f31603c396e2137516048d184a9e784575d462577be02d","observation_id":"5268a8c5-0d45-4927-9691-746f18d2d27a","resolution":{"observed_at":"2026-05-22T09:26:21.024626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Methods are compared on the same gap","venue":null,"work_id":"a337a5be-337b-4cee-bc3b-f167d692c1f8","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:70ba9c7382716f411714800878961a9aae396696be8533197b04a655df7667da","observation_id":"e6f477f6-82e0-49f8-afb3-6be669255dff","resolution":{"observed_at":"2026-05-22T09:26:21.028091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All methods are evaluated at the 100-step checkpoint, following the OPSD evaluation horizon of Zhao et al","venue":null,"work_id":"43624861-695f-4166-bf72-9793ab79d33d","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:ab419751edb063a4787261ff94658b4b774ee53d028267920214c8e499b7a1c5","observation_id":"877bed36-b084-4b01-b4a7-5b9d9508f425","resolution":{"observed_at":"2026-05-22T09:26:21.042595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For each method–benchmark pair we run three random evaluation seeds (main, 1","venue":null,"work_id":"a50f11f7-77fa-45d3-a11a-1c89b1e65932","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:8e530976164322b88f8e4c92ed9ae3fac87ea899d865a5dcc00ce9d8050d7a98","observation_id":"326b8426-dd98-4a0c-a4b1-421dc6370eb3","resolution":{"observed_at":"2026-05-22T09:26:21.018189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4d9d9aba-8899-4445-8827-aaf39309c0ca","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:f5e99e254e2bdf4c65972ff7a51ba04aaa31428147f3a651edc01841170304f5","observation_id":"aa84a4d6-9ba4-4edb-a5fe-fb2ee45f668e","resolution":{"observed_at":"2026-05-22T09:26:21.021480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"per-sequence) by positioning (none vs","venue":null,"work_id":"a552750e-d4f8-42e9-8c3a-7a9fb601f08b","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:148e622e660132fcbbdd332542b68ab051dfbeb261566c537c56dc2a80d2ef03","observation_id":"3a1b1817-8ffd-4417-91b4-3785aee3cbe9","resolution":{"observed_at":"2026-05-22T09:26:21.034808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The two axes are complementary on AIME 2024 rather than independently sufficient","venue":null,"work_id":"ff0fa2c6-27c6-4ee3-9158-ecd65af5102b","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:aaa93978508c271094e96cd4c221c75a33dbb4c5e4ea2ed12858713b13879bd0","observation_id":"718e2ca2-5601-409b-9580-a8f10c4dfade","resolution":{"observed_at":"2026-05-22T09:26:21.046767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":14,"parse_uncertain":0,"unresolved":4,"verified_exact":15,"verified_fuzzy":8},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 6 inbound Pith citation observations for arXiv:2605.21606."}