{"as_of":"2026-08-15T22:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:153fa1eecf6dc66d24aaa426163ddb4234dff0481821be751ee8ea488ab3fa99","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:38:13.296565Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06243/citation-record","integrity":"/paper/2608.06243/integrity","json":"/paper/2608.06243/citation-record.json","paper":"/paper/2608.06243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.106699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.106699Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:69ef96fdc786ae019db90fe12428deafda44c30353bcfa7ad488a8942ee97145","observation_id":"f4219dd4-1dc8-48ae-a32d-8e59cf97dc34","resolution":{"observed_at":"2026-08-15T14:38:13.106699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.112655Z","title":"2025 , doi =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.112655Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:32c804d42cbaa7c77b3bac16a7b02b5834cb7f8212c7ebf19b46019ec97d9bdd","observation_id":"726d5435-1ecd-4f66-8769-a2242d3f5264","resolution":{"observed_at":"2026-08-15T14:38:13.112655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.116032Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.116032Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:91b0decd5b918ee7c75589e60db6e517c9f938315e82a01ba37b7a7a9ea8d6b5","observation_id":"eda955a7-ecd4-4746-9535-02c278dd2022","resolution":{"observed_at":"2026-08-15T14:38:13.116032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.119605Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.119605Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:6a8ff12dd03f758dfa25e85f614cca45a109f8cb2103dfe6dc3793a83b35936e","observation_id":"35218719-cf3c-48af-84a0-7bf1d25e9e91","resolution":{"observed_at":"2026-08-15T14:38:13.119605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.123104Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.123104Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:df2633a640b96606649d9e7560407476f9b6346285ec548b012c74e1f570decf","observation_id":"77be2d5b-91d3-4f50-af29-38a046dded11","resolution":{"observed_at":"2026-08-15T14:38:13.123104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-14T23:15:54.149500Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-15T14:38:13.126568Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.126568Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:7922e6b78ede41047bac10e30cb4c3324d212306a3fbb8b276028e1840f08dc4","observation_id":"4aa4d116-78de-46fd-8b3b-50f1884c3425","resolution":{"observed_at":"2026-08-15T14:38:13.126568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-15T14:38:13.130376Z","title":"arXiv preprint arXiv:2601.18734 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.130376Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:ca8663c53287b50c26b7942510773256c2e4b71a7527c923e87493d5caf10e7b","observation_id":"a3d96e27-24ea-4989-a382-7cebde7f76b4","resolution":{"observed_at":"2026-08-15T14:38:13.130376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-15T14:38:13.133996Z","title":"arXiv preprint arXiv:2603.07079 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.133996Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:ac98d4a9a7d4a50fdaf54cb9045ccc7d51ce05710cf6f5dd2e21a8abcb68d28a","observation_id":"3496a0ea-259d-4abf-8081-293c11409170","resolution":{"observed_at":"2026-08-15T14:38:13.133996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-15T14:38:13.138616Z","title":"arXiv preprint arXiv:2605.21606 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.138616Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:ceb24673fc080f23355bb1a26449b7917c5a75c196b0eaba76db56768dbfb8f6","observation_id":"658e2172-3811-4392-90c3-fc95df007c96","resolution":{"observed_at":"2026-08-15T14:38:13.138616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22600","last_updated":"2026-06-26T02:45:32Z","snapshot_observed_at":"2026-08-08T07:09:29.965305Z","submitted_at":"2026-06-21T17:20:21Z","title":"On the Position Bias of On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22600","snapshot_observed_at":"2026-08-15T14:38:13.143580Z","title":"arXiv preprint arXiv:2606.22600 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.143580Z"},"links":{"cited_paper":"/paper/2606.22600","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:944ba3a4c257141242cf9d39423d73fd154b2933426bfc831b4f8bcd322d095c","observation_id":"b1d36558-4772-43ab-a2c1-95bc733479a7","resolution":{"observed_at":"2026-08-15T14:38:13.143580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30833","last_updated":"2026-05-29T04:39:20Z","snapshot_observed_at":"2026-08-09T18:50:24.647346Z","submitted_at":"2026-05-29T04:39:20Z","title":"Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30833","snapshot_observed_at":"2026-08-15T14:38:13.148001Z","title":"arXiv preprint arXiv:2605.30833 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.148001Z"},"links":{"cited_paper":"/paper/2605.30833","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:24d295088e80be439f9acbf580a7b556056fc9f40433a5befec862e9504dd33b","observation_id":"65004d52-a603-482a-8250-49eb9f656b22","resolution":{"observed_at":"2026-08-15T14:38:13.148001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.152075Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.152075Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:46d4453a14bb0046a18880d4087b02c34b47942f7f713e4d082860dfc98e0e4f","observation_id":"b8f8facd-2fb7-4aa1-9442-792adc2bb604","resolution":{"observed_at":"2026-08-15T14:38:13.152075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.155967Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.155967Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:500afaaa46d39fb8512c12f0f85e06d5594cfc183101aa1dac41e245ab8a51cf","observation_id":"1486c8b0-c60f-423b-b72d-96011c922606","resolution":{"observed_at":"2026-08-15T14:38:13.155967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.159977Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.159977Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:ecd3626a7db17778c7825a1b75e110dd88d6a66e3b3726fb697c7de9e9c8a35f","observation_id":"707e60fc-85eb-40d6-8cf2-3be294fd1c8c","resolution":{"observed_at":"2026-08-15T14:38:13.159977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.164056Z","title":"Purified","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.164056Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:21dc2020d5a6ac91903d0f3d9c17dd9a9b37c9abadc88c3ae3be6e0e74c5d1c6","observation_id":"18d30972-ef0d-46dc-986c-1014289d4d7f","resolution":{"observed_at":"2026-08-15T14:38:13.164056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.167823Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.167823Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:40c9cccf0198cf90a2f55e25b81d8158ccedacbbe70dc233a06df4bb0f96fc42","observation_id":"799d723b-8736-4285-a3a5-546de5330d24","resolution":{"observed_at":"2026-08-15T14:38:13.167823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.171465Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.171465Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:195174804f9d8046f25c54b664b7298ddb13886c5465781fcf02a59917042701","observation_id":"e5570b07-990d-4a48-85d0-6965be7c2fb2","resolution":{"observed_at":"2026-08-15T14:38:13.171465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.175594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.175594Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:4eafbca824063b64f8e16f45719e066433955e685d54c0dbe2cf95f164074ecd","observation_id":"a463fb26-6db5-4f4b-8b61-2a110149adc1","resolution":{"observed_at":"2026-08-15T14:38:13.175594Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.179253Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.179253Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:30d2a6497c9319cb8e7d9fa67282195ba976aa44acf998eee3b32834d7ededde","observation_id":"d8e611ed-ac46-4b1d-a7b4-d2322e8cd760","resolution":{"observed_at":"2026-08-15T14:38:13.179253Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.182936Z","title":"and Liu, Alisa and Dziri, Nouha and Lyu, Shane and Gu, Yuling and Malik, Saumya and Graf, Victoria and Hwang, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.182936Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:a93b2a979674c3312fccbdff150dc669ada58627b2ac80fbcda7a784351dfbef","observation_id":"1673e8b1-bf0e-469c-9678-1629ef476dbe","resolution":{"observed_at":"2026-08-15T14:38:13.182936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.186410Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.186410Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:ad4b6b8050da63281ec18aad4a1c32af158b0e86c52f10490e8ef0d804d21a35","observation_id":"70769e61-e37a-41f5-be4c-86b17454c191","resolution":{"observed_at":"2026-08-15T14:38:13.186410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.189982Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.189982Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:53b17f30372b79ae0ef29a5182287494a9d83da29d018ab810cdb23cd1f9b160","observation_id":"c0d0ca39-527d-4c4f-b579-af30d59a96cf","resolution":{"observed_at":"2026-08-15T14:38:13.189982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T14:38:13.193577Z","title":"arXiv preprint arXiv:1707.06347 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.193577Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:dbda8928d7b383c2d4daf5933451b1fe65143159df348dedbd045ca220f12c9d","observation_id":"e021e681-8e98-4066-a4bd-602d2adb5631","resolution":{"observed_at":"2026-08-15T14:38:13.193577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.197421Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.197421Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:bf19b1cd4338ec514b836e75878f25281120a2aa3fc94dea1f9aace9db8d15cd","observation_id":"35ef7025-daf5-410b-9df5-b12d96148eb5","resolution":{"observed_at":"2026-08-15T14:38:13.197421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.201026Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.201026Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:f8535ab8f32810f43ba05f3b740aeeb7d3db0e04de124c9b99cd86bb0f124708","observation_id":"8c4fa34c-b90c-4ec8-8dda-a5b5ec07bbf2","resolution":{"observed_at":"2026-08-15T14:38:13.201026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T14:38:13.205106Z","title":"arXiv preprint arXiv:2110.14168 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.205106Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:b060262875f40c617c7c73d88261e20ded4e455191c9560580ef7f9c98be31b5","observation_id":"38eb1fa2-53bb-40ea-b757-be4a789de237","resolution":{"observed_at":"2026-08-15T14:38:13.205106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.208929Z","title":"Measuring Mathematical Problem Solving with the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.208929Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:30db191c3175be2c4af24c5c1aab0446f65e34c9cc5f14adc375bcfd3fd6a93c","observation_id":"2e230541-cadb-4756-9b70-d2c741a229b6","resolution":{"observed_at":"2026-08-15T14:38:13.208929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T14:38:13.213714Z","title":"arXiv preprint arXiv:2107.03374 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.213714Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:451fb8d07b64919fe9a4aca4642668d7f8b10cb3fe90f13661052a459af50af5","observation_id":"1af62569-06fb-4acd-8790-49d4c7f075c3","resolution":{"observed_at":"2026-08-15T14:38:13.213714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.217919Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.217919Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:d2f4ef2e67cb21b2c47123f213016270b3ddd368d8df82846c4dfdea3452f4ec","observation_id":"9e9f466b-31ca-452a-bddb-66650b598c04","resolution":{"observed_at":"2026-08-15T14:38:13.217919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.222227Z","title":", booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.222227Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:06befa989d767f9ee04f086cb2cede9a1791fbfc5979fe55fa0c6c835fde3183","observation_id":"449bc022-0803-4ee7-a5f8-0853ac5c1422","resolution":{"observed_at":"2026-08-15T14:38:13.222227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-15T14:38:13.226014Z","title":"arXiv preprint arXiv:2211.14275 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.226014Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:1c210bd0fb9c2980c2723761f81007ed70ad979b84544918e85cc534a0240777","observation_id":"9402f2e0-8cfe-4004-bd22-d54e179147fc","resolution":{"observed_at":"2026-08-15T14:38:13.226014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.229462Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.229462Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:bcb1955f728ca010b065fc3dfc100e97f4bfb18595fa12372682fdb855e5ad5c","observation_id":"cf01f4ab-af70-47fd-999c-d4e52b0ae2fd","resolution":{"observed_at":"2026-08-15T14:38:13.229462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.232686Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.232686Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:f785271217847a81a617136c9f81ac0dbfc5a4f549f9b380425be744a9d7c9e8","observation_id":"0b3253d8-0166-4546-93b5-3bddc95a8dac","resolution":{"observed_at":"2026-08-15T14:38:13.232686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.237285Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.237285Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:f273706a9c0fc92e48e7ea9e93e89d17751690b040fcea8ad6960c8774751411","observation_id":"053bdf03-8ec8-4c7a-9bcc-f397aa2347a0","resolution":{"observed_at":"2026-08-15T14:38:13.237285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.241163Z","title":"Machine Learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.241163Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:5c08020ba0ef8ed5d3a7fbf3aaca320b14ecbdffe8d33a7b8554e859bf7219c7","observation_id":"dfba234b-9852-4766-93de-bdd7310f3e7e","resolution":{"observed_at":"2026-08-15T14:38:13.241163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.244783Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.244783Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:24b6627f539ecbcb8c122ae03cce4836fd6b17393776610f9bb499ae10680aec","observation_id":"0c6fdf8c-64b4-40e2-a061-c0651c902dd1","resolution":{"observed_at":"2026-08-15T14:38:13.244783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.248531Z","title":"Machine Learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.248531Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:871e4bd910a22091417ea2e4c9005f18067d038c8e7a3f0f67b7d1c76e855ed4","observation_id":"15552ae1-12b0-43bf-bdb1-155e39000a17","resolution":{"observed_at":"2026-08-15T14:38:13.248531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.252229Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.252229Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:7c11ffef542052d41b190d8880f6d9c9ae1a5d11ac0ed60dcc1016e97ef671a5","observation_id":"c2daa83c-01a0-4451-bf9e-cb6bf2d32177","resolution":{"observed_at":"2026-08-15T14:38:13.252229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T14:38:13.255795Z","title":"arXiv preprint arXiv:1503.02531 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.255795Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:78fa2bc52d0d64372f5d0deee9e9bb73259f3cf02184d04eca031a1844994206","observation_id":"f720ca1a-1281-41e2-90e7-3871528697f9","resolution":{"observed_at":"2026-08-15T14:38:13.255795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.259231Z","title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.259231Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:f173d909b5d8d18026ca4ab4670c54d006b29a7206fa5a81d9f9981afa4ed551","observation_id":"6227b58b-9615-42d4-819c-f3e6439ce9cd","resolution":{"observed_at":"2026-08-15T14:38:13.259231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.262599Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.262599Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:8b464fab9c026f5d661a0938136c8daed3d54c4436ffb832122ab80060a87f5a","observation_id":"65642262-2d28-4179-b206-d993d7c2a956","resolution":{"observed_at":"2026-08-15T14:38:13.262599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.266232Z","title":"Proceedings of the International Conference on Artificial Intelligence and Statistics , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.266232Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:af362dff19f3bdafc2b1c5d1434ebecf181b41aca53e7e1cf8a0397be0fd170f","observation_id":"70374d51-c51e-4658-ab42-99885ab85a10","resolution":{"observed_at":"2026-08-15T14:38:13.266232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.269547Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.269547Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:90c9aac1feae256fe080a7671af9120fcab85ff52c078db2253fbb268634f857","observation_id":"9874e403-50a8-4014-aac4-aa1940815ee4","resolution":{"observed_at":"2026-08-15T14:38:13.269547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.273289Z","title":"Neural Networks , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.273289Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:30203b598bff2ccfd8dba03b94931108b0e887395a4b62815e2137758de2b190","observation_id":"071c1af5-d5ed-495a-869f-c18f20be8eb3","resolution":{"observed_at":"2026-08-15T14:38:13.273289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.277474Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.277474Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:9e506e60f4331218ba3fbe8c4d7c213943a9213ab69be27b5a1e3d9a86f92284","observation_id":"4671c1ef-63a1-4416-9fd9-f645f8167aa9","resolution":{"observed_at":"2026-08-15T14:38:13.277474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.281431Z","title":"Robotics: Science and Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.281431Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:ebdfc77d2a1c345de3bd86069943dcd3dde0705d4026914c37ef79e722cfd206","observation_id":"8587597b-2499-4693-acd1-2be192138a50","resolution":{"observed_at":"2026-08-15T14:38:13.281431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.285395Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.285395Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:346bdb493c246069ba9601ed7c0590915620e304adbf178a236a56a5643104a3","observation_id":"42419323-f0a6-4535-b20a-e3e7d48fd639","resolution":{"observed_at":"2026-08-15T14:38:13.285395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.289386Z","title":"Neural Computation , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.289386Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:c3869066a6d243d9332cd085f9b776ed49be25419e7ed373d9344013f26fed38","observation_id":"bd24587f-f8b2-4f33-9e31-5baaa52f35f3","resolution":{"observed_at":"2026-08-15T14:38:13.289386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:38:13.292577Z","title":"Learning Phrase Representations Using","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.292577Z"},"links":{"citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:aeef1725ac2225d72a77f3768d49a2ac93b85f8c15f9ee8b5eddcfd0cfc0d798","observation_id":"39876256-6633-4d30-9909-20d932053f00","resolution":{"observed_at":"2026-08-15T14:38:13.292577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20643","last_updated":"2026-05-20T03:06:36Z","snapshot_observed_at":"2026-08-03T05:02:30.649585Z","submitted_at":"2026-05-20T03:06:36Z","title":"AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20643","snapshot_observed_at":"2026-08-15T14:38:13.296565Z","title":"arXiv preprint arXiv:2605.20643 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.296565Z"},"links":{"cited_paper":"/paper/2605.20643","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:c65e5cf9e0124b13e5ecceea889065c623af3a6f513af9993bc307afe244a632","observation_id":"ad4b5534-944b-4956-a8e7-9dce4e4c1a7d","resolution":{"observed_at":"2026-08-15T14:38:13.296565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T14:32:00.858600Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2608.06243."}