{"as_of":"2026-08-08T04:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6b6920ccc965914565a1986790457c64675ac24d23b20147855c2e1eaf1f66a","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:19:43.839213Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06296/citation-record","integrity":"/paper/2608.06296/integrity","json":"/paper/2608.06296/citation-record.json","paper":"/paper/2608.06296"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-07T10:19:41.326448Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.326448Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:56e55dad88e709fb730377dbd06b8bed33ae168482ee2e1efc3002ac3ef9b87e","observation_id":"f9d279ec-09f0-4ddb-9790-a4860180521e","resolution":{"observed_at":"2026-08-07T10:19:41.326448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-07T10:19:41.411447Z","title":"Etash Guha, Ryan Marten, Sedrick Keh, Negin Raoof, Georgios Smyrnis, Hritik Bansal, Marianna Nezhurina, Jean Mercat, Trung Vu, Zayne Sprague, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.411447Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:0d7f42baacc2b9da185f7304d42bed2455bb9b2063f15164fa84f1dad8bf8164","observation_id":"1b7637fa-51c4-4807-a2f1-43ef153e9df6","resolution":{"observed_at":"2026-08-07T10:19:41.411447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-07T10:19:41.444364Z","title":"URL https://arxiv.org/abs/2506.04178","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.444364Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:b40f8aa32485ed0de29fee11b5d591bb0b52afdb3da1fbfd3fcc4cde8ad92d30","observation_id":"f9cb2373-0e40-4d27-8f14-1197802d626e","resolution":{"observed_at":"2026-08-07T10:19:41.444364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-07-06T14:08:26.493996Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-07T10:19:41.572940Z","title":"Large language models can self-improve.arXiv preprint arXiv:2210.11610,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.572940Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:329168332802ba0798a6f259dc44da99e0c55d9d44ffc0b0974217c7aa4adb8d","observation_id":"df86c3a3-12bb-4391-b060-2bf05ce0c6dc","resolution":{"observed_at":"2026-08-07T10:19:41.572940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-08-07T10:19:41.728357Z","title":"Aditya Prakash, Josiah Hester, Jindong Wang, and Srijan Kumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.728357Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:53dec79d455dcf47ea783815f82810478379af5e85d05a530b077c7d28996992","observation_id":"a710c963-c998-47cc-9513-7d4135445f1a","resolution":{"observed_at":"2026-08-07T10:19:41.728357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13255","snapshot_observed_at":"2026-08-07T10:19:41.784586Z","title":"Respecting self-uncertainty in on-policy self-distillation for efficient LLM reasoning.arXiv preprint arXiv:2605.13255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.784586Z"},"links":{"cited_paper":"/paper/2605.13255","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:3c07fd305bd817e8ef9a52c2bee9b50b9cc7537913accebb76121d3e12b51f65","observation_id":"ae2517a6-bafe-45a7-9921-e2a36b8ff6e1","resolution":{"observed_at":"2026-08-07T10:19:41.784586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-07T22:39:15.110117Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-07T10:19:41.827630Z","title":"press/v267/ko25a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.827630Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:5e046b2cd0e8017a007ed1ef883b4dfef4a0a3576ae35f40d19515fc7187f7db","observation_id":"f2c04ddc-ed22-4a6b-8056-4cdb81fed65e","resolution":{"observed_at":"2026-08-07T10:19:41.827630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.13929","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:44.873558Z","title":"Self-evolving visual questioner.arXiv preprint arXiv:2606.13929,","venue":null,"work_id":"8e31beac-21e2-40b7-bf11-ad318ed892b0","year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.853544Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:61b20d113386398e08bf05135699ecdbc555a617c274d06d764d1a71697a8430","observation_id":"d1caa6be-f65c-45c2-a1a6-d0a3c4949e81","resolution":{"observed_at":"2026-08-07T10:19:44.930747Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:41.914010Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning.arXiv preprint arXiv:2506.24119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.914010Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:ada6df19991fe850484e87d0369487c0c45573bb95a6476f0f511e02bd45fac1","observation_id":"cce98735-534e-4d7b-bec6-723f40a9ff5b","resolution":{"observed_at":"2026-08-07T10:19:41.914010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11559","last_updated":"2026-06-10T01:35:34Z","snapshot_observed_at":"2026-08-07T08:00:31.756918Z","submitted_at":"2026-06-10T01:35:34Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","version":1},"cited_work":{"arxiv_id":"2606.11559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11559","snapshot_observed_at":"2026-08-07T10:19:44.532912Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","venue":"cs.AI","work_id":"62263c6a-1666-4fc1-acec-6cdbb7901f76","year":2026},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.961817Z"},"links":{"cited_paper":"/paper/2606.11559","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:7aa7c5388afe6190fe88ceb0efeb2bf866b386aec143de0c699365886c562183","observation_id":"dbbaa0a1-f975-4e45-b0a9-8fad67c2f673","resolution":{"observed_at":"2026-08-07T10:19:44.623767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:42.025433Z","title":"URL https://thinkingmachines.ai/ blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.025433Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:640ef55a916838e53150cb17c1f344914bbd09ef8dd40a839817c291aa2cce2f","observation_id":"5409db2d-a287-478d-9367-4c9e5523aa91","resolution":{"observed_at":"2026-08-07T10:19:42.025433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-07T10:19:42.100814Z","title":"Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste, Laurent Charlin, and Massimo Caccia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.100814Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:34f815b6876a5df4ee4dddec4683785ba0892400b67f6c0e5cb3a7bfb5f26edb","observation_id":"5ddeec39-3bf7-488d-a025-b484ce551768","resolution":{"observed_at":"2026-08-07T10:19:42.100814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-07T12:59:59.342982Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-07T10:19:42.170600Z","title":"Maximizing confidence alone improves reasoning.arXiv preprint arXiv:2505.22660,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.170600Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:c92a3b2fbe54c2d1f22859bea6718bfa8d53d5fbaec0e3a41f33443e20a4788a","observation_id":"fdd5552c-0f46-4046-b580-ea0c1db55611","resolution":{"observed_at":"2026-08-07T10:19:42.170600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04109","last_updated":"2025-07-06T18:16:47Z","snapshot_observed_at":"2026-07-06T19:46:15.364468Z","submitted_at":"2024-11-06T18:36:22Z","title":"Self-Consistency Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04109","snapshot_observed_at":"2026-08-07T10:19:42.234006Z","title":"Self-consistency preference optimization.arXiv preprint arXiv:2411.04109,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.234006Z"},"links":{"cited_paper":"/paper/2411.04109","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:6edb126a285e9ec9634583fbc6a56fd5acc4294adf3f4454084dea2d0e93ee6c","observation_id":"4caa0439-287f-4296-bd16-6aa4e452b899","resolution":{"observed_at":"2026-08-07T10:19:42.234006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-07-15T14:32:24.776402Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-08-07T10:19:42.294503Z","title":"CRISP: Compressed reasoning via iterative self-policy distillation.arXiv preprint arXiv:2603.05433, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.294503Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:03a09755895760cc2ff737f47ab59315b8c4f4f7238bf9ed31fab36232ae33d3","observation_id":"7b608f62-0f24-4183-bf92-ecf1227a2398","resolution":{"observed_at":"2026-08-07T10:19:42.294503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:19:42.384243Z","title":"Deepseek- math: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.384243Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:edf9403c51f71d4e285dda90e0983087af98c36e5acf54dfc73c3caade678902","observation_id":"21f116ed-e599-4564-8d34-7d621f60020a","resolution":{"observed_at":"2026-08-07T10:19:42.384243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-07T10:19:42.449663Z","title":"Self-distillation enables continual learning.arXiv preprint arXiv:2601.19897, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.449663Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:3a090a643864a14461c7cd5668ec487d56924c661bc84fb90b453a88798a5b35","observation_id":"a9f0db98-ed67-46b7-8b0d-98bb297156c5","resolution":{"observed_at":"2026-08-07T10:19:42.449663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-07T10:19:42.513853Z","title":"Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, and Kam-Fai Wong","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.513853Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:473ca63a6b9e4c237f147e7255b31e977c1b6a703b0e606fe915d7a3bae9ea61","observation_id":"d2ee794e-11d1-41ac-a219-3fda760934a1","resolution":{"observed_at":"2026-08-07T10:19:42.513853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13399","last_updated":"2026-07-15T02:52:37Z","snapshot_observed_at":"2026-08-06T12:04:36.871552Z","submitted_at":"2026-07-15T02:52:37Z","title":"Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations","version":1},"cited_work":{"arxiv_id":"2607.13399","doi":"10.48550/arxiv.2607.13399","metadata_source":"pith","pith_arxiv_id":"2607.13399","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations","venue":"cs.CL","work_id":"be01684d-9d09-4bf9-a762-62c5f159091f","year":2026},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.587810Z"},"links":{"cited_paper":"/paper/2607.13399","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:238e6561bdfdcb66e1f83a0dc2be226129c64025804a39cd1b066e765f17763a","observation_id":"2154647d-37e0-44a8-9cd8-93e4ab1e3cd2","resolution":{"observed_at":"2026-08-07T10:19:44.047486Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01754","last_updated":"2025-03-19T18:35:44Z","snapshot_observed_at":"2026-08-07T17:32:58.635348Z","submitted_at":"2025-03-03T17:24:42Z","title":"SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01754","snapshot_observed_at":"2026-08-07T10:19:42.700966Z","title":"ISBN 979-8-89176-288-6","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.700966Z"},"links":{"cited_paper":"/paper/2503.01754","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:67ea1ed2a4fabf0e06b5a010e86f7ed6178604c879f0900ec51f09a23e04404e","observation_id":"84d0f8aa-9ec0-4549-9c80-977a7ede8044","resolution":{"observed_at":"2026-08-07T10:19:42.700966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-07T10:19:42.801108Z","title":"Lightning OPD: Efficient post-training for large reasoning models with offline on-policy distillation.arXiv preprint arXiv:2604.13010,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.801108Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:618f71500877f7ef1b6e8c6e2ba66d424886fceafadc549ccfce50228aa8724b","observation_id":"97b0ba77-58c6-42f0-9eea-bfb789c67920","resolution":{"observed_at":"2026-08-07T10:19:42.801108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-07T10:19:42.927212Z","title":"URLhttps://arxiv.org/abs/2604.13010","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.927212Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:485207c2b9afb93e1b90f031cbca3c2ed6d016d4bd97f1c0fa5543a50fc533f2","observation_id":"e5f4537e-e154-4c97-a652-cdf41624b582","resolution":{"observed_at":"2026-08-07T10:19:42.927212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T10:19:43.007032Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.007032Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:95e4cd0274244dd5c37709a0031ed546d4ab908eecfc67916d03348deed60e8f","observation_id":"2c84e049-02db-4bd7-b671-bc8815b22c4f","resolution":{"observed_at":"2026-08-07T10:19:43.007032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00123","last_updated":"2018-12-01T02:08:38Z","snapshot_observed_at":"2026-07-06T07:18:22.588053Z","submitted_at":"2018-12-01T02:08:38Z","title":"Snapshot Distillation: Teacher-Student Optimization in One Generation","version":1},"cited_work":{"arxiv_id":"1812.00123","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.00123","snapshot_observed_at":"2026-08-07T10:19:44.242281Z","title":"Snapshot Distillation: Teacher-Student Optimization in One Generation","venue":"cs.CV","work_id":"c6b1c83c-c734-46e5-83b7-4acfb20c32fb","year":2018},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.092889Z"},"links":{"cited_paper":"/paper/1812.00123","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:5cc983bd82e1284057c4a058198308b32bcec5a35c75e5d8ad0ecde7877aac8d","observation_id":"87977f5a-2953-48d6-aa83-22770c97d75b","resolution":{"observed_at":"2026-08-07T10:19:44.305382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-07T10:19:43.250443Z","title":"On-policy context distillation for language models.arXiv preprint arXiv:2602.12275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.250443Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:8ff1fe8b5931edf976523ae36125b42e959094e3e18ce3f87d9ff85e2e22f81d","observation_id":"cbaaed0d-6c3f-47f9-810d-868cc4bead47","resolution":{"observed_at":"2026-08-07T10:19:43.250443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-07T10:19:43.347186Z","title":"net/forum?id=T2TZ0RY4Zk","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.347186Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:41e65062107bdda7a5e5953eaf94070279484167c80edb2baf556b2a5a97db7a","observation_id":"bd14b0e8-7f9d-484b-841f-0b74a17ba5de","resolution":{"observed_at":"2026-08-07T10:19:43.347186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-05T03:08:42.211484Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-07T10:19:43.516621Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.516621Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:886374c3d2387cbd5625fea960409637f1d19a48b725b7b3c67f18791e9a06e0","observation_id":"e37b18b6-0199-485d-863f-ee6df588524a","resolution":{"observed_at":"2026-08-07T10:19:43.516621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-07T10:19:43.698887Z","title":"Absolute zero: Reinforced self-play reasoning with zero data.arXiv preprint arXiv:2505.03335, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.698887Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:1ca5a73e0b4f810e03b392a1127350df072728243bfdc214403cf417a6ee4fe7","observation_id":"5f69390f-b506-483a-9d7d-9f611a7600fd","resolution":{"observed_at":"2026-08-07T10:19:43.698887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-07T10:19:43.764127Z","title":"Learning to reason without external rewards.arXiv preprint arXiv:2505.19590, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.764127Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:b0a4b706e4031d677a5ce03bf074d06eeb8643d2359e34b67feedbea5b604c0f","observation_id":"08631336-b861-4564-ab57-28cf45aba4d4","resolution":{"observed_at":"2026-08-07T10:19:43.764127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:45.188510Z","title":"pub.” denotes the numbers published in the official OPSD repository; “ours","venue":null,"work_id":"74a46e82-4bab-48c9-bc0c-a730cd6bcbb3","year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.839213Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:7f9518977333d9879e044ec830f0285db0864582f9e0deedffa76056ccabd88b","observation_id":"3acd0707-5d9d-425b-82d2-f8b27eb2a3fd","resolution":{"observed_at":"2026-08-07T10:19:45.236912Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-07T10:19:43.157443Z","title":"Self-distilled RLVR.arXiv preprint arXiv:2604.03128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.157443Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:9c4d4f7a43658a8ef63723d6ea5ae00f890b3f8876f9a0b4812cf8dafddbd91f","observation_id":"ceacb47f-efeb-4c0c-8e6a-932ff0750eef","resolution":{"observed_at":"2026-08-07T10:19:43.157443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-07T10:19:43.621441Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.621441Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:2474f03b5843f8ca640be949cdb0de4fdac720f9e0e1b361423ba4d9cc5025b8","observation_id":"9cfbb828-d21e-44c6-8a5b-d32ece739d6f","resolution":{"observed_at":"2026-08-07T10:19:43.621441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-07T10:19:41.490605Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.490605Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:a3b1897de57626633128b280d0775b89642645da3e5061e4de5d0da579fe144a","observation_id":"125cc2a1-4970-4931-8111-eb1d3c01d637","resolution":{"observed_at":"2026-08-07T10:19:41.490605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-07T10:19:41.667277Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.667277Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:1ac52acaa7f304f80142ca5c9dc8cd1d6a309631296a9386661e8885cffbad80","observation_id":"8b6d3f6b-7b5d-4a83-afb4-79b6cf5f0262","resolution":{"observed_at":"2026-08-07T10:19:41.667277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T10:19:43.431632Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.431632Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:4c21dc3d03d126ed04b46a7ba08e302d37c862fb46f1216f8cf8a479200b6bdc","observation_id":"2a38042b-66e7-4535-a4a0-aa0bd7eafc88","resolution":{"observed_at":"2026-08-07T10:19:43.431632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:19:41.249543Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.249543Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:7f8e56cacb4ec16e82a64e8949316898bc0c551227f9d045462d6e7281e20ff2","observation_id":"49934ccb-49e9-4533-8497-46dfbd014348","resolution":{"observed_at":"2026-08-07T10:19:41.249543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:41.277301Z","title":"Serl: Self-play reinforcement learning for large language models with limited data.arXiv preprint arXiv:2505.20347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.277301Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:d9f718e831e2a014dffe1a40a43c6a1bc689982803c4cf3fc9fa816bf331e3c9","observation_id":"2a5413ea-f2e3-4e93-a015-1e7d2c3215b6","resolution":{"observed_at":"2026-08-07T10:19:41.277301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-07T10:19:41.381899Z","title":"URL https://arxiv.org/abs/ 2603.25562","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.381899Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:b8d3b9347f8e2c2b3ad13058f57cf4018a9d24ae32bcf73cfaf8383128a426dc","observation_id":"2faf3dfb-1cba-4f8b-8eeb-6600154c7a29","resolution":{"observed_at":"2026-08-07T10:19:41.381899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T04:16:26.323427Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.06296."}