{"as_of":"2026-08-18T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b77e72d188d96256427328f6dac5227221cf74a8a7f4f913780bf8abb296b034","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:31:40.978324Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08764/citation-record","integrity":"/paper/2608.08764/integrity","json":"/paper/2608.08764/citation-record.json","paper":"/paper/2608.08764"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-14T04:31:40.893421Z","title":"Fu, Y .; Huang, H.; Jiang, K.; Liu, J.; Jiang, Z.; Zhu, Y .; and Zhao, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.893421Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:860c371099a8c85295358072e303740affa21171e594faa3fa06ecd649f0e5a4","observation_id":"bbc3693d-ac26-4f0a-b217-c4088ef02f59","resolution":{"observed_at":"2026-08-14T04:31:40.893421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-14T04:31:40.913039Z","title":"Jia, N.; Yang, H.; Ma, X.; Lian, J.; Zhang, S.; Zhang, W.; Zeng, K.; Cai, X.; and Sun, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.913039Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:e5de3816f05e1ed041f7644b5f6de9740b1dcbc609f1cd8ac64e9300515aa5af","observation_id":"a9eec759-0224-4efe-a5f5-79d6cf0d0e7d","resolution":{"observed_at":"2026-08-14T04:31:40.913039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-08-16T19:17:49.212702Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06387","snapshot_observed_at":"2026-08-14T04:31:40.917409Z","title":"Jin, Y .; Wang, Y .; Fu, L.; Xiao, Y .; Luo, Y .; Liu, H.; Prakash, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.917409Z"},"links":{"cited_paper":"/paper/2605.06387","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:36015dfb7efc92b05ed36c6089b77198860626fa641ccf36828a7accaef0a3fd","observation_id":"fa17ce90-6107-463f-8b99-06de3dd671f3","resolution":{"observed_at":"2026-08-14T04:31:40.917409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-08-13T06:21:09.710371Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-08-14T04:31:40.921666Z","title":"Ko, J.; Kim, S.; Chen, T.; and Yun, S.-Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.921666Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:b04cb392695c5b919eef4345b1e3d7a8535c7b8d57cdedc4460d0fed7c1d121b","observation_id":"268847bd-388d-4ac4-94f9-051cea0e1ddd","resolution":{"observed_at":"2026-08-14T04:31:40.921666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-16T14:21:03.535260Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-14T04:31:40.926096Z","title":"arXiv preprint arXiv:2402.03898","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.926096Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:934e5f99a290180a47ffb3885416f81aea4af35a902e7fa5502cb70fdab36c4e","observation_id":"9dc29fc1-97b6-4435-9476-34db50f38de4","resolution":{"observed_at":"2026-08-14T04:31:40.926096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-14T04:31:40.934410Z","title":"Press, O.; Zhang, M.; Min, S.; Schmidt, L.; Smith, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.934410Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:9e6984caf4895587cbc11137b95fe178399d96c2712cfe35fb80bff2c01a3b8a","observation_id":"5d0201ab-a43f-49dd-9762-5644e0729f83","resolution":{"observed_at":"2026-08-14T04:31:40.934410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-14T04:31:40.942530Z","title":"Ross, S.; Gordon, G.; and Bagnell, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.942530Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:cde87308a46bbdb45208733750d7c457058e5e025113871909d9d0fca6aaa16d","observation_id":"4a0a7d45-0028-4ae4-b3f9-85f33a0685eb","resolution":{"observed_at":"2026-08-14T04:31:40.942530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-14T04:31:40.946297Z","title":"Shen, G.; Cheng, X.; Zhao, C.; Huang, L.; Li, J.; Zhao, D.; and Yu, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.946297Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:af6778f6c6200f26c24ed5dcef491d37d06a31a0b8fd74d3931d752d7c30167b","observation_id":"95a03d18-c17c-4b11-8b7e-5ef7014ed2f8","resolution":{"observed_at":"2026-08-14T04:31:40.946297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:31:40.950141Z","title":"arXiv preprint arXiv:2602.20574","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.950141Z"},"links":{"citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:abe2619e970bc77d88f7c02bf126025ff234c2c93d5f7b75eb50300c8f505ef5","observation_id":"3718fcaf-3c77-4ba9-9e94-d4b1c4bd9cbd","resolution":{"observed_at":"2026-08-14T04:31:40.950141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11178","last_updated":"2026-04-09T18:32:18Z","snapshot_observed_at":"2026-08-17T07:42:01.719668Z","submitted_at":"2026-03-11T18:00:05Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11178","snapshot_observed_at":"2026-08-14T04:31:40.953793Z","title":"Xu, Y .; Sang, H.; Zhou, Z.; He, R.; and Wang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.953793Z"},"links":{"cited_paper":"/paper/2603.11178","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:9dc138e9fd229ce8454054aaf124a55edb97c0b8ed9e36f1c38dfc60efa43155","observation_id":"590da225-31ed-49f2-9a8f-67cbe11f1903","resolution":{"observed_at":"2026-08-14T04:31:40.953793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-14T04:31:40.957549Z","title":"Yang, C.; Qin, C.; Si, Q.; Chen, M.; Gu, N.; Yao, D.; Lin, Z.; Wang, W.; Wang, J.; and Duan, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.957549Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:6757057c7a75770490dfb99d9c472a3f27dfc77cd6d41ceb450c90f0ebbfb085","observation_id":"cd62bf11-6b5e-4479-bd97-dc5121eb6fc4","resolution":{"observed_at":"2026-08-14T04:31:40.957549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-14T04:31:40.962082Z","title":"Ye, T.; Dong, L.; Wu, X.; Huang, S.; and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.962082Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:86ac7d4decc6d202c332731af398190cfb32656dd52d381457f638a6e6699c2b","observation_id":"15f8995b-6e2c-4e50-b804-8984e7d8a593","resolution":{"observed_at":"2026-08-14T04:31:40.962082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-13T16:28:18.700523Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-14T04:31:40.965980Z","title":"Yu, W.; Li, X.; Zhao, Y .; Liu, X.; Zhang, R.; Wang, H.; Luo, Y .; Wu, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.965980Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:158d053199185a927e3d90c267d4c382ee10e6e0c820ce995cb82daec4534e98","observation_id":"71732ff7-32f2-43d4-899a-98146d2e9603","resolution":{"observed_at":"2026-08-14T04:31:40.965980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-11T13:23:10.571972Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12652","snapshot_observed_at":"2026-08-14T04:31:40.969905Z","title":"Zhao, S.; Xie, Z.; Liu, M.; Huang, J.; Pang, G.; Chen, F.; and Grover, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.969905Z"},"links":{"cited_paper":"/paper/2605.12652","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:e4f2dc65a246d42b91315f4d1f139180373836e9b102835f3fc3ae2ce2181840","observation_id":"32a8d406-ca36-45cf-b120-8231effb7cd4","resolution":{"observed_at":"2026-08-14T04:31:40.969905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-14T04:31:40.974049Z","title":"Zheng, B.; Ma, X.; Liang, Y .; Ruan, J.; Fu, X.; Lin, K.; Zhu, B.; Zeng, K.; and Cai, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.974049Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:95211e709d3b4dbeb0f62fe10303bb31710805db24d2218a526851d4c405f7aa","observation_id":"44442b6a-9581-4299-9fb8-7788d0591050","resolution":{"observed_at":"2026-08-14T04:31:40.974049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-14T18:05:40.907227Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-14T04:31:40.978324Z","title":"Zuo, Y .; Zhang, K.; Sheng, L.; Qu, S.; Cui, G.; Zhu, X.; Li, H.; Long, X.; Hua, E.; Qi, B.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.978324Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:274c045d841888cdb3e16b019a2db9710bf3bcd8ae90200fd400ef2823ee1e2e","observation_id":"20003c9d-fca1-40f7-950f-319f121b8e79","resolution":{"observed_at":"2026-08-14T04:31:40.978324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-14T04:31:40.908467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.908467Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:a3efb7a1f8a9edfdd5e8e83b487b371acdb4c10ffc17c53210bdfeb371c679ac","observation_id":"953d7c51-62cd-4021-891c-c70fa83d153f","resolution":{"observed_at":"2026-08-14T04:31:40.908467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-14T04:31:40.930257Z","title":"Penaloza, E.; Vattikonda, D.; Gontier, N.; Lacoste, A.; Charlin, L.; and Caccia, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.930257Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:c7bcddaae44a720b45df318d60c801995863c69350618cd3c437cb00bb72d456","observation_id":"a6c24abb-978b-49d9-9c97-3a3325795f36","resolution":{"observed_at":"2026-08-14T04:31:40.930257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:31:41.265239Z","title":"InFindings of the Association for Computational Linguistics: EMNLP 2023, 5687–5711","venue":null,"work_id":"2d8e5521-74f6-4a70-a15d-d586fe7dfb8b","year":2023},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.938535Z"},"links":{"citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:8f934b7e18c0f16ba97220bcc5ea7f3d76808fb1563efa5b18378ecc2e4eb217","observation_id":"4c33c231-9f9d-49f4-b758-e1bc832e81cf","resolution":{"observed_at":"2026-08-14T04:31:41.270942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:31:41.279342Z","title":"InInternational Conference on Learn- ing Representations, volume 2024, 21246–21263","venue":null,"work_id":"8f0a4a2d-1296-4914-bfdf-2bfdbe6c81f3","year":2024},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.888392Z"},"links":{"citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:d1cb2c1c4a59ec00d5a9d3b4e34c726daa217b49de7b33d7c5745533c0e3bfae","observation_id":"33d8db9a-da57-456a-a43f-2c4dda5b33f8","resolution":{"observed_at":"2026-08-14T04:31:41.283534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-17T02:17:22.510859Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-14T04:31:40.903633Z","title":"Guo, J.; Sun, H.; Zhang, W.; Fan, X.; and Zhang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.903633Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:fe0320f78cde266fe6185bfb18f8e5f79564350aee6835b317e8e0d101f19b78","observation_id":"c4ebc4a7-3eb0-4167-83fb-f072da754b68","resolution":{"observed_at":"2026-08-14T04:31:40.903633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-14T04:31:40.898325Z","title":"Gu, Y .; Dong, L.; Wei, F.; and Huang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.898325Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:4ecf3ea9e27290078f0502b8a50fbdcdeba614cfc590228bca998def64f90168","observation_id":"c723d0dc-7693-4866-8e27-24a711f934ce","resolution":{"observed_at":"2026-08-14T04:31:40.898325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T21:56:08.327930Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2608.08764."}