{"as_of":"2026-08-04T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a34baa40ad231cf6a5fdcdb16c727a938a44b0d007fa1274410fd2c0f2dc4b5","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T16:22:46.913172Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:40:41.757803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T16:28:38.434907Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":"2605.05040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-07-03T16:28:38.434907Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","venue":"cs.LG","work_id":"c6ccbdba-ef63-4ee6-a7b3-9785cff53879","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T09:05:30.262601Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:cbeec70a663b7cc8a7714be9a953a557b1f0e0e873b8bd2bca94bd5979c57090","observation_id":"dc822383-633f-4f61-a170-3acb28b804b1","resolution":{"observed_at":"2026-05-20T09:08:09.883187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":"2605.05040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-07-03T16:28:38.434907Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","venue":"cs.LG","work_id":"c6ccbdba-ef63-4ee6-a7b3-9785cff53879","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T09:51:52.886663Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:c12f2c067f2ae05e236f72f16ce3b546116833ebeb5c5e566628a0e892df97c2","observation_id":"6159c1c3-988f-4682-a15d-d069dcea0db3","resolution":{"observed_at":"2026-05-22T09:54:46.934280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":"2605.05040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-07-03T16:28:38.434907Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","venue":"cs.LG","work_id":"c6ccbdba-ef63-4ee6-a7b3-9785cff53879","year":2026},"citing_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T10:28:18.490452Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2606.11709"},"observation_digest":"sha256:4a629276cb77baec921d4d28d132b231da5150384c35b86bad211744b23b8e74","observation_id":"e63f3d9a-5097-4b76-87f0-b60c9afd40c1","resolution":{"observed_at":"2026-07-03T09:07:48.375369Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":"2605.05040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-07-03T16:28:38.434907Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","venue":"cs.LG","work_id":"c6ccbdba-ef63-4ee6-a7b3-9785cff53879","year":2026},"citing_paper":{"arxiv_id":"2607.02502","last_updated":"2026-07-12T16:14:05Z","snapshot_observed_at":"2026-08-01T10:31:19.297840Z","submitted_at":"2026-07-02T17:58:29Z","title":"DemoPSD: Disagreement-Modulated Policy Self-Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-03T16:21:02.422775Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2607.02502"},"observation_digest":"sha256:6f9900a02f74b0976a9bbae6f605a9c45d21c5d9d83c2f4ddc0671e3a61e8d64","observation_id":"c1e27acb-7add-46b5-b717-b3c636aedb14","resolution":{"observed_at":"2026-07-03T16:28:38.436240Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-07-12T08:00:10.945953Z","title":"Dapo: An open-source llm reinforcement learning system at scale.Advances in Neural Information Processing Systems, 38:113222–113244, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02502","last_updated":"2026-07-12T16:14:05Z","snapshot_observed_at":"2026-08-01T10:31:19.297840Z","submitted_at":"2026-07-02T17:58:29Z","title":"DemoPSD: Disagreement-Modulated Policy Self-Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T08:00:10.945953Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2607.02502"},"observation_digest":"sha256:4b05bc361aeb282b080e128028d89bf970cbf685a97f94a5b0e9126b02478bae","observation_id":"685b8c5c-e0e9-4cd6-a1bb-a24693448c5e","resolution":{"observed_at":"2026-07-12T08:00:10.945953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-07-14T16:40:00.821341Z","title":"Dapo: An open-source llm reinforcement learning system at scale.Advances in Neural Information Processing Systems, 38:113222–113244, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02502","last_updated":"2026-07-12T16:14:05Z","snapshot_observed_at":"2026-08-01T10:31:19.297840Z","submitted_at":"2026-07-02T17:58:29Z","title":"DemoPSD: Disagreement-Modulated Policy Self-Distillation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T16:40:00.821341Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2607.02502"},"observation_digest":"sha256:1066aa0247386da1ca7d1a39eed9243be50baee690b260020e0a78c442880383","observation_id":"9efda571-6255-4f55-ae5f-ead04887d3fa","resolution":{"observed_at":"2026-07-14T16:40:00.821341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-08-01T13:40:41.757803Z","title":"Preference- based self-distillation: Beyond kl matching via reward regularization.arXiv preprint arXiv:2605.05040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-01T13:40:35.820857Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.757803Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:ef2bd316b4368ec1a51aec995c5fc9b5ba72bf219c8aadb0435bfe19ad7aab46","observation_id":"ed59648d-76be-4a61-9bd2-e75318123df3","resolution":{"observed_at":"2026-08-01T13:40:41.757803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.05040/citation-record","integrity":"/paper/2605.05040/integrity","json":"/paper/2605.05040/citation-record.json","paper":"/paper/2605.05040"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.07944","last_updated":"2026-04-09T08:06:19Z","snapshot_observed_at":"2026-08-03T01:28:21.257030Z","submitted_at":"2026-04-09T08:06:19Z","title":"On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning","version":1},"cited_work":{"arxiv_id":"2604.07944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07944","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning","venue":"cs.RO","work_id":"c4a41865-6e09-4861-908e-4b1bf8788702","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2604.07944","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:94930bbc90c09d0c0968888dd7454627edc75fc61485ff8a306fad2cd302309b","observation_id":"4474d615-5a35-4844-b49f-9ae84066fe9b","resolution":{"observed_at":"2026-05-11T18:16:10.878876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1214/09-ejs521","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jiamu Bai, Xin Yu, Meilong Xu, Weitao Lu, Xin Pan, Kiwan Maeng, Daniel Kifer, Jian Wang, and Yu Wang","venue":null,"work_id":"4177f1ed-3a89-4727-a087-3154feb1e041","year":2010},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:07ac01126a1b7a388f365875db9b77591417302eeeab8219e83c4587b8ef886d","observation_id":"630c912b-ad0c-47d1-9028-18a1be8b467e","resolution":{"observed_at":"2026-05-08T20:24:09.051021Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24422","last_updated":"2026-05-14T07:12:17Z","snapshot_observed_at":"2026-08-01T18:33:19.748881Z","submitted_at":"2026-03-25T15:33:34Z","title":"OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework","version":2},"cited_work":{"arxiv_id":"2603.24422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24422","snapshot_observed_at":"2026-06-27T05:30:36.175940Z","title":"Onesearch-v2: The latent reasoning enhanced self- distillation generative search framework","venue":"cs.IR","work_id":"58ef2c37-0f09-404a-af66-99a5ea8d6ed2","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2603.24422","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:759a5d28dca8b97da91e544549f471f60b9bd3d001b790996a80c9944968b60a","observation_id":"8faf494b-48c4-4a43-bd64-d82676d7a9d2","resolution":{"observed_at":"2026-05-15T01:43:12.126898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.23871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:12.711972Z","title":"Hdpo: Hybrid distillation policy optimization via privileged self-distillation","venue":null,"work_id":"e40578ea-e2a1-4ab3-a681-c6ee0356fb90","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:5e68c3cc8ab986466819e916204360afcfec72da5cf56ca693f9de59789459df","observation_id":"c0428810-736e-46d0-9b3c-106fd2d52cab","resolution":{"observed_at":"2026-05-11T18:16:10.854456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":"2603.25562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-07T12:33:45.227324Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","venue":"cs.LG","work_id":"8e059321-d6e4-4359-89eb-83ecbb93b657","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:2a6eb427e8bd15fd65c7a029778703bb8a32f1bac06156fa6bdb0f5ca01cd939","observation_id":"8d5f5526-0bc8-43d3-be39-ac30142f40cc","resolution":{"observed_at":"2026-05-11T18:16:10.948921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.04178","doi":"10.48550/arxiv.2506.04178","metadata_source":"pith","pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OpenThoughts: Data Recipes for Reasoning Models","venue":"cs.LG","work_id":"c7acbe41-27a0-4773-a7be-8f08d86cdf21","year":2025},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:04ae30b746c3fa3aaa3886cb98794eb334b019dea6f15a32548ade1a6db269b0","observation_id":"d9515901-543c-4e25-9510-56747c002831","resolution":{"observed_at":"2026-05-12T04:57:51.597669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07750","last_updated":"2025-02-19T04:21:58Z","snapshot_observed_at":"2026-07-06T20:34:53.567141Z","submitted_at":"2025-02-11T18:25:48Z","title":"PFedDST: Personalized Federated Learning with Decentralized Selection Training","version":2},"cited_work":{"arxiv_id":"2502.07750","doi":"10.48550/arxiv.2502.07750","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07750","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Pfeddst: Personalized federated learning with de- centralized selection training","venue":null,"work_id":"23fcf3cd-7584-4034-89e5-b1b33d43944c","year":2025},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2502.07750","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:c8247a08beabad48e241c7a7e2574dcdd54bb118b52453fd4a9821bc7cb26915","observation_id":"ee7fa4a1-f0ab-488a-9d7f-3c473b5bd133","resolution":{"observed_at":"2026-05-11T18:16:10.973582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:fb7baffd82089d2decdde601172c251a45419cb15b5c737cac2a9d59632da911","observation_id":"567fd72d-d9e7-49f2-a8a3-6d495536ef3d","resolution":{"observed_at":"2026-05-12T04:29:18.795354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":"2603.24472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-10T00:26:39.269322Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","venue":"cs.CL","work_id":"8df6a2d1-d890-48ae-af85-c11643a91097","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:10627c70f071ad1f576eee98fb34a9ebc2b19c6a629d706f64dda454f234f6a5","observation_id":"9d5a2af6-6dcb-4107-91c3-39c25dac3069","resolution":{"observed_at":"2026-05-11T18:16:10.921197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.02288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.050266Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing","venue":null,"work_id":"6dea6cb7-a4e5-478a-ab3c-eeeb335abd51","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:2f8526e0438bd3d8b5fa99405addb1b0b364d4709c611708c9873c9a626779ef","observation_id":"df82730e-31b0-4bb9-8542-16c0a6a29f35","resolution":{"observed_at":"2026-05-11T18:16:10.828081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml.20251026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:24.393084Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism","venue":null,"work_id":"bb76b11f-d59b-421e-88c6-fa0920ed09c3","year":2025},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:d1db253b509269db7af653160e6b6b41be1556dee227e4e6e41710e0f2200844","observation_id":"2d9ae9a9-a5d8-4a79-bb35-f2cc6941ae39","resolution":{"observed_at":"2026-05-08T20:24:09.044640Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1214/12-sts400","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T15:55:48.582076Z","title":"and Ravikumar, Pradeep and Wainwright, Martin J","venue":null,"work_id":"0f6fb3ca-b3b7-4351-802b-a2957a7700a4","year":2012},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:adb865e5894ef7617a02aba2245b0b1f6b35202fcb5ea9eeea32e0f5a3fa8930","observation_id":"01af755b-8ef8-4f4e-b71c-8b107f072748","resolution":{"observed_at":"2026-05-08T20:24:09.055047Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T16:24:24.884859+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T16:24:24.884859+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":"2406.05534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-07-03T01:17:30.387482Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing.arXiv preprint arXiv:2406.05534","venue":null,"work_id":"67698921-3d05-4e9d-a33f-3a04296b5942","year":2024},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:cf1b6ecfcef9106babdda2cfa6e70192e6138d5a99e9503946e5c28a380fb533","observation_id":"c8adf3e0-6aa8-4421-ba5c-f644bfdc0e22","resolution":{"observed_at":"2026-05-11T18:16:10.962351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-07-15T14:32:24.776402Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":"2603.05433","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-07-03T20:18:56.074332Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","venue":"cs.LG","work_id":"c5a99022-15b6-4d77-9850-23036df7a073","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:e7f2598d1094c65a97ff5e49f1b33fc2e60d51476c1a1d17ed8901274c3b62d6","observation_id":"495db4f8-69f6-4cf1-ac3a-3ae3a45effac","resolution":{"observed_at":"2026-05-11T18:16:10.996011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:267c994ae07dee306735f872e2de0ec0aa2223172b7cfa2351449039191a2121","observation_id":"35a7df0e-6aea-4477-9302-d7e7eda67e84","resolution":{"observed_at":"2026-05-11T18:16:10.835642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-10T16:57:24.571259Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:10fa3d22602950652c0ef97d50d27fee1e59f9b1135eeebb2aa389ea93d68f5e","observation_id":"39d5b8f9-faab-425f-989a-5b24af4e0c76","resolution":{"observed_at":"2026-05-12T05:31:52.723793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:c4523ae4734060476f7030068bcd6af5a9b2c7c33dcac116086cde864c1ccf24","observation_id":"7e0ba19f-1c61-46b8-bfe5-33b9a18640ab","resolution":{"observed_at":"2026-05-13T02:47:19.238105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":"2604.10674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-07-04T13:39:50.103028Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","venue":"cs.LG","work_id":"97dc38ac-2adb-4aaa-9fa4-16929254604e","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:a3174475b4f4fb14e997825e09540c23f7fde5c598263383d033b8e7a45766c9","observation_id":"74db5023-b36d-4051-905b-025d7df7ca94","resolution":{"observed_at":"2026-05-11T18:16:10.847225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":"2604.03128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-07T12:33:45.187943Z","title":"Self-Distilled RLVR","venue":"cs.LG","work_id":"935a34f3-b83d-4214-b6a0-ae2395b3d107","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:5aed558543918c23ecaaf8b7bb716f8443235106a79d469cbd5e4aa64d2e0c35","observation_id":"8c0199b6-0411-417c-994c-25e0da9c78da","resolution":{"observed_at":"2026-05-11T18:16:10.782925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:0f835b54f60f6f8a9b1c45bb4335f9492089880e109f45f57f8dae52dd6eea19","observation_id":"8057ce1c-bdcd-408b-8aff-517f74b16fba","resolution":{"observed_at":"2026-05-11T18:16:10.817694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01193","last_updated":"2026-06-24T22:44:36Z","snapshot_observed_at":"2026-08-02T16:28:38.685624Z","submitted_at":"2026-04-01T17:39:50Z","title":"Embarrassingly Simple Self-Distillation Improves Code Generation","version":2},"cited_work":{"arxiv_id":"2604.01193","doi":"10.48550/arxiv.2604.01193","metadata_source":"pith","pith_arxiv_id":"2604.01193","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Embarrassingly simple self-distillation improves code generation","venue":"cs.CL","work_id":"c0ef109a-9f93-445a-beb2-16ed977cbebc","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2604.01193","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:24c62b1bef5625550afb0d376098992775789e2df86189d41e25a0df1bede9bf","observation_id":"f6e75022-a335-4d15-a081-e89bed8931fd","resolution":{"observed_at":"2026-06-26T01:15:18.478768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:a084373bb34b6e31b29472ed544389ebf584c9b4fdebf36e056871e4e914f958","observation_id":"90e88614-6bed-449f-8b19-c2a86e878f3a","resolution":{"observed_at":"2026-05-12T03:54:31.187112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16335","last_updated":"2024-01-29T17:43:42Z","snapshot_observed_at":"2026-07-06T17:21:58.983048Z","submitted_at":"2024-01-29T17:43:42Z","title":"Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF","version":1},"cited_work":{"arxiv_id":"2401.16335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.16335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jordan, and Jiantao Jiao","venue":null,"work_id":"588086f8-9d24-4175-bf30-d6033381374c","year":2024},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2401.16335","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:0e937b0ed6e2a798e27e5044f216bb647acefa2e74acaae63373f2c155f9f81f","observation_id":"ec45e4a4-4f48-4097-955a-686854b0ab13","resolution":{"observed_at":"2026-05-11T18:16:10.933497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Appendix E develops the technical details behind the statistical analysis in the main text","venue":null,"work_id":"3fc5476c-046b-4c70-9faa-cfb74b0edec1","year":2024},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:cc64b521ad3fd28f7b6da2e0287bc6be152bc460fb793772f05cf4f5a74f423d","observation_id":"ae0a0656-b9cc-4b25-b2b6-9541c4759d6a","resolution":{"observed_at":"2026-05-26T10:07:34.528922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"86b11236-062e-4874-b4d9-143ed5550b3d","year":2000},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:19e9c97dd20ea31922ce7a8973af5a68c0a76bc7f2749cb0ffa0fe2123f455e1","observation_id":"547ffe04-b74c-4323-8039-c3461eec9345","resolution":{"observed_at":"2026-05-26T10:07:34.535327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[2026a] whenever applicable so that the comparison against prior baselines isolates the effect of the proposed PBSD objective as cleanly as possible","venue":null,"work_id":"549b6ed7-4af4-4f3a-80e7-5966f1db3132","year":2025},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:331cc299144408ed63ecf8ffd1c2337949071eaba4056deea54ec3fdafd03466","observation_id":"e6476b21-681f-466c-8ac3-196244b87de2","resolution":{"observed_at":"2026-05-26T10:07:34.532204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tool-use data.For the additional tool-use study, we follow the setup in Shenfeld et al","venue":null,"work_id":"32b186a8-3eec-458b-89f9-18b927b5b1d9","year":2026},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:3447090136d7a037773f01c58a2b216e59ac15ad4ab114ee6b93bdd9aed8708c","observation_id":"517b923f-e1e3-4f87-8ba7-675bb2a4e767","resolution":{"observed_at":"2026-05-26T10:07:34.538558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Base (Student)","venue":null,"work_id":"c7a29e85-7f06-491b-8ca0-e47e8840a29d","year":2025},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:62bc59e5a1cb6c369f5d99ade75e5b654331f4b688a3719bd9b488091807bf21","observation_id":"c11ee6f9-3076-42b1-bd70-682e600ffc2c","resolution":{"observed_at":"2026-05-26T10:07:34.541532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":4},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 7 inbound Pith citation observations for arXiv:2605.05040."}