{"as_of":"2026-08-05T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40987123d7cb8a73e2178fd8d622f180c31fdb73a6e74d54529b2a6bb74f19c6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:44:55.200796Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:23:31.294548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T16:28:38.401236Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":"2605.06597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-03T16:28:38.401236Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","venue":"cs.CL","work_id":"3c8e45a6-8c5b-40fb-b157-49ef97c2b2eb","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T09:05:30.262601Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:982586b3b8d46d166151638be3bc1efca5f8ff6f3146771ee5d28ff9de99877e","observation_id":"d754a85a-330c-460b-bb14-6a5ec20fa880","resolution":{"observed_at":"2026-05-20T09:08:09.856485Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":"2605.06597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-03T16:28:38.401236Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","venue":"cs.CL","work_id":"3c8e45a6-8c5b-40fb-b157-49ef97c2b2eb","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:51:52.886663Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:1869674e5c8fe6bbf7aae74d5480653df5d0620c00553ddf22cb40c9bfc8b907","observation_id":"eef4040c-5786-425e-8afa-e3c82e2cbf18","resolution":{"observed_at":"2026-05-22T09:54:46.944771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":"2605.06597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-03T16:28:38.401236Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","venue":"cs.CL","work_id":"3c8e45a6-8c5b-40fb-b157-49ef97c2b2eb","year":2026},"citing_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T10:28:18.490452Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2606.11709"},"observation_digest":"sha256:535c8e646d87247a65d73badc28ca630e2e292a85b3d30ee549149ab71c64b24","observation_id":"9a7c0620-a8d1-4073-ade6-8c4ec65a0c02","resolution":{"observed_at":"2026-07-03T09:07:48.368268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":"2605.06597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-03T16:28:38.401236Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","venue":"cs.CL","work_id":"3c8e45a6-8c5b-40fb-b157-49ef97c2b2eb","year":2026},"citing_paper":{"arxiv_id":"2607.02502","last_updated":"2026-07-12T16:14:05Z","snapshot_observed_at":"2026-08-01T10:31:19.297840Z","submitted_at":"2026-07-02T17:58:29Z","title":"DemoPSD: Disagreement-Modulated Policy Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T16:21:02.422775Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.02502"},"observation_digest":"sha256:eb235c3b49a38d8d56611d62f3d0508cf6aba39c770172f27cdf478974ccf41c","observation_id":"7286c9b8-cd70-4474-a5de-0154c3844f9d","resolution":{"observed_at":"2026-07-03T16:28:38.402435Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-12T08:00:10.945953Z","title":"Aditya Prakash, Josiah Hester, Jindong Wang, and Srijan Kumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02502","last_updated":"2026-07-12T16:14:05Z","snapshot_observed_at":"2026-08-01T10:31:19.297840Z","submitted_at":"2026-07-02T17:58:29Z","title":"DemoPSD: Disagreement-Modulated Policy Self-Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T08:00:10.945953Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.02502"},"observation_digest":"sha256:fe01d65374c70273a8bc92a0a21d11526909b40c8d5aa5482d40e5b067d583a8","observation_id":"d1ef0f6e-7beb-4829-b9d1-4847ffece68d","resolution":{"observed_at":"2026-07-12T08:00:10.945953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-14T16:40:00.821341Z","title":"Aditya Prakash, Josiah Hester, Jindong Wang, and Srijan Kumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02502","last_updated":"2026-07-12T16:14:05Z","snapshot_observed_at":"2026-08-01T10:31:19.297840Z","submitted_at":"2026-07-02T17:58:29Z","title":"DemoPSD: Disagreement-Modulated Policy Self-Distillation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T16:40:00.821341Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.02502"},"observation_digest":"sha256:9d115fe6a071c1fa165a71bf668299a226dad942ee01b87adff7e168ded5b9af","observation_id":"1f0d3291-79e1-4397-83d1-991b1d8df601","resolution":{"observed_at":"2026-07-14T16:40:00.821341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-08-01T15:42:04.082077Z","title":"Unisd: Towards a unified self- distillation framework for large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-03T11:03:45.528761Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.082077Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:057b5c1f29ef1225c9ec86882fa9b84a7ab6480ac83cc61d1d39d775c417f934","observation_id":"2fff4f34-bfc2-4241-9075-c35dec88808d","resolution":{"observed_at":"2026-08-01T15:42:04.082077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-07-31T18:36:19.071380Z","title":"arXiv preprint arXiv:2605.06597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28076","last_updated":"2026-08-03T09:38:05Z","snapshot_observed_at":"2026-08-05T04:22:16.689685Z","submitted_at":"2026-07-30T11:49:46Z","title":"Group-Reflective Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T18:36:19.071380Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.28076"},"observation_digest":"sha256:1b89a2860827096f11d9b7b3b7620e7b5eff1fd61bac9820fab63ac2647a757b","observation_id":"e908b5a8-ebe8-493b-824f-e95ed19fa9c7","resolution":{"observed_at":"2026-07-31T18:36:19.071380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-08-04T03:23:31.294548Z","title":"arXiv preprint arXiv:2605.06597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28076","last_updated":"2026-08-03T09:38:05Z","snapshot_observed_at":"2026-08-05T04:22:16.689685Z","submitted_at":"2026-07-30T11:49:46Z","title":"Group-Reflective Self-Distillation for Agentic Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T03:23:31.294548Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.28076"},"observation_digest":"sha256:d43195bfbf0c043dc1ba3189663c082d155b9e5b562a200e1655cea1b4c7a4b8","observation_id":"58e5bc50-b9d5-4850-be04-0ca605e48e6d","resolution":{"observed_at":"2026-08-04T03:23:31.294548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.06597/citation-record","integrity":"/paper/2605.06597/integrity","json":"/paper/2605.06597/citation-record.json","paper":"/paper/2605.06597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916","venue":null,"work_id":"b6ac582f-2fb8-433c-a94c-a857187b3025","year":2023},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:7c1ac0b61a9822dc349bcc2ff62c37a6333a2cf3fcfe632c4a67e8995d85841e","observation_id":"bf0ea2f4-2e3e-4399-9e4b-4c937499208d","resolution":{"observed_at":"2026-05-22T09:46:23.163536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpaca: A strong, replicable instruction-following model.Stanford Center for Research on Foundation Models","venue":null,"work_id":"622a11d0-15d7-4032-b4b9-6a02f0bfef64","year":2023},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:b89a84a55de7687637d6cd6b503cfec0cd4f0423aab01e8682aea91fa8a008db","observation_id":"c98d2f70-6f33-4c48-b084-62748434ec6a","resolution":{"observed_at":"2026-05-22T09:46:23.167768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":"f0a45a15-3b02-4a4e-bb20-723777b567a9","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:e2db8cc48e8d5dcdda0297744f4ea34c44ea4851b8e10ae3e2a02c69608672f8","observation_id":"0a995058-3ef6-4a69-a645-13d18fe14540","resolution":{"observed_at":"2026-05-22T09:46:23.179386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:98792011cccdb7525bcb3a8479e990f8f999802171f1db3f80c708481bc3d3e3","observation_id":"79763869-7775-4b2e-a92f-1984029b6604","resolution":{"observed_at":"2026-05-22T09:46:22.597636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simpo: Simple preference optimization with a reference-free reward.NeurIPS, 37:124198–124235","venue":null,"work_id":"8d4f9522-15f9-4051-9876-52c2c2e17212","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:892b103fcc01bf12ce1ff200af9def113311b011dd81b1f1fe405221167dc651","observation_id":"452e58b1-a3eb-4097-9d4c-bb9b2b72d130","resolution":{"observed_at":"2026-05-22T09:46:23.171751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:1833f5c22f9a2cda5083a3b2420c5ab7f9dcbf905c78614ce68699659d8dcf0f","observation_id":"a7239eca-27d9-481d-9683-0579ddc576d0","resolution":{"observed_at":"2026-05-22T09:46:22.549762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:15248d6a6752fffd72ab6981e92dd1ba93ecfc7ce5a006945d3c0be07c40fd54","observation_id":"adfeed04-bfc1-4550-ac49-1bb7fcc64853","resolution":{"observed_at":"2026-05-22T09:46:22.516034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt4all: An ecosystem of open source compressed language models","venue":null,"work_id":"cf12f100-348f-4cd8-9125-f04e43571ae6","year":2023},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:616b0747d74670d3225a2a7d1e7fc01b0939ca0da1b2bf52eb9788334baf5594","observation_id":"feebbecd-09b7-4906-ad7f-a3b71c119d03","resolution":{"observed_at":"2026-05-22T09:46:23.280979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03955","last_updated":"2026-05-23T00:45:07Z","snapshot_observed_at":"2026-08-03T04:53:25.321944Z","submitted_at":"2026-02-03T19:18:28Z","title":"AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent","version":3},"cited_work":{"arxiv_id":"2602.03955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03955","snapshot_observed_at":"2026-07-03T08:17:45.041829Z","title":"AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent","venue":"cs.AI","work_id":"e3131638-ac7d-42c8-baee-977a86327564","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2602.03955","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:7e314993cfcb9dd1a5743aeb2e59db69810fcfd48a995814dc079c440aee5db5","observation_id":"54fb25f6-94c1-47db-bd32-ab54b844ee8d","resolution":{"observed_at":"2026-05-22T09:46:22.555101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:789b0e58da0d130cec36271b9cafdb6d5e1b5c9706ec6c5a0b3f8f0ccbe7e6a3","observation_id":"fd6d12e2-bdf2-4c92-b4bd-209b5e107691","resolution":{"observed_at":"2026-05-22T09:46:22.561041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-02T17:17:56.296462Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":"2402.13116","doi":"10.48550/arxiv.2402.13116","metadata_source":"pith","pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Knowledge Distillation of Large Language Models","venue":"cs.CL","work_id":"b1dcdadf-875e-4695-8fcf-0907c69302f3","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:37c55ec05dd2e68cec76c4406744eb497c1fb83fa755a01d7db6c8b920b2988a","observation_id":"4e182904-aa5b-46b5-82da-299837eff201","resolution":{"observed_at":"2026-05-22T09:46:22.567310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:49:12.049248+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:49:12.049248+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Companioncast: A multi-agent conversational ai framework with spatial audio for social co-viewing experiences.ACM CHI 2026 Workshop on Human-Agent Collaboration","venue":null,"work_id":"c7c5d254-8356-406a-9f69-f36e388df66c","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:3ab134a7aa3bb5fd4c88259e29a7bdd5ffe0ff4c2578a100dd08fc5c78e8cde8","observation_id":"0f6137cb-ba39-4d5e-a5e3-64f51e2d03e4","resolution":{"observed_at":"2026-05-22T09:46:23.220973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harnessing the wisdom of the inner crowd.Trends in cognitive sciences, 18(10):504–506","venue":null,"work_id":"e7cd3339-398e-40a0-9d91-5c4a5d9f22ac","year":2014},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:556ea974a411059fd376aab79276af67991efbeec4d259625ee7adc222d66360","observation_id":"09f8ed6e-d735-4bbe-abea-30cf4ca3c3ea","resolution":{"observed_at":"2026-05-22T09:46:23.260394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction induction: From few examples to natural language task descriptions","venue":null,"work_id":"2eed089f-49e4-4de0-8258-5f793c2e7610","year":1935},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:5760f2a83b1e5cb33bd891eebe25ef1632a602aa6097ae7879b786fb9f02624f","observation_id":"affd457a-f51a-490b-9c43-9ec4bacaaf54","resolution":{"observed_at":"2026-05-22T09:46:23.198913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wordnet: a lexical database for english.Communications of the ACM, 38(11):39–41","venue":null,"work_id":"c2dc367f-5fe8-41bb-b962-78c87acc4c9f","year":1995},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:394ab43472ab038f31c7909a0881d883c537fc68c436365f37982cfc11e2456a","observation_id":"690b4091-221e-417e-9523-b8ea31a326aa","resolution":{"observed_at":"2026-05-22T09:46:23.202799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ppdb: The paraphrase database","venue":null,"work_id":"7761cb42-682e-4fe9-9af5-6cf93a5e4c45","year":2013},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:5d7fe41a965fe51f5097a4e7790edaaf3f54a8027d06ff342789da58480a32fe","observation_id":"676ec211-4cba-4d4d-a5d7-cd2552158569","resolution":{"observed_at":"2026-05-22T09:46:23.206805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textattack: A framework for adversarial attacks, data augmentation, and adversarial training in nlp","venue":null,"work_id":"a74e29c7-0d11-46a2-95a1-8e746aa443d6","year":2020},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:6af330dd1644d74e8c92daf10ad6e8bbe7ba0a06e4c61c70c4857074902aa260","observation_id":"27356a45-645f-49ea-b48a-ee4953e9dada","resolution":{"observed_at":"2026-05-22T09:46:23.195063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less is more: Task-aware layer-wise distillation for language model compression","venue":null,"work_id":"b1f681f0-2cd6-43b9-a2bb-1887aefbb24f","year":2023},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:e3b625325912d7035fc2efa4f21b2e447c67551b4dbc2aab9d2924c6e910bfb3","observation_id":"b63e53ca-c56c-4d8b-9a0a-d8119bd922da","resolution":{"observed_at":"2026-05-22T09:46:23.187277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minilmv2: Multi-head self- attention relation distillation for compressing pretrained transformers","venue":null,"work_id":"0deb4aac-c492-4fc6-bc91-1fc9d03e6e8b","year":2021},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:ebd7dafa515d1374ef7b98375521d80fbfa40374aef60029383c7edef1a78bb7","observation_id":"5e85aa15-7aca-4e74-b8ee-37139a97f668","resolution":{"observed_at":"2026-05-22T09:46:23.191290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.440050Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"d5ab38b8-0bd0-4a4c-b943-d85055dd76df","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:d5f239db1e03635529ab4695832ba98500520f52cbd79ad70d64b442f61caf3f","observation_id":"5bd81e30-32c1-4838-8cb1-d6ad9186bd3d","resolution":{"observed_at":"2026-05-22T09:46:23.216209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01193","last_updated":"2026-06-24T22:44:36Z","snapshot_observed_at":"2026-08-02T16:28:38.685624Z","submitted_at":"2026-04-01T17:39:50Z","title":"Embarrassingly Simple Self-Distillation Improves Code Generation","version":2},"cited_work":{"arxiv_id":"2604.01193","doi":"10.48550/arxiv.2604.01193","metadata_source":"pith","pith_arxiv_id":"2604.01193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Embarrassingly simple self-distillation improves code generation","venue":"cs.CL","work_id":"c0ef109a-9f93-445a-beb2-16ed977cbebc","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2604.01193","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:c823f181279255e508389dbd045a088b1f4703fc736ed0c8519ce8ab818f875d","observation_id":"aa74d1fe-6ba0-405b-a609-f948bf8eb8f1","resolution":{"observed_at":"2026-06-26T01:15:18.478768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:4dd0f1a56cbfb23403e612e81cd2ecab13b89e4fdfec877270426e0faf0aef23","observation_id":"d76df9da-c4c0-4508-b293-3203f1d0e9a9","resolution":{"observed_at":"2026-05-22T09:46:22.492347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"cb3b1e0e-317c-4cd3-9e59-9e54950ef8ea","year":2022},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:6206b8b9747db78235a89aad8eefce2bef65db622f9bec03599c84fddcfce38c","observation_id":"8bd939ff-4c9c-485f-b18d-317011d7f493","resolution":{"observed_at":"2026-05-22T09:46:23.183370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"5ae7f45f-0a84-48c3-9ee9-18c9599052d1","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:087a4db168cd83da9b2f160ab33f2b950dcbffd325bba8d7be446b599462f87d","observation_id":"18c2b5ce-25ac-41e2-9d92-81ced4002c61","resolution":{"observed_at":"2026-05-22T09:46:23.155795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Explain yourself! leveraging language models for commonsense reasoning","venue":null,"work_id":"01cb825a-a835-4fde-8176-723603be2fb1","year":2019},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:991513e6c793a73262db3056982094806398996fc6b97db3aca3be09caf25a60","observation_id":"bbe7495d-9f1d-4513-ba20-eed4106fe9a9","resolution":{"observed_at":"2026-05-22T09:46:23.143790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":"449097ec-cae5-4e8a-a4ba-f2027f2df2a7","year":2019},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:b6a5a401d877b6fa236d02e3b8e1aee9a8a909234c5dfd85b64342faa0b3bc33","observation_id":"26f891b1-2a16-4c37-b22c-007057030dd4","resolution":{"observed_at":"2026-05-22T09:46:23.151593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:94f08cab1e6081b367cc78b359b07d617f680ee1d7f399b5b7073c8794475064","observation_id":"ad08a83d-20c2-4414-92a8-da1dbdd154b3","resolution":{"observed_at":"2026-05-22T09:46:22.498232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:d552a4dff38c73e90d3b4a38884cfd9f31c70f5aba9401e9fe5f9287ceaae1ad","observation_id":"0e6ce38b-40ab-4ee0-ba29-26ac2bfca03d","resolution":{"observed_at":"2026-05-22T09:46:22.538387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-07-06T15:40:20.267344Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":"2306.05301","doi":"10.48550/arxiv.2306.05301","metadata_source":"pith","pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","venue":"cs.CL","work_id":"e900f660-9178-4fda-ad54-a788e23aa0d8","year":2023},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:1df743ac25e0fc05106dac6dfb282ca2fe667cd706efa513abe640290ac194e5","observation_id":"5734dbab-b3aa-4507-a0bd-34ec4b2b9f28","resolution":{"observed_at":"2026-05-22T09:46:22.618119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.387207Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"6c796970-6476-4183-926b-4a42316e5ea6","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:924eaf34adde88f51afa9b185f5aa0eeaf9741b2ec6b6a390617ebc1a4990092","observation_id":"1af10851-4a66-42a4-96f2-14c0eb70ff20","resolution":{"observed_at":"2026-05-22T09:46:23.255839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:986dbe034bf21a839098d5db48361ada16eca4f2ab1190ea448d097e4e7c09b0","observation_id":"2f9919d1-4cc9-4ebf-9290-14826dfbd85e","resolution":{"observed_at":"2026-05-22T09:46:22.607286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:f47bbaf0b0cae66993fb1082bae26a02c5b5ecc212ab4e52a5e4e8b7a8c64b51","observation_id":"e71ff4a9-1e8d-432f-93cc-b585791c35e7","resolution":{"observed_at":"2026-05-22T09:46:22.612179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How context affects language models’ factual predictions","venue":null,"work_id":"6dd6f5b6-7962-4268-a2c6-058587133941","year":2020},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:165a7b59c751b751169614925399aaa26d36675925b799b607e26214502c524f","observation_id":"69b8405f-d7e6-413f-b4b2-c05a0a50f864","resolution":{"observed_at":"2026-05-22T09:46:23.264776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lost in the middle: How language models use long contexts.TACL, 12:157–173","venue":null,"work_id":"e5cb30e4-22f8-4411-abde-8193c68d295d","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:8b1351cad63ffc6a8fe3c7a671527eb117c634a079b9ffcb19020930c9782a5d","observation_id":"022942bc-4799-4885-9bcf-e5201d127ae0","resolution":{"observed_at":"2026-05-22T09:46:23.272905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Federated continual learning via knowledge fusion: A survey.TKDE, 36(8):3832–3850","venue":null,"work_id":"476e876c-d47e-4ab9-934e-e02b8d0f241c","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:0d690474ab6907ed2fd05633cfe2c57e62256f737d93206cd3dd2117d7c7104a","observation_id":"d166c954-85cf-47ba-bf87-185eee76ecf2","resolution":{"observed_at":"2026-05-22T09:46:23.251515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.311639Z","title":"Catastrophic interference in connectionist networks: The sequential learning problem","venue":null,"work_id":"d4b223df-56a6-49ad-a2ab-710ae21d87dc","year":1989},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:5de5908ee01339950847d5eaf078fc27c6189f0bc2192211ffa8af4209152ef2","observation_id":"f9bdec3d-0a40-4a42-94e0-870d806c4632","resolution":{"observed_at":"2026-05-22T09:46:23.243205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey of continual learning: Theory, method and application.TPAMI, 46(8):5362–5383","venue":null,"work_id":"9dd312bc-e71a-45ed-a10f-18bc3b5fb270","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:3785fea4ef4698eb16a7daa152dae88c6dbe479e523f8b9142a0021a5c1d6912","observation_id":"a9643c08-bce2-4d10-9ccb-d46cbe9a4ff0","resolution":{"observed_at":"2026-05-22T09:46:23.247569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14230","last_updated":"2026-05-31T05:19:53Z","snapshot_observed_at":"2026-08-03T09:21:00.637246Z","submitted_at":"2026-01-20T18:44:04Z","title":"MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems","version":2},"cited_work":{"arxiv_id":"2601.14230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14230","snapshot_observed_at":"2026-07-02T13:16:58.879920Z","title":"Mascot: Towards multi-agent socio- collaborative companion systems","venue":"cs.CL","work_id":"ae7b7fe1-2ff1-4709-8020-7cdf9aeffdaf","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2601.14230","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:f21d48e19f05b8b6693f61bed75ec6c22857654525e8d87ce085a9e35e66d793","observation_id":"19ca7aab-eeb8-4445-96c9-b8665d94bdeb","resolution":{"observed_at":"2026-06-02T02:04:13.222420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:b04e90985d42f43dea24345b56ea43913cbe42d62d12cffb22e552ff627fda73","observation_id":"dfe4168b-633c-4021-b0c2-d5ca2a3e244e","resolution":{"observed_at":"2026-05-22T09:46:22.585618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:e165981eb24c62bc33154ab2527fbc290a024f931903129febd31881d245aa4c","observation_id":"2316f8ab-056a-4058-9cdc-b4901d134cb5","resolution":{"observed_at":"2026-05-22T09:46:22.602765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"094c57d3-0bbc-456b-8d89-5c64aed57471","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:5685e954c876c80b7154a62bed2ac397e8d3605ab286bd64842fb77eef563e17","observation_id":"9e133665-145b-464c-bf79-f937d682d39e","resolution":{"observed_at":"2026-05-22T09:46:23.277233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":"7a0ba491-64c0-4d61-b2dd-120703d0775c","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:1185f48daf13d3e3c553a32e75ca203130fdbb0bc388952c99ad2f986d7762c8","observation_id":"89b6c35c-e2fe-417e-bfc9-bb569f5be156","resolution":{"observed_at":"2026-05-22T09:46:23.268715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:4b69eb62c8b1e069128fb5ea3f8343998073277eb4adf5eaea1329e7260fa961","observation_id":"cc193bb3-b8f8-47c2-a837-69a382876f16","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:20:07.034073Z","title":"Vla-opd: Bridging offline sft and online rl for vision-language-action models via on-policy distillation","venue":null,"work_id":"6228ca2f-c41a-48ae-9bc1-912a0726b03f","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:24b0765e9401b053fee6ab43086b9251647b4f6ec02f0b3b250d62a526d85c4d","observation_id":"6830b879-c527-4129-aff8-a3cbfaa58112","resolution":{"observed_at":"2026-05-22T09:46:22.526439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-02T07:46:19.307542Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":"2604.10688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-07-04T16:09:56.987062Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","venue":"cs.LG","work_id":"c31baac4-7cbe-4749-92ac-4d4051d62ec2","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:8b89c071551965f08fda6322b6352f277587832eeb660d47277701da21699371","observation_id":"14fd2344-1599-435d-bd3b-703575a9cc81","resolution":{"observed_at":"2026-05-22T09:46:22.510338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:aa306db7676bfd7d39189c78c42aa363c24a789934956d3141cc6c9ec9dd2eb2","observation_id":"5789fdb2-a335-4cac-a115-a4d4bcef9fb3","resolution":{"observed_at":"2026-05-22T09:46:22.544088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:4bf7eff6b037bdb060a1acb9816237348f2e0721ac4579206de48f89a7ffa3c4","observation_id":"05b67307-e2c9-418e-b6aa-1d9dfc5d00a3","resolution":{"observed_at":"2026-05-22T09:46:22.532994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy and policy considerations for deep learning in nlp","venue":null,"work_id":"1ff5306a-b7d1-4b0e-9872-26260c1e7fc5","year":2019},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:1a26879f9492a9438148dbe3dffb6c8f2af42c0f42b5dea8dc63bb723e60c9d9","observation_id":"3cef06ed-8ee4-4643-bf0a-c036eedf651d","resolution":{"observed_at":"2026-05-22T09:46:23.211628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Green ai.Communications of the ACM, 63(12):54–63","venue":null,"work_id":"c187b2dc-3bde-4f12-99ab-e2313a9507c8","year":2020},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:cc15d759d5680b4c7cb14e7057e4c58fcbcc52ec67610916ba717a278795308a","observation_id":"365b2087-210c-4e16-9692-60d1a554051b","resolution":{"observed_at":"2026-05-22T09:46:23.147821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-07-06T11:02:18.405330Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":"2104.10350","doi":"10.48550/arxiv.2104.10350","metadata_source":"pith","pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Carbon Emissions and Large Neural Network Training","venue":"cs.LG","work_id":"5cd5f484-8e24-440f-8bed-e8a801f4ac40","year":2021},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:f979c9e44f9b54c4b90f9086caeecb5bda85b0b00e3b8289e01f6b335907f591","observation_id":"67a529f0-68e8-4f0c-be00-0203d412a9ad","resolution":{"observed_at":"2026-05-22T09:46:22.579905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:19.119642+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:19.119642+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CodeCarbon: mlco2/codecarbon v2.4.1, May 2024","venue":null,"work_id":"017baa7b-3d65-49ee-b588-e591730866b0","year":2024},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:ae44e7e99c22239d6073e69fc9cfb119c136ac3ffc88730160224ffd39080baa","observation_id":"6f715edb-1970-493a-9ca2-a69068e8d22f","resolution":{"observed_at":"2026-05-22T09:46:23.159620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":"1910.09700","doi":"10.48550/arxiv.1910.09700","metadata_source":"pith","pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying the Carbon Emissions of Machine Learning","venue":"cs.CY","work_id":"7bc98d11-b344-40f2-b27f-2e08a08d1b95","year":2019},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:9c4e2e65c0d36070e2eb26c0bd834f8ace88cd9f2206a4488e7b3a78dc298497","observation_id":"cf2ad82a-5124-4597-bd04-abe74ea98be0","resolution":{"observed_at":"2026-05-22T09:46:22.486306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pue: a comprehensive examination of the metric.White paper, 49:52","venue":null,"work_id":"bcdc4dc0-de9c-45f9-bc9e-648893d64f8e","year":2012},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:ad84abec4573462ffdb5e3f9b12101176bfd259faca8f3f4f17ccdabea1c269b","observation_id":"c6156179-da57-4aa3-804e-22f45b2f19c5","resolution":{"observed_at":"2026-05-22T09:46:23.175568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"f6b41cb7-e55c-4b41-ad75-20bd4a952606","year":2021},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:0cf5f631574ef1664937decf6e8d9e7f6aef02c65997f85ca2807df89532d749","observation_id":"983644f3-fb4b-4c98-9db0-a49fab2f5c71","resolution":{"observed_at":"2026-05-22T09:46:23.234417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"79a4c8df-416d-4d18-b5c2-b447413490cb","year":2019},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:ae40a8c431543f1d1dd071de56e7cdac45abd5cad81d8d433195f89ca9b2321d","observation_id":"5fa592d2-4dee-44fb-a2bd-80acefbc3967","resolution":{"observed_at":"2026-05-22T09:46:23.238820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"7fe0dd21-d968-4c8f-8d7b-5e5981a52f76","year":2023},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:7c2dfb89896398ed89244621e0d901e4007f5987fde3abba5dbc83bc9a993d0f","observation_id":"34c5d18b-5985-4f76-b108-824f64325363","resolution":{"observed_at":"2026-05-22T09:46:23.225347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond magic words: Sharpness-aware prompt evolving for robust large language models with tare","venue":null,"work_id":"76cf9bc7-a4fa-4d11-8c74-e72196a2ab79","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:212c65ff551b6660736dc3419d3a476019d10e211e0b5206b76e89afc95a9dd1","observation_id":"e4dcc63d-f6cf-4958-a8d6-ba3bf90721ae","resolution":{"observed_at":"2026-05-22T09:46:23.230169Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":33},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 9 inbound Pith citation observations for arXiv:2605.06597."}