{"as_of":"2026-08-21T18:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c45f136d559fa55b2fff43fd421a095f6c237789a5d5d00e0135d70d49add7f2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:13:22.755979Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-12T12:45:19.955519Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.955519Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:642e287651dbcec3ca21e5e90b44a4ff7257bd7bf461d11cac38f1adea0d3bad","observation_id":"ca37dec1-f373-4fd3-a31f-644000543747","resolution":{"observed_at":"2026-08-12T12:45:19.955519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-11T12:15:18.565667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-17T12:58:39.957994Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.565667Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:5bf3e9c9b5c78b38baebbd06b9405be268bd09aa9a63808fbe325658bb99433f","observation_id":"381fdb64-d263-45d2-a983-52bb9588d22d","resolution":{"observed_at":"2026-08-11T12:15:18.565667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-11T15:09:39.100484Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15255","last_updated":"2025-06-04T12:38:38Z","snapshot_observed_at":"2026-08-18T09:30:22.813739Z","submitted_at":"2024-12-15T19:38:48Z","title":"Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:09:39.100484Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2412.15255"},"observation_digest":"sha256:addf614af7f27f8ae5fef56f0bdc75f6c8c94d679be74fb52ef4169eda3df3d2","observation_id":"b4832e30-4a5f-43b5-885c-03b680f0ca8a","resolution":{"observed_at":"2026-08-11T15:09:39.100484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-11T11:59:54.856784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15303","last_updated":"2024-12-19T12:24:15Z","snapshot_observed_at":"2026-08-16T17:41:25.076578Z","submitted_at":"2024-12-19T12:24:15Z","title":"Self-Evolution Knowledge Distillation for LLM-based Machine Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:59:54.856784Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2412.15303"},"observation_digest":"sha256:cdbe37383bfb237d3ccc4552785245c95f2fcb7db34c3fbefe13ac0787f3e537","observation_id":"48187e72-3c62-4e3c-9f0f-395e3997ecc9","resolution":{"observed_at":"2026-08-11T11:59:54.856784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-10T22:08:34.862859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02795","last_updated":"2025-02-17T03:49:14Z","snapshot_observed_at":"2026-08-18T02:47:14.015924Z","submitted_at":"2025-01-06T06:29:55Z","title":"InfiFusion: A Unified Framework for Enhanced Cross-Model Reasoning via LLM Fusion","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:08:34.862859Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2501.02795"},"observation_digest":"sha256:a6ad664b21791b5f2d2e1092feb37e196ea3d80bb79a5f1f3e088a133653fed4","observation_id":"5ffc08f1-601f-4e35-9474-87a827ab0d02","resolution":{"observed_at":"2026-08-10T22:08:34.862859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-10T19:04:34.962552Z","title":"Lin Long, Rui Wang, Ruixuan Xiao, Junbo Zhao, Xiao Ding, Gang Chen, and Haobo Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10648","last_updated":"2025-01-18T03:48:56Z","snapshot_observed_at":"2026-08-15T05:30:47.115727Z","submitted_at":"2025-01-18T03:48:56Z","title":"DNA 1.0 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:04:34.962552Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2501.10648"},"observation_digest":"sha256:e9c0d503f9c2de59b7f3080a59e3592ca80ca73cee781306e8f850cf70324808","observation_id":"a279f826-24db-4d48-aab9-79be8b390922","resolution":{"observed_at":"2026-08-10T19:04:34.962552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-10T14:46:38.501603Z","title":"Distillm: Towards streamlined distillation for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15014","last_updated":"2025-01-28T20:29:44Z","snapshot_observed_at":"2026-08-15T08:26:57.013948Z","submitted_at":"2025-01-25T01:37:03Z","title":"On Accelerating Edge AI: Optimizing Resource-Constrained Environments","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T14:46:38.501603Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2501.15014"},"observation_digest":"sha256:ae90643a268b964851349489ac3170e4fe626a97ee780a10fd96e21faa15c209","observation_id":"994244e9-e0b4-4f92-95d3-d3765efae91b","resolution":{"observed_at":"2026-08-10T14:46:38.501603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-08T14:48:53.789335Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-19T01:12:28.922658Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.789335Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:8a8b9622ae373d708e470d444ee52de57c8ec42a099ed109d9880504a2162e9a","observation_id":"bab0a534-e073-49c7-ad5c-4fdaa397ab83","resolution":{"observed_at":"2026-08-08T14:48:53.789335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-16T11:13:22.755979Z","title":"doi: 10.18653/v1/2023.acl-long.248","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16431","last_updated":"2025-04-23T05:32:58Z","snapshot_observed_at":"2026-08-18T11:32:22.519753Z","submitted_at":"2025-04-23T05:32:58Z","title":"Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:13:22.755979Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2504.16431"},"observation_digest":"sha256:6317f2b1d038e6482d4ed73da628cde6d06ad735807d2cd9f5666a0e00de3c5a","observation_id":"20fda6c1-d7c0-4f50-ab19-4587b76ef855","resolution":{"observed_at":"2026-08-16T11:13:22.755979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-16T01:00:02.023103Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.023103Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:a5ef8f9041769815230d2370b610011232f5add6612ef7a8319796494be18d8f","observation_id":"97676631-4632-4726-90e7-37cafba6c385","resolution":{"observed_at":"2026-08-16T01:00:02.023103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-07T10:20:01.289189Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05695","last_updated":"2025-06-06T02:48:38Z","snapshot_observed_at":"2026-08-08T17:46:37.577079Z","submitted_at":"2025-06-06T02:48:38Z","title":"Being Strong Progressively! Enhancing Knowledge Distillation of Large Language Models through a Curriculum Learning Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:20:01.289189Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2506.05695"},"observation_digest":"sha256:b259618f2e83d020f89361ec818f45c89992d4299dc8bef97e055df81422fad5","observation_id":"087c71f0-6667-4297-8cc2-07fcdc99ece5","resolution":{"observed_at":"2026-08-07T10:20:01.289189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-07T05:04:03.157167Z","title":"Alexander Lin, Jeremy Wohlwend, Howard Chen, and Tao Lei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09104","last_updated":"2025-06-10T16:26:32Z","snapshot_observed_at":"2026-08-19T16:05:22.693884Z","submitted_at":"2025-06-10T16:26:32Z","title":"Unifying Block-wise PTQ and Distillation-based QAT for Progressive Quantization toward 2-bit Instruction-Tuned LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:03.157167Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2506.09104"},"observation_digest":"sha256:4301ab1ae0a6bc910eddc7accd31edb6e5a529ae97987a16fadd9d962e4c2965","observation_id":"8e479b64-4769-4745-8936-23e0b4357318","resolution":{"observed_at":"2026-08-07T05:04:03.157167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-15T19:47:26.188921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15118","last_updated":"2025-06-18T03:35:24Z","snapshot_observed_at":"2026-08-20T08:15:54.757141Z","submitted_at":"2025-06-18T03:35:24Z","title":"CKD-EHR:Clinical Knowledge Distillation for Electronic Health Records","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:47:26.188921Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2506.15118"},"observation_digest":"sha256:ef697ebc0df69e5982c17ce7715c05af678179de83d0ba0094b434553ce58ca1","observation_id":"5cdf9751-0f79-4855-8afd-44e3ebced1bd","resolution":{"observed_at":"2026-08-15T19:47:26.188921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-06T23:57:23.472738Z","title":"arXiv preprint arXiv:2402.03898 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:23.472738Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:0626faf8af315e300ce9c8e6f093f019b7be5f2782fce397104ee870956a645a","observation_id":"b777241c-171e-42da-9dbd-2d7149f8f076","resolution":{"observed_at":"2026-08-06T23:57:23.472738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-06T22:58:09.354241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20353","last_updated":"2025-06-25T12:04:53Z","snapshot_observed_at":"2026-08-15T01:44:17.237882Z","submitted_at":"2025-06-25T12:04:53Z","title":"DipSVD: Dual-importance Protected SVD for Efficient LLM Compression","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:58:09.354241Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2506.20353"},"observation_digest":"sha256:9dc653b05781b13ad62e6466fad31b1a1bc0a05c7ed20938981bc135e7195abb","observation_id":"afb47b9a-9024-441a-b97a-73df6cff3a7a","resolution":{"observed_at":"2026-08-06T22:58:09.354241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-06T22:45:01.602702Z","title":", Kim, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-16T00:49:04.578925Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.602702Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:33994fde460b53daa19a08cf87ae1c5f3268594bb61132fb584337e68852c511","observation_id":"bf1372cb-2c2d-4815-b264-30df58d36e6d","resolution":{"observed_at":"2026-08-06T22:45:01.602702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-15T15:55:56.138663Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16456","last_updated":"2026-06-10T00:25:53Z","snapshot_observed_at":"2026-08-18T11:13:37.412708Z","submitted_at":"2025-09-19T22:30:23Z","title":"GPO: Learning from Critical Steps to Improve LLM Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:55:56.138663Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2509.16456"},"observation_digest":"sha256:3c1bad87797c1c53c452233ac9acaa69986e15672272567bdb7735cc81b3729a","observation_id":"bd44b6ad-7232-4790-8296-22323b63afb4","resolution":{"observed_at":"2026-08-15T15:55:56.138663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-07-12T22:24:51.874340Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-14T18:05:40.907227Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T22:24:51.874340Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2604.10688"},"observation_digest":"sha256:84d5a217f6b47266d05b93506e1b090cc3045a9d22c1a2b9b448b740ac7ecb76","observation_id":"8a4f3613-9185-441e-8e0b-a14583187ad8","resolution":{"observed_at":"2026-07-12T22:24:51.874340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2604.14629","last_updated":"2026-04-16T05:13:57Z","snapshot_observed_at":"2026-08-14T10:07:40.756198Z","submitted_at":"2026-04-16T05:13:57Z","title":"Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:46.371799Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2604.14629"},"observation_digest":"sha256:ca00ecaddb020d824d4c79ca2d81256f2ca4dbd243bdc5533d39262ff3abc1c2","observation_id":"25b3d109-edcc-4ec3-9525-689323846b11","resolution":{"observed_at":"2026-05-10T11:25:18.532570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2604.20244","last_updated":"2026-08-08T05:05:33Z","snapshot_observed_at":"2026-08-13T23:16:21.197853Z","submitted_at":"2026-04-22T06:46:22Z","title":"Hybrid Policy Distillation for LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T00:41:21.984760Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2604.20244"},"observation_digest":"sha256:cc56acd0a757402a7e1433cb77ded6131d8c578a7a8ed404c07cd2c548cfa704","observation_id":"5460ef4e-539c-48c5-968d-a219b717c64f","resolution":{"observed_at":"2026-05-10T00:54:49.028037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.01374","last_updated":"2026-06-02T09:16:00Z","snapshot_observed_at":"2026-08-15T00:28:37.696428Z","submitted_at":"2026-05-02T10:52:49Z","title":"MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-09T14:55:26.285575Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.01374"},"observation_digest":"sha256:ddefba0013b35eee490ec4d4dd99dccaa7b1fefe251c6b21f0a9e483bac14b33","observation_id":"d2ace319-c448-4eef-b9ee-fc47d2760ef3","resolution":{"observed_at":"2026-05-11T16:51:05.560395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.05940","last_updated":"2026-05-07T09:50:53Z","snapshot_observed_at":"2026-08-15T02:24:38.964177Z","submitted_at":"2026-05-07T09:50:53Z","title":"Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T14:20:37.141500Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.05940"},"observation_digest":"sha256:ec622b330494bc98985cabc047210c3a80002fa1f2c1e2956f33c1662ddbbba4","observation_id":"22128e69-fbca-4a4d-9f98-4c8ee4151840","resolution":{"observed_at":"2026-05-11T18:41:11.258763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.08737","last_updated":"2026-05-09T06:48:00Z","snapshot_observed_at":"2026-08-16T01:55:43.438729Z","submitted_at":"2026-05-09T06:48:00Z","title":"The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:43:16.720945Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.08737"},"observation_digest":"sha256:657c30bdbae178d5eb5850eab17dd3055a30a820962958fc1d637301b3c3f19d","observation_id":"f8300bd2-957c-4c41-8eb7-dc6f92b05adb","resolution":{"observed_at":"2026-05-12T07:06:36.519788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.11260","last_updated":"2026-05-11T21:37:20Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T21:37:20Z","title":"Curriculum Learning-Guided Progressive Distillation in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:53:21.920498Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.11260"},"observation_digest":"sha256:f25219bf080bfdd11f6d9a5467222e020fd4f4a9d6a1774e87e9494f9b86eaf3","observation_id":"4481a242-61fc-467a-8bfa-caba6dc58ae6","resolution":{"observed_at":"2026-05-13T01:57:05.823128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.12741","last_updated":"2026-05-12T20:46:05Z","snapshot_observed_at":"2026-08-18T01:39:18.596016Z","submitted_at":"2026-05-12T20:46:05Z","title":"Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:23:15.511083Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.12741"},"observation_digest":"sha256:632f144a5c347258f1e03d1b2ce37ab4dc75239f9c50b80e5a003ce138fbbf3e","observation_id":"bfffa97a-b11a-4121-b33d-29bbc0db482e","resolution":{"observed_at":"2026-05-14T21:28:00.258090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.17743","last_updated":"2026-05-18T01:52:12Z","snapshot_observed_at":"2026-08-17T14:01:15.374405Z","submitted_at":"2026-05-18T01:52:12Z","title":"MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T12:53:20.761872Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.17743"},"observation_digest":"sha256:5b637a58bb52af7564570349fb7c1a158893c28e53c37573920dcc9b61d14e42","observation_id":"9eaf2427-19ab-454d-af7e-5b8207d49198","resolution":{"observed_at":"2026-05-20T12:53:28.543541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:8db2d9b8787f90e9365cab2f22eb69ecd733285014a28c950cc5ce14de50e193","observation_id":"04227a4c-c5b2-412b-8eed-1fc2e91a6002","resolution":{"observed_at":"2026-05-22T09:26:20.581767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-08-16T21:45:56.892632Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:eeec2e7daf30d745dcd7a086f7281aafb364b6ad6ef966e5b6371367fc9be9ca","observation_id":"7c5fbd27-8657-4e24-8198-00f7d6280272","resolution":{"observed_at":"2026-05-22T07:24:42.929750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.30448","last_updated":"2026-05-28T18:19:32Z","snapshot_observed_at":"2026-08-13T17:27:20.539505Z","submitted_at":"2026-05-28T18:19:32Z","title":"Bounded Behavioral Indistinguishability for Black-Box LLM Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:50:41.083288Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.30448"},"observation_digest":"sha256:a4aa4b83bb7883c94cce8c8189e3ba3ea6af2723b1ac05c480f9a608dd0eb141","observation_id":"42024a70-d33c-4a87-886a-3da384f2c19b","resolution":{"observed_at":"2026-06-29T08:53:15.857113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:ff48ca944848e4659c2479286cd8bcdf40a25f0ab6674ea7575dbbb0540f70c3","observation_id":"38722acb-1395-4ab4-81df-c831c34b1361","resolution":{"observed_at":"2026-06-28T23:32:46.502050Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2606.09396","last_updated":"2026-06-08T12:14:06Z","snapshot_observed_at":"2026-08-02T09:59:19.994689Z","submitted_at":"2026-06-08T12:14:06Z","title":"PriFT: Prior-Support Guided Supervised Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:09.015766Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2606.09396"},"observation_digest":"sha256:6ad41774180a0646a8428b04744482fbf78d5a354e1f03360680179b7e513b0b","observation_id":"5c01b4d8-3945-4919-a27e-65c3b065498d","resolution":{"observed_at":"2026-07-03T00:57:29.941581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-08-16T02:55:53.932381Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:28:18.490452Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2606.11709"},"observation_digest":"sha256:45f8db2d3d8a7f31e3c1d71806213e6444ea545559fc71e4c080085e10f5de99","observation_id":"6e5b53cd-d166-447d-8a7e-2d7a863224ec","resolution":{"observed_at":"2026-07-03T09:07:48.375782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:3a9b1435742e7676cb68dfdd613407b88f3131251ef9cb3c54a4c4908aa3fd1b","observation_id":"390eb2f4-b160-4077-9735-dbc06f3613c8","resolution":{"observed_at":"2026-07-03T20:48:56.150486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2606.29340","last_updated":"2026-06-28T11:15:26Z","snapshot_observed_at":"2026-08-08T00:55:58.041882Z","submitted_at":"2026-06-28T11:15:26Z","title":"PHF: Privileged Hidden Flow for On-Policy Self-Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-30T07:26:32.902086Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2606.29340"},"observation_digest":"sha256:85ad9fd286a33a7f777a48642e6b7ef32ae9ab0aebfc45d1cb9b1649a60d40ab","observation_id":"bede0ac8-83e3-4d0f-92cd-3f6400106332","resolution":{"observed_at":"2026-06-30T07:34:21.814445Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-07T12:31:42.224094Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:83a747dc4334a1e1868526f3d178719448c51f80ea56563f7e298ee156929058","observation_id":"f3675b32-7ab2-4005-a5f1-ee3b584baea0","resolution":{"observed_at":"2026-07-07T12:33:45.112342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models.Proceedings of ICML, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:9f612b28cc061aa05c9f2363f89915c0a55cd14ef6885ba8cf868097fafe6ee3","observation_id":"e193e4c4-d4be-4125-9b9c-a5b283fa6f3b","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-02T00:00:10.117823Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15161","last_updated":"2026-07-16T16:07:19Z","snapshot_observed_at":"2026-08-19T00:15:19.875375Z","submitted_at":"2026-07-16T16:07:19Z","title":"On-Policy Delta Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:00:10.117823Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.15161"},"observation_digest":"sha256:443c0591c557ec9117e6a42fcf28d4eb2802487d6962d1c2be9d345fb4720399","observation_id":"6336b4f7-cc18-4380-beb2-d95329b794b9","resolution":{"observed_at":"2026-08-02T00:00:10.117823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-02T06:36:34.519466Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16303","last_updated":"2026-07-14T07:08:28Z","snapshot_observed_at":"2026-08-13T16:58:31.697624Z","submitted_at":"2026-07-14T07:08:28Z","title":"Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:34.519466Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.16303"},"observation_digest":"sha256:dd7cebdaf3a02299c05bfed1df9427b7c25eb0847bbe2b7d05bb325ca5ecf319","observation_id":"1e7e9c5b-8ed8-4641-b1dc-3ca27c65684c","resolution":{"observed_at":"2026-08-02T06:36:34.519466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-01T05:09:56.913028Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.913028Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:8ee73548a9d8cb9d69693cce90bf5c82a1d752f3b54812177b74ccebc3fbd84d","observation_id":"1488b820-6824-4687-954a-28e0b376173d","resolution":{"observed_at":"2026-08-01T05:09:56.913028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-01T00:26:25.081268Z","title":"arXiv preprint arXiv:2402.03898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.081268Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:cffde4529912b559ed92ee425408fdde454ee9628dcd22c305986d5051fdfcef","observation_id":"8ad81f8e-c470-4db2-ab72-2650a284f41f","resolution":{"observed_at":"2026-08-01T00:26:25.081268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-07-31T23:39:11.831350Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.831350Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:4260c945dd7de53fb1fe6abe2d1ca8120d8ee03a489708ad1d2431b3cfc2cf31","observation_id":"c1b745d8-005e-434f-8ad3-6f3bbae76750","resolution":{"observed_at":"2026-07-31T23:39:11.831350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-03T11:42:23.628684Z","title":"Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, and Junfeng Fang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29209","last_updated":"2026-07-31T09:28:16Z","snapshot_observed_at":"2026-08-18T23:15:34.784699Z","submitted_at":"2026-07-31T09:28:16Z","title":"SAF-OPD: Stable Advantage Fusion for On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T11:42:23.628684Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.29209"},"observation_digest":"sha256:e966692774b1e24d33a9e223758175236faf6601bd466a0153a811e064053267","observation_id":"d5ea3033-7bfd-4d19-8426-a838f50f57e6","resolution":{"observed_at":"2026-08-03T11:42:23.628684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-10T15:27:03.084232Z","title":"2024 , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07068","last_updated":"2026-08-07T10:18:31Z","snapshot_observed_at":"2026-08-19T22:05:54.747275Z","submitted_at":"2026-08-07T10:18:31Z","title":"MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T15:27:03.084232Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2608.07068"},"observation_digest":"sha256:d5f6845e93110ed440acc48513eef558c1131ee9bcb67f26bb7c6b880de03a59","observation_id":"f592d38c-cecd-4fe3-80e4-942c4e0b34d8","resolution":{"observed_at":"2026-08-10T15:27:03.084232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-14T04:42:22.396440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08572","last_updated":"2026-08-09T08:23:57Z","snapshot_observed_at":"2026-08-21T08:14:53.470418Z","submitted_at":"2026-08-09T08:23:57Z","title":"Reliability-Safety Trade-off in AI Distillation: A Renormalization-Group Approach","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:22.396440Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2608.08572"},"observation_digest":"sha256:07ce42c2865f23501ea35f3cb0ad35e6821def45062252e094ba4ed887b61634","observation_id":"6bed0a0b-3442-47ad-9654-7cd59b7a9f2f","resolution":{"observed_at":"2026-08-14T04:42:22.396440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-14T04:31:40.926096Z","title":"arXiv preprint arXiv:2402.03898","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-19T11:43:15.697444Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.926096Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:12f90a2464d904005e93293344475be099f9dfa69fe756ff5f1d5435468c648c","observation_id":"9dc29fc1-97b6-4435-9476-34db50f38de4","resolution":{"observed_at":"2026-08-14T04:31:40.926096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.03898/citation-record","integrity":"/paper/2402.03898/integrity","json":"/paper/2402.03898/citation-record.json","paper":"/paper/2402.03898"},"outbound":[],"paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2402.03898."}