{"as_of":"2026-08-09T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c4e8652f1122008861462a932103b933fc72f80d0ccffc858bbe950a777719d","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T08:04:29.580811Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08776/citation-record","integrity":"/paper/2607.08776/integrity","json":"/paper/2607.08776/citation-record.json","paper":"/paper/2607.08776"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-06T18:01:31.723021Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"and Li, Y","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:141cf830a9744ec92be02539eb50fa9b5438cd1a2c03bbdb83980e4af8494af9","observation_id":"cbb8f483-f147-468b-89b7-a361c91ac52d","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16318","last_updated":"2024-09-13T12:27:44Z","snapshot_observed_at":"2026-07-06T17:21:58.983048Z","submitted_at":"2024-01-29T17:21:41Z","title":"Defining and Extracting generalizable interaction primitives from DNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16318","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Defining and extracting generalizable interaction primitives from dnns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2401.16318","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:c64098c18bd0fe7d5cfc64ee2140266faa0530d59bd350da8931eec9350c8119","observation_id":"23064cd9-97c1-456f-830d-0909cf78fd81","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"E., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:6179a2a6c8038d57c4e82e15c7701fba12573418a3d71a93d262ff1333f2597d","observation_id":"a2af95aa-b8f2-4bd9-872c-b89e90a2c593","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.03623","last_updated":"2022-08-22T23:49:30Z","snapshot_observed_at":"2026-08-06T16:50:20.075432Z","submitted_at":"2020-11-06T22:37:55Z","title":"Feature Removal Is a Unifying Principle for Model Explanation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.03623","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Feature removal is a unifying principle for model explanation methods.arXiv preprint arXiv:2011.03623,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2011.03623","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:2626c35921579fa1e6d1baaaa7c69fb1e68ac6c113ae2fe8612ab80175f77f38","observation_id":"7c571ff5-0f5c-4962-9b61-6debd4cd2678","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17215","last_updated":"2025-03-19T00:03:30Z","snapshot_observed_at":"2026-08-01T16:26:33.917672Z","submitted_at":"2024-10-22T17:40:32Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17215","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Minillm: Knowl- edge distillation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2410.17215","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:03e5db8c5e56c99d8235aa5857f7610505cf54a17ccf96fdf33109f9f645c4a6","observation_id":"9520a6fe-a9c3-49c7-a007-c1b16dded02a","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:0b54caa1bfb9de49ddb051cd474f69274d528d7b097471008d2efe42d9b70c3f","observation_id":"808cb2df-5f4e-44a8-948d-e62519d56e86","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Promptkd: Distilling student-friendly knowledge for generative language mod- els via prompt tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:ee5699f8033cc08098bd29e67877367e3efbccd0c30f8ee6e9d96a139e16b71b","observation_id":"4dc63a30-df2e-4bb3-81d0-17e3db19673a","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"and Rush, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:88c0cb6182cd93e55a6bcc45fb9665f099957526049f922cc88bef1b722581e1","observation_id":"1d530c7d-b2b9-4536-959c-edf893895c10","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07067","last_updated":"2025-05-30T04:41:12Z","snapshot_observed_at":"2026-08-08T09:26:03.922623Z","submitted_at":"2025-03-10T08:51:32Z","title":"DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07067","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Distillm-2: A contrastive approach boosts the distillation of llms.arXiv preprint arXiv:2503.07067,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2503.07067","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:155890d0d149beb300e3357d6ff6eb3c0b49a20ecdcc88fcf73495053501714b","observation_id":"bad64279-fd00-4efc-8faa-acb9f3eab34a","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Homodistil: Homotopic task-agnostic distillation of pre-trained transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:27d3bf0cc423970c3fa8facc1d100ef0ff06663640f4dafe72be86365509e3b1","observation_id":"5a1af472-0722-4e98-a533-ee8c97acfef4","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Defining and quantifying the emergence of sparse concepts in dnns","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:95fdc4d08782eb6df67aec30e52376ee8d22b0ffecc64fabcefb84fd2aa47000","observation_id":"e35d0d52-486b-4665-ace9-f9455050a7c0","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01083","last_updated":"2023-04-03T15:39:35Z","snapshot_observed_at":"2026-07-06T15:11:32.429514Z","submitted_at":"2023-04-03T15:39:35Z","title":"Can the Inference Logic of Large Language Models be Disentangled into Symbolic Concepts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01083","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Can the inference logic of large language models be disentangled into symbolic concepts?arXiv preprint arXiv:2304.01083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2304.01083","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:5a949c52bf1b196224d44c2450728d12535662f896b90d6cd881e889ba1b8f1e","observation_id":"669e01dd-a6a3-4446-a985-ef50838c7d4e","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:f114697dba73f35bb62de29693ffd307f955f2ad587c5c7f7761e3180d651afb","observation_id":"2df4220a-fcfd-458d-a18d-38f4bbf613db","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05122","last_updated":"2020-08-12T06:07:44Z","snapshot_observed_at":"2026-08-02T21:59:17.195799Z","submitted_at":"2020-08-12T06:07:44Z","title":"The Language Interpretability Tool: Extensible, Interactive Visualizations and Analysis for NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05122","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"The language interpretability tool: Extensible, interactive visualizations and analysis for nlp models.arXiv preprint arXiv:2008.05122,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2008.05122","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:76b15c55f555fb836cc5fe22357a75877260d904eaaf2fa23c2bc207cc2794b4","observation_id":"947e009f-c602-43e8-aa69-cfb15e10d8db","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Llama: Open and efficient foundation lan- guage models.arXiv preprint arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:814a6f067c11f75ff9f12619cd326ec07acba42a9f18147856c87193fdffe170","observation_id":"a22e9749-f16f-43e0-b041-7f9621bc0533","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"doi: 10.18653/v1/ 2023.acl-long.605","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:c512ba27c10bd30635b95a1e8b8b3fbb73dd5b17e2626a2c677cc86468bdeb37","observation_id":"6d134a0c-f3a2-4dc5-a0c0-3993ca258be5","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Interpreting and boosting dropout from a game-theoretic view","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:b7aef6d3cf26e2a356a8454e70172e15d87112a7a986eb374bd2eed186fcaea1","observation_id":"56d3916f-8f4b-4444-a377-75a32af5c37d","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"More recent approaches have explored contrastive representation distillation (Tian et al.,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:0ed31aa224452e8c6cab5e48a27ee1c7d6b37d8e618cef0b16178d2bea781401","observation_id":"3c205735-809e-433b-a5fc-22345eec3cac","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Others have proposed homotopic distillation for pre-trained transformers (Liang et al., 2023a) or utilized Wasserstein distance to match feature distributions (Lv et al., 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:8ca7f1632d40adcfbaad814df21c08c69b8996e0e81c2c6d70e17f9a1ae23500","observation_id":"a094d1f7-b14a-4b0b-92d4-6316d1403e80","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:df1dd1f6c34b8c3f1c95a86f5be5efc6d8ebb5562b8d0ad8cb7b56eeb1197d80","observation_id":"c1ab3001-e2e3-499d-acb8-b8eb6c57f328","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Furthermore, distillation is applied to critical safety tasks, such as the detection and mitigation of hallucinations in large language models (Zhou et al., 2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:6d27a997907dad93f9c974601e13000ed3506139371e94f255d1a61393130798","observation_id":"bc52fc3c-44db-48b7-8a8a-3a4dc0ba1b5e","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"The selection of a masking approach is complex, as each method has its weakness","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:1d429edaef78b29d6e3f96d479274221fcbaf9baad5732b2a86e4faa6f2e144e","observation_id":"260d0408-11dd-4cb2-b917-d8af61942dea","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"He is a green hand,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:c18b637cbe2b11bb06b45eff516fb4348f6f07bc0c05bb7005f776d45cfb6b6e","observation_id":"3b74683c-5585-4260-9466-d960820ae9a0","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Instruction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:1a2715665caa288a1111610b3b1780873bb80d568da02d1e7c749768584f1ae9","observation_id":"ce082a7c-3315-41f7-955e-829bbb15241f","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"It utilizes a mixed dataset and proposes an adaptive off-policy method to selectively incorporate SGOs based on validation loss, thereby filtering out noisy generated data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:d428f791274f349b8961d9ab5bc5e8e64f926f4e8da2335589032fd51b7ca560","observation_id":"7f88568a-474c-464f-9001-5ac0ab239b10","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Instruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:8870314717ce7b66c05b59b9b3543fa0a8802b51452dd724fcc195beb6694c35","observation_id":"3d470f26-ab0b-41fc-a079-c70bf172b2ef","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"[[rating]]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:fae6d93aa75d992ac7a19b9734b3394ccdd46072abb3f234bdc6995426860e82","observation_id":"e2465bb3-b045-4a7e-a01d-8b3695f729bd","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"What\", \"is","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:55006de983d7c3416920dc2e5891460fa7238157791731e83c174244195dd0d4","observation_id":"8f587f00-5cae-42d4-a1bb-80e52d936c3c","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":null,"venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:be99144591d13c7a2b2180ab9d76f4153c585716ba928893714bea19f9d39c8e","observation_id":"aa3a62f3-5c98-45a0-bd9c-5f7fd3ac9906","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Table 7.Instruction-following cases from thedatabricks-dolly-15kdataset","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:c285c2e5d3cb494bafda6b9226810f64aef729a20007354c0ac741e7e58a7424","observation_id":"f6cefee7-d6d4-4898-a709-a3445d720c64","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"Patrick’s","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:d1177b989cd3e5b14d5aa8556ae48b4b85411822cda29c365aa50ce42473f95d","observation_id":"58683096-75be-4e0e-8059-f610b1d9727a","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"w/ CIP Claughaun won the 57th edition of the Limerick Senior hurling championship after defeating St","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:cc5d1ad97c3f001ac73da973da4d115f67212f56d79f985448e0b1308d3cea18","observation_id":"676d3e1a-24d4-41b4-bdea-d2c9692c079c","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T08:04:29.580811Z","title":"MiniLLM w/o CIP Claughaun won the 63rd staging an went on to win the next four senior hurling championships","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T08:04:29.580811Z"},"links":{"citing_paper":"/paper/2607.08776"},"observation_digest":"sha256:4c4ad72d01292d8f75c98d79cad44b3f05e23e3602bf99a916845f7c834e1d48","observation_id":"e90b86a5-bb4e-442f-99e3-8f8cc6d75e96","resolution":{"observed_at":"2026-07-13T08:04:29.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08776","last_updated":"2026-05-05T07:24:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T10:29:11.110252Z","submitted_at":"2026-05-05T07:24:01Z","title":"A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.08776."}