{"as_of":"2026-08-17T18:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f115638eaaf55f306e013f223efe0fce939b2fb8197d91be35e2578cae624936","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:14:33.817036Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.16056/citation-record","integrity":"/paper/2504.16056/integrity","json":"/paper/2504.16056/citation-record.json","paper":"/paper/2504.16056"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.210698Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.210698Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:7d0a81a3bdfd506f532d3806262a857aebd5d64fdad992cf8da4144c514b35e7","observation_id":"98b69021-97a2-44e2-9763-6abb1118bb58","resolution":{"observed_at":"2026-08-16T11:14:33.210698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.219284Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.219284Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:5319fd6d9ff840f5f741ef7f0e06bce09386057da1b68f9f14e81cd095ce42ae","observation_id":"b1812db4-a0bc-4667-ad44-fd6c7278b68a","resolution":{"observed_at":"2026-08-16T11:14:33.219284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.224801Z","title":"How many data points is a prompt worth?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.224801Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1d6c47900ac81272a0dc47975b1eeb50e05320cb4f7520f6f58e925777cc0605","observation_id":"f3966a9c-5b91-4152-b30a-b478383c6509","resolution":{"observed_at":"2026-08-16T11:14:33.224801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08484","last_updated":"2022-03-15T01:52:38Z","snapshot_observed_at":"2026-08-16T17:48:50.488927Z","submitted_at":"2021-10-16T06:07:59Z","title":"A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08484","snapshot_observed_at":"2026-08-16T11:14:33.230226Z","title":"A good prompt is worth millions of parameters? low-resource prompt-based learning for vision-language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.230226Z"},"links":{"cited_paper":"/paper/2110.08484","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:dcac9c4fcbd57d5af6fb97a907bd8615d4a942625b1a8ef91aa1b0472da5ea37","observation_id":"2f3a4864-4e04-447b-a013-b6613aa6a73b","resolution":{"observed_at":"2026-08-16T11:14:33.230226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.237630Z","title":"Orca 2: Teaching small language models how to reason,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.237630Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2960f45e9873cb5db54350544d56e4d85f49dd3c355aac018be3324c72edaad9","observation_id":"18db569c-24c1-45ec-bd85-31d81a8856fe","resolution":{"observed_at":"2026-08-16T11:14:33.237630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.243258Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.243258Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ad4e3d39cacd62348a1826c10961d1879e1b70af82e00e3e4f4676fda12359ba","observation_id":"88e77e2b-a18d-43a1-a0fc-3035525f1d79","resolution":{"observed_at":"2026-08-16T11:14:33.243258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.253840Z","title":"Tree of thoughts: deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.253840Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:163b669f10cbf512be98e179fce320c397701003b35c84dfa8f38b25c323f7bb","observation_id":"d769a000-8baa-4909-add5-02b14e90f632","resolution":{"observed_at":"2026-08-16T11:14:33.253840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16478","last_updated":"2024-04-25T10:03:14Z","snapshot_observed_at":"2026-08-17T06:16:46.131999Z","submitted_at":"2024-04-25T10:03:14Z","title":"Evaluating Consistency and Reasoning Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16478","snapshot_observed_at":"2026-08-16T11:14:33.262619Z","title":"Evaluating Consistency and Reasoning Capabilities of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.262619Z"},"links":{"cited_paper":"/paper/2404.16478","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:48910c5d931dbc020503462a5c6a917a90d85f9fefc68bb64a61c95a2e165061","observation_id":"40c8ec38-e37d-48a2-884c-197e34eba25c","resolution":{"observed_at":"2026-08-16T11:14:33.262619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.271377Z","title":"LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.271377Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ef1d3a1424201cc713365b6f37c7bc6f900e3fcfef87fc9c229e38bc14e4ddee","observation_id":"f3757aab-b2ac-4f54-8036-bfe20918ac78","resolution":{"observed_at":"2026-08-16T11:14:33.271377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.278489Z","title":"Towards a Mechanistic Interpretation of Multi-Step Reasoning Capabilities of Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.278489Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f505e2fb25cac6a29b2dbf139e0cbfcba97e0635f7e8e10b7b12224f980a9371","observation_id":"e19bff66-49ed-4f99-af76-1264f20f4c32","resolution":{"observed_at":"2026-08-16T11:14:33.278489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-16T11:14:33.286742Z","title":"Large Language Models: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.286742Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:a0d38448e4c955e2c7b94392d91b7d56d3d88da53d22b559c985173bf16ccb77","observation_id":"36bb8b42-14b4-4dbb-9604-457fedc2b329","resolution":{"observed_at":"2026-08-16T11:14:33.286742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-16T11:14:33.295471Z","title":"PaLM: Scaling Language Modeling with Pathways,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.295471Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:99bd04d55210b12e853e99d7218e7b0e4cef1686c38466a7989d8488e77c246d","observation_id":"d711e744-6740-4214-9a2a-d4fa81a14483","resolution":{"observed_at":"2026-08-16T11:14:33.295471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12136","last_updated":"2019-03-28T17:23:50Z","snapshot_observed_at":"2026-08-14T16:55:13.315157Z","submitted_at":"2019-03-28T17:23:50Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12136","snapshot_observed_at":"2026-08-16T11:14:33.305643Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.305643Z"},"links":{"cited_paper":"/paper/1903.12136","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4682649c940f4d416668dfd47bf836a37851bce8d9b7734292c3d51f711d6a9d","observation_id":"5f8d12ff-88b8-4e3b-ada2-ec0858bbe784","resolution":{"observed_at":"2026-08-16T11:14:33.305643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.312409Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.312409Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e827951a6d5ca3ed72e18b47eecc7cad0ad56838dcb24ff48da639f04f19f0bd","observation_id":"0c1b7307-c6b4-46b2-b806-67ef6513496a","resolution":{"observed_at":"2026-08-16T11:14:33.312409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.318425Z","title":"A survey on model compression for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.318425Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4f0e07425a545db44834e3c5d8c72b06daec8e81fe835e6e62b012182d05e4af","observation_id":"ae1240ab-bf61-4e4b-8bd5-08dac906f5d8","resolution":{"observed_at":"2026-08-16T11:14:33.318425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1062328","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.447187Z","title":"Robustness-Reinforced Knowledge Distillation With Correlation Distance and Network Pruning,","venue":null,"work_id":"4fed3811-eb6c-44ca-aa51-d99d58313679","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.330242Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6a431709da2f52edbebfefe9aa8bc55fcaf347e887f9a896bf1418836f9aab85","observation_id":"fc464acc-3672-4d20-8166-1b425735dad7","resolution":{"observed_at":"2026-08-16T11:14:35.465463Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-08-17T13:50:40.586963Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-16T11:14:33.335551Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.335551Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:a70d51ccbbdee97148a74b9e457c16eac55b6acae67c714abdea099a3c2304eb","observation_id":"205069e1-d13f-4f4a-bf81-09b72aac1138","resolution":{"observed_at":"2026-08-16T11:14:33.335551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1047552","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.313155Z","title":"PanDa: Prompt Transfer Meets Knowledge Distillation for Efficient Model Adaptation,","venue":null,"work_id":"1adbdfbe-5d57-4b4b-90c3-3e0cd0b435c7","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.343242Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6529398537ddc959932c95db75a4b4b4343b468a249905d88ef99f35a8c7cceb","observation_id":"dbdf1f77-978b-49a2-a739-23cf6e579ac4","resolution":{"observed_at":"2026-08-16T11:14:35.326248Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12586","last_updated":"2024-09-19T09:09:53Z","snapshot_observed_at":"2026-08-16T13:17:14.700018Z","submitted_at":"2024-09-19T09:09:53Z","title":"Efficient Knowledge Distillation: Empowering Small Language Models with Teacher Model Insights","version":1},"cited_work":{"arxiv_id":"2409.12586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12586","snapshot_observed_at":"2026-08-16T11:14:35.228051Z","title":"Efficient Knowledge Distillation: Empowering Small Language Models with Teacher Model Insights","venue":"cs.CL","work_id":"799b3cbe-21d1-46ad-9426-8d6aeb3f85c4","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.349173Z"},"links":{"cited_paper":"/paper/2409.12586","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ea3802822f6b86ed849b354c1ac9e5c3ecb288b2053131690560c28c905550f5","observation_id":"7be016a7-3828-4fea-b47e-b9df5de62d82","resolution":{"observed_at":"2026-08-16T11:14:35.235959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.694639Z","title":"Improve Student‘s Reasoning Generalizability through Cascading Decomposed CoTs Distillation,","venue":null,"work_id":"0a43ec2f-7b5b-4889-b403-9d8d6dba3444","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.355639Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4e3171a68e073a4eb10449de4e17f067a0eda5e416f603fb0e27db4c7617a745","observation_id":"7f2bdad9-662d-4356-9eae-b177258ab2b4","resolution":{"observed_at":"2026-08-16T11:14:36.701126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19737","last_updated":"2024-05-30T06:32:11Z","snapshot_observed_at":"2026-08-16T13:47:54.534279Z","submitted_at":"2024-05-30T06:32:11Z","title":"Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19737","snapshot_observed_at":"2026-08-16T11:14:33.362273Z","title":"Beyond imitation: Learning key reasoning steps from dual chain-of-thoughts in reasoning distillation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.362273Z"},"links":{"cited_paper":"/paper/2405.19737","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:24464323f97475ef2cd03e7a0d2f057d817a3cdc700875310c9d582e154521ae","observation_id":"6f514958-2a04-47f7-8def-6d790ed36f17","resolution":{"observed_at":"2026-08-16T11:14:33.362273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.676897Z","title":"One teacher is enough? pre-trained language model distillation from multiple teachers,","venue":null,"work_id":"b5ec37cf-0289-44e5-a3e7-2fa966778670","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.376497Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:5403743bbcd2fec783e55e92872028d317b4182db5b25bb05968fa47bb9c98ad","observation_id":"68424ea8-48fd-4ce2-8154-e08f800a1ae8","resolution":{"observed_at":"2026-08-16T11:14:36.682170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19737","last_updated":"2024-05-30T06:32:11Z","snapshot_observed_at":"2026-08-16T13:47:54.534279Z","submitted_at":"2024-05-30T06:32:11Z","title":"Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19737","snapshot_observed_at":"2026-08-16T11:14:33.370369Z","title":"Available: https://doi.org/10.48550/arXiv.2405.19737","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.370369Z"},"links":{"cited_paper":"/paper/2405.19737","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:5978fc195d4b6e9c9355d19db9828eb5ff4a1737ed25681f420c2689483114b8","observation_id":"32b23400-321c-4d2b-8556-6adc88e07744","resolution":{"observed_at":"2026-08-16T11:14:33.370369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.658066Z","title":"We’re getting a better idea of AI’s true carbon footprint,","venue":null,"work_id":"208951a6-4229-4838-9ac1-449ad8fcf8b8","year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.390193Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:201b00fbc75e5b9c5baf54030f490a301d1108a4fcfb24a2dbfe1ace6c38d71b","observation_id":"9d81e9cb-a2f6-4b01-a567-0d722665be01","resolution":{"observed_at":"2026-08-16T11:14:36.664620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.383447Z","title":"Distilling Large Vision-Language Model with Out-of-Distribution Generalizability ,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.383447Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f1c21a9e4f4787308ea90bcaabc672fd97c7307d0543912eb52c15eab337509d","observation_id":"2baef9c0-9ad5-4038-971c-bc99aadde51f","resolution":{"observed_at":"2026-08-16T11:14:33.383447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04751","last_updated":"2023-10-30T20:36:20Z","snapshot_observed_at":"2026-08-16T15:25:41.820556Z","submitted_at":"2023-06-07T19:59:23Z","title":"How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04751","snapshot_observed_at":"2026-08-16T11:14:33.401221Z","title":"How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.401221Z"},"links":{"cited_paper":"/paper/2306.04751","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c373e76b72b6da918028ae915cfc967412f9398876132fc91dfafea8cc636292","observation_id":"a5d1de52-e38c-4275-b0d1-b30bed9c1900","resolution":{"observed_at":"2026-08-16T11:14:33.401221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.635904Z","title":"Energy and policy considerations for modern deep learning research,","venue":null,"work_id":"54ae6f67-9b7e-4d23-80e2-b3cd9c7a76f9","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.395348Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:631608a9c7ed676f7deb4218387766bce5f7f2571d427833d7d1b9ce38bad78f","observation_id":"7b777eb8-5b55-4c68-be52-747a82cf7873","resolution":{"observed_at":"2026-08-16T11:14:36.642068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.617970Z","title":"Towards a rigorous science of interpretable machine learning,","venue":null,"work_id":"73e48a78-a069-4805-8d64-759ee4c57550","year":2017},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.415619Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:24d098b3c70467448f7d01d87b1f5f4370b28c1cf2e9b5f8285096019b8a1c0a","observation_id":"ef9a79be-8a3d-457c-90f4-63ee2fefb9ad","resolution":{"observed_at":"2026-08-16T11:14:36.623378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-16T11:14:33.409305Z","title":"Code Llama: Open Foundation Models for Code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.409305Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:d8f885396c33faadbe7b12aa99ac1cd0822be71841bc08cca7f25200388e0130","observation_id":"2f72d52e-be27-4dd7-9f02-6c71301c8668","resolution":{"observed_at":"2026-08-16T11:14:33.409305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04729","last_updated":"2025-01-09T12:44:44Z","snapshot_observed_at":"2026-08-16T14:28:43.936864Z","submitted_at":"2024-01-09T18:59:47Z","title":"Human Delegation Behavior in Human-AI Collaboration: The Effect of Contextual Information","version":3},"cited_work":{"arxiv_id":"2401.04729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04729","snapshot_observed_at":"2026-08-16T11:14:34.936955Z","title":"Human Delegation Behavior in Human-AI Collaboration: The Effect of Contextual Information","venue":"cs.HC","work_id":"5ed56bf0-f906-4c1a-9e27-88d4a70d22b3","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.429650Z"},"links":{"cited_paper":"/paper/2401.04729","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:8daeb83c03ff7f570cb2dbcc01e04c640377565b4ffd9f014cfc60b40bcddeae","observation_id":"a0859352-8950-41cf-87d8-d7c3542e2479","resolution":{"observed_at":"2026-08-16T11:14:34.945203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20873","last_updated":"2024-10-28T09:45:34Z","snapshot_observed_at":"2026-08-16T13:05:27.334848Z","submitted_at":"2024-10-28T09:45:34Z","title":"Explainability in AI Based Applications: A Framework for Comparing Different Techniques","version":1},"cited_work":{"arxiv_id":"2410.20873","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20873","snapshot_observed_at":"2026-08-16T11:14:34.978006Z","title":"Explainability in AI Based Applications: A Framework for Comparing Different Techniques","venue":"cs.AI","work_id":"e93a9085-1f0a-4d90-b7cf-0034632c20d3","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.422214Z"},"links":{"cited_paper":"/paper/2410.20873","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:381428332574e9f3ca7580167997842e7dfa7a96d751990d1982439c44eae259","observation_id":"f388cb98-012c-41db-b296-e006bdcb0588","resolution":{"observed_at":"2026-08-16T11:14:34.987158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.574976Z","title":"Multimodal explanations: Justifying decisions and pointing to the evidence,","venue":null,"work_id":"19d5905c-7a07-42b1-b03c-554e35ac9b1c","year":2018},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.444498Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:7ec8ea3a1a8540a812d7f25f2576b1c7f23c280504a042743aa45ac81a3bb601","observation_id":"68e86581-1138-47e4-bf33-abba4f572450","resolution":{"observed_at":"2026-08-16T11:14:36.582192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.596073Z","title":"Textual explanations for self-driving vehicles,","venue":null,"work_id":"6fbfb50d-d893-4194-b856-c1ed82ba6d2c","year":2018},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.436517Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:efce892be32e95e9ef7c99f667590b370f5567a2e89f4353da421a4bbb5d3c52","observation_id":"67acd858-bb00-4913-8335-0ff0bf6532d0","resolution":{"observed_at":"2026-08-16T11:14:36.603412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.550961Z","title":"SCOTT: Self-consistent chain-of-thought distillation,","venue":null,"work_id":"8cd09e0f-3fa7-497b-afd7-1476819419ef","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.457164Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4d6259f7fa06fa70267cfea6a1c76d931e26bfb9e13e0f82e3ed7c1f44abbdb8","observation_id":"24a31e83-23f5-48b4-8c34-884a9706401d","resolution":{"observed_at":"2026-08-16T11:14:36.557491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13566","last_updated":"2024-05-08T17:14:25Z","snapshot_observed_at":"2026-08-16T15:13:24.907276Z","submitted_at":"2023-07-25T15:19:36Z","title":"The Impact of Imperfect XAI on Human-AI Decision-Making","version":4},"cited_work":{"arxiv_id":"2307.13566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13566","snapshot_observed_at":"2026-08-16T11:14:34.904372Z","title":"The Impact of Imperfect XAI on Human-AI Decision-Making","venue":"cs.HC","work_id":"48d29be2-777f-4100-87f4-107a76f62340","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.451101Z"},"links":{"cited_paper":"/paper/2307.13566","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:503e856d517620766f3c068229cb9e77a8642e2adbe05d2d00606574d82f2d63","observation_id":"11020271-44dd-4c07-9a27-f2121b09e107","resolution":{"observed_at":"2026-08-16T11:14:34.911322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.528217Z","title":"GPT-NeoX-20B: An open-source autoregressive language model,","venue":null,"work_id":"32ab55dc-a4e9-47d3-b601-b38a93183dad","year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.470853Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9eb0bbe83ec5bbad96389aa4ef19509eea72310de48a0f442d4d2ef5d3b8ef99","observation_id":"e380decd-ef05-4d9c-bd54-89933584f5c1","resolution":{"observed_at":"2026-08-16T11:14:36.534008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T11:14:33.464536Z","title":"Constitutional AI: Harmlessness from AI Feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.464536Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:be1b4a3600bc1a893b789fc0bf5ad7e9829875ff84827364d01a1ffa7df47dca","observation_id":"d03cc4b7-2763-456b-9b92-07728ef5de20","resolution":{"observed_at":"2026-08-16T11:14:33.464536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.508160Z","title":"MiniLLM: Knowledge distillation of large language models,","venue":null,"work_id":"e41987a8-9108-489b-8631-bd75321761be","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.484866Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:a9c78297e83036f3ad5b46c95089e92d988eff35f92c6b0e3fde168473c7968e","observation_id":"8c5eeee1-4791-4d24-8e43-1c2e99c5ba13","resolution":{"observed_at":"2026-08-16T11:14:36.514086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T11:14:33.478311Z","title":"Distilling the Knowledge in a Neural Network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.478311Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:d060a07bbfaa42cab8f87870db7bcaddb718f2d8f5efd8943faa64de11596d61","observation_id":"1dfe0a89-dace-4aa9-9165-a5fb0cfba560","resolution":{"observed_at":"2026-08-16T11:14:33.478311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.08436","last_updated":"2020-03-24T15:09:17Z","snapshot_observed_at":"2026-08-16T01:20:01.294737Z","submitted_at":"2020-03-18T18:59:31Z","title":"Collaborative Distillation for Ultra-Resolution Universal Style Transfer","version":2},"cited_work":{"arxiv_id":"2003.08436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.08436","snapshot_observed_at":"2026-08-16T11:14:34.787684Z","title":"Collaborative Distillation for Ultra-Resolution Universal Style Transfer","venue":"cs.CV","work_id":"90f939ae-3a8d-410a-8883-0073fa503928","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.499036Z"},"links":{"cited_paper":"/paper/2003.08436","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:b76e9ba7fd479fa766e418ea4faf6dbe667a140cd844952d30a7beac4361e069","observation_id":"ed1622c9-09f0-4769-b435-72e85aa870fc","resolution":{"observed_at":"2026-08-16T11:14:34.794436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.487505Z","title":"ERDL: Efficient Retrieval Framework Based on Distillation from Large Language Models,","venue":null,"work_id":"a6474ba7-85fe-40fb-8a6a-f061a8b2f190","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.491419Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2eef501ea1e48e8c8dc305a677fb142bea811393081ea557a2099a5025b5ce10","observation_id":"e77b374e-b894-4c69-8e36-4e804050e515","resolution":{"observed_at":"2026-08-16T11:14:36.493565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.467795Z","title":"Learning Efficient Object Detection Models with Knowledge Distillation,","venue":null,"work_id":"1f5462da-aee1-493f-ba98-64ee42dacab6","year":2017},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.512642Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:46b81591c09dc8456bf0a55f61d69a96aa551dceab57da6500e7dec357ff9f43","observation_id":"4df334a1-f535-470c-8972-dd470626dbe9","resolution":{"observed_at":"2026-08-16T11:14:36.473530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04457","last_updated":"2019-05-19T14:13:37Z","snapshot_observed_at":"2026-08-14T16:33:57.659180Z","submitted_at":"2019-05-11T06:23:51Z","title":"Triplet Distillation for Deep Face Recognition","version":2},"cited_work":{"arxiv_id":"1905.04457","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.04457","snapshot_observed_at":"2026-08-16T11:14:34.754417Z","title":"Triplet Distillation for Deep Face Recognition","venue":"cs.CV","work_id":"68a24517-6e20-41aa-b828-adcd487fffef","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.505671Z"},"links":{"cited_paper":"/paper/1905.04457","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9b43f8c4282de275adab964e0f814e645ce1b96ea27359c1dfe952e99a946073","observation_id":"7258449e-ce62-4ddb-b21a-61a3e922586d","resolution":{"observed_at":"2026-08-16T11:14:34.760921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.448852Z","title":"Training Compact Models for Low Resource Entity Tagging using Pre-trained Language Models,","venue":null,"work_id":"b1c2db1d-ee99-4900-9bc4-eb3646e95557","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.526719Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1378c03ca8d3f0d81da47539dbc1fdca6c3fb295eae6710cacf9de44b95c8dfa","observation_id":"ff7ee1f4-7ecc-407f-a6f4-453edda60d00","resolution":{"observed_at":"2026-08-16T11:14:36.455034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-16T11:14:33.519953Z","title":"A Survey on Knowledge Distillation of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.519953Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:55678f74d28e6935a6a47f31cc18dbbfb1c74c887b631daccf6001416e4e369b","observation_id":"9b1ab665-5a3e-4740-aa82-e97f7594d065","resolution":{"observed_at":"2026-08-16T11:14:33.519953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.541136Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.541136Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1ec6a8b25562dcb3597e383502e3c9767142ac3d1079f09aea7dfef2109f5b5c","observation_id":"fae3d5ec-891f-44c9-8386-4323c85d1ab5","resolution":{"observed_at":"2026-08-16T11:14:33.541136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.533713Z","title":"On the effectiveness of adapter-based tuning for pretrained language model adaptation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.533713Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6dcc4b93a4a17be60a715fa38005f20efa5389bf001efc7e04e3f7bbf7dde728","observation_id":"076b0ddf-f35d-4b9b-abca-75a1a6637a35","resolution":{"observed_at":"2026-08-16T11:14:33.533713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.415462Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning,","venue":null,"work_id":"49e9f2fb-0d59-43dc-b2b8-54ac453dd1fc","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.563083Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:bd1ddb847ef0a4ea72483bfbfbb0c1d3a70bbb8d4621442b66d88ca13d766132","observation_id":"5a332118-3ebb-4b38-aba3-8ad410930bb6","resolution":{"observed_at":"2026-08-16T11:14:36.422585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1072951","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:34.612947Z","title":"Efficiency Optimization of Large-Scale Language Models Based on Deep Learning in Natural Language Processing Tasks,","venue":null,"work_id":"139087f2-38d0-46c1-bc7d-a3a2e8cb6c6a","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.570311Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:df2d31ae48ad7ff5657f02e445dfda4e8b433b6320dce952e37ce131cdca3cd8","observation_id":"829b6fe7-5bef-4449-b3d6-20d866f33253","resolution":{"observed_at":"2026-08-16T11:14:34.636249Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19486","last_updated":"2024-06-27T19:02:41Z","snapshot_observed_at":"2026-08-17T16:08:19.003097Z","submitted_at":"2024-06-27T19:02:41Z","title":"LoPT: Low-Rank Prompt Tuning for Parameter Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19486","snapshot_observed_at":"2026-08-16T11:14:33.555181Z","title":"LoPT: Low-Rank Prompt Tuning for Parameter Efficient Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.555181Z"},"links":{"cited_paper":"/paper/2406.19486","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2a2307b3676662d69d08c0b5fb89a75abe065eea9706f7763488d82668dc04b3","observation_id":"2726a0e4-0f88-476d-aebf-8984ffc4d260","resolution":{"observed_at":"2026-08-16T11:14:33.555181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.583008Z","title":"A survey on the explainability of su- pervised machine learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.583008Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:18242517fb959ccb229a3d5f46fc550d93029cc7b8def0a546e57251e961487a","observation_id":"23af0cdf-774c-438c-8714-91bc58b841d1","resolution":{"observed_at":"2026-08-16T11:14:33.583008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.349604Z","title":"Baize: An Open- Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data,","venue":null,"work_id":"7b76587e-b034-4a05-9ddd-bc4483c59e62","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.588971Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:3bcc2db0b027a545e93ea36b8119cd77f60f944412d2adc3b14e5c7dc53e7eb5","observation_id":"e0b18b51-2d2f-4dc3-b554-1c944bd67083","resolution":{"observed_at":"2026-08-16T11:14:36.356019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.390026Z","title":"Causability and explainability of artificial intelligence in medicine,","venue":null,"work_id":"066f47cc-cff3-4f15-85fa-05c2b115cd86","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.576472Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:04c233c670fb17bbef9aadeb33903e6d952d4e47ad15be740666c4926d26c367","observation_id":"128b23c6-9508-4834-8853-a7a723bfff32","resolution":{"observed_at":"2026-08-16T11:14:36.398035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-16T16:07:24.644844Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-16T11:14:33.602378Z","title":"Large Language Models Are Reasoning Teachers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.602378Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2c0923dc35a9562b936d9b965fecb8b52375bf32dc2d2ff24b6365839f55244e","observation_id":"76cbda5e-7e7c-45f9-9ae2-008253d7765c","resolution":{"observed_at":"2026-08-16T11:14:33.602378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-08-16T15:59:16.027349Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-08-16T11:14:33.611181Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.611181Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:d3d7ccb970a780be213b1a541e4033cb4781ad0b4c7a8c4c2f980de3abef2652","observation_id":"457fff00-8fc6-4855-97f3-8a2b0e7d16e3","resolution":{"observed_at":"2026-08-16T11:14:33.611181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.329917Z","title":"Teaching small language models to reason,","venue":null,"work_id":"6168f4ba-c959-4708-b8f9-41d8897b63c2","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.595210Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c71cd84d5affa43da6942cb91832956c952521d2511e7e408d8324d37ba8e37a","observation_id":"a1e58e14-d50d-4ebb-9a7d-0f3a7962c376","resolution":{"observed_at":"2026-08-16T11:14:36.334869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-16T11:14:33.623608Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.623608Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:503d7e61208f122ef8065abdb9eea3f434d17652bc25844a89fe7c60106a1172","observation_id":"8e6492d4-5e75-457b-a33e-4f4584da72e2","resolution":{"observed_at":"2026-08-16T11:14:33.623608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.312129Z","title":"Explain Yourself! Leveraging Language Models for Commonsense Reasoning,","venue":null,"work_id":"cfab4afd-fa22-4354-8f1b-2deab78887a9","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.630185Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:3f33967eaef9c4e1c5c32cbc1d49140f6d405eef4f460c5e54214b5cc4e589c7","observation_id":"13966246-99c7-4232-ac64-bfcc5916e6f7","resolution":{"observed_at":"2026-08-16T11:14:36.317871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1050762","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:34.458444Z","title":"Sci-CoT: Leveraging Large Language Models for Enhanced Knowledge Distillation in Small Models for Scientific QA,","venue":null,"work_id":"b41d775b-61a7-47ba-8cbc-f4d3a84e0a7d","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.618376Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6f5d05495f06f683ffa2af0b249e497bbc9d0f9b1fc05af7719719b965d6cb3b","observation_id":"0556d3fa-430b-4d1d-ba92-7e91b014fb34","resolution":{"observed_at":"2026-08-16T11:14:34.469818Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12434","last_updated":"2020-02-14T22:32:46Z","snapshot_observed_at":"2026-07-06T08:25:01.425019Z","submitted_at":"2019-09-26T23:25:25Z","title":"Learning the Difference that Makes a Difference with Counterfactually-Augmented Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12434","snapshot_observed_at":"2026-08-16T11:14:33.643474Z","title":"Learning the Difference that Makes a Difference with Counterfactually-Augmented Data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.643474Z"},"links":{"cited_paper":"/paper/1909.12434","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2a22ace311f26a331773ce33dfd819d68b095f223ed3f03b4d7fbf4566318c69","observation_id":"2e8d94af-f530-4c5b-9e07-3c4d058a8757","resolution":{"observed_at":"2026-08-16T11:14:33.643474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.276971Z","title":"Measuring Association Between Labels and Free-Text Rationales,","venue":null,"work_id":"51ab3e0b-0964-48e0-ad60-0eaa15f7ceb6","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.649662Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:d59f7fd0465dbc81fa109802ca1472245a957a77e2f53932c2cd965d945681f4","observation_id":"4ebb9732-bf28-439a-a787-f4e1514b22ba","resolution":{"observed_at":"2026-08-16T11:14:36.282778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.636237Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.636237Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1a12236ea54cbb6eda3be60569bea663fd1a823469bea3b94d0433eec6f26a3e","observation_id":"225e2463-0cf3-436e-beba-c3269bd93350","resolution":{"observed_at":"2026-08-16T11:14:33.636237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:14:33.660941Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.660941Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:dae87fb9020eb01944336326ca50b4bc18edafedd5efa475b2bbb988800b6d32","observation_id":"ac008d29-186c-4110-8306-28d05d17f829","resolution":{"observed_at":"2026-08-16T11:14:33.660941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.234279Z","title":"RLCD: Reinforcement learning from contrastive distillation for LM alignment,","venue":null,"work_id":"cd72ef1f-018d-436e-97c8-ed13e1a827dd","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.666797Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1928de488975bd660f56bfa5a54c82fbb3b3038535f4519722dd48949bb29fa6","observation_id":"8c144fd8-b7ff-4474-895d-920041793ea7","resolution":{"observed_at":"2026-08-16T11:14:36.240089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.256165Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge,","venue":null,"work_id":"29922526-c024-4f80-9a3c-8a14632468f1","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.655062Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:8b2e3cbfdcfaff2a4b0d79d032af255a30146f26ddeae344981d7faaca528ec1","observation_id":"00338ae6-a98f-43e8-b63b-8e589f616ace","resolution":{"observed_at":"2026-08-16T11:14:36.262504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.687221Z","title":"Transformers: State- of-the-art natural language processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.687221Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e097ab525e282477e504b2f091474fc35c04294ec2db87654ca6ca923ce7d9c6","observation_id":"9cca6e39-e9fc-45cb-94d1-cd1e82167214","resolution":{"observed_at":"2026-08-16T11:14:33.687221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.156971Z","title":"Generating visual explanations,","venue":null,"work_id":"34258814-310f-49c9-9fa8-edcb919c2ed8","year":2016},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.692926Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:40b264e972b834b2d998a21cabb43b813a38fc69a28664669e35cc46dacde5ab","observation_id":"c803238b-ad20-4141-b4cb-60ecf4a4824a","resolution":{"observed_at":"2026-08-16T11:14:36.164806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.215010Z","title":"Available: https://openreview.net/forum?id=v3XXtxWK i6","venue":null,"work_id":"1d95fade-73d5-4deb-9b88-5554d073f281","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.675136Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:10af8b1c8539a24d1af3cc523ddeec71b7cc5a8b36188effaeb3bf39746155e3","observation_id":"a63a36d2-7f36-4705-b61a-13668f557077","resolution":{"observed_at":"2026-08-16T11:14:36.220722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.195549Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"6af4736c-2e5b-420b-8e96-528bc0a39353","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.681286Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ef129c3cf317472d182e8c797bd6133c8192310ccd036e62f7062f5438128275","observation_id":"e399f061-52f8-41d4-8839-b75f29a21de7","resolution":{"observed_at":"2026-08-16T11:14:36.201963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.086455Z","title":"Exploring Evaluation Methods for Interpretable Machine Learning: A Survey,","venue":null,"work_id":"978641d8-b1e1-430d-96e6-137c53eb8797","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.719857Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:29d63ad4762a4d89ab660e1616247c51b29fed5f4a2025c2e324bebb47f1d775","observation_id":"25b23c66-30be-43f4-888b-61102579c7a2","resolution":{"observed_at":"2026-08-16T11:14:36.095461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.061292Z","title":"Evaluating the Quality of Machine Learning Explanations: A Survey on Methods and Metrics,","venue":null,"work_id":"ae9f7b66-ed44-4d1a-acae-08621e151aed","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.725446Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:5443c2bbe1341b248e0e4fe5ba3eed780843750454606a1923ec861350dd0ec7","observation_id":"38a404bc-869c-48f6-97b9-0020d1087550","resolution":{"observed_at":"2026-08-16T11:14:36.069454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.135301Z","title":"Prolific · Quickly find research participants you can trust","venue":null,"work_id":"2d34e22d-cedb-44bc-8fd9-3296439530cb","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.699384Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:b6a6bb2c8ec4b689d90dc3a6c7f512276a15f240f0b272ef9ae225614be87664","observation_id":"dc10041a-86fe-41c6-8535-0ecd00ef424d","resolution":{"observed_at":"2026-08-16T11:14:36.141145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.011901Z","title":"Oxford Learner’s Dictionaries | Find definitions, trans- lations, and grammar explanations at Oxford Learner’s Dictionaries,","venue":null,"work_id":"0f64ce68-fa74-4cbb-b8fd-00ce22b89663","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.737626Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f7e0d2102672cee2661e7df14b93ad3a370a35fcc338265bd7918836fd4551a0","observation_id":"600d2bdd-8c55-4ce4-bfab-a46d63be6a6b","resolution":{"observed_at":"2026-08-16T11:14:36.019173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12254","last_updated":"2022-05-24T17:57:55Z","snapshot_observed_at":"2026-08-16T16:57:58.765602Z","submitted_at":"2022-05-24T17:57:55Z","title":"Interpretation Quality Score for Measuring the Quality of interpretability methods","version":1},"cited_work":{"arxiv_id":"2205.12254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12254","snapshot_observed_at":"2026-08-16T11:14:34.153278Z","title":"Interpretation Quality Score for Measuring the Quality of interpretability methods","venue":"cs.CL","work_id":"ad65aedf-b739-413c-98be-f73605dfb4ab","year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.714226Z"},"links":{"cited_paper":"/paper/2205.12254","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6a757e9dfc5b5b4e3e11c9b95d01595be301675364366ca286152eb3538275bf","observation_id":"3d6068cb-7b34-457d-83f5-2b7b3bcd0778","resolution":{"observed_at":"2026-08-16T11:14:34.164010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.857633Z","title":"Machine Learning Interpretability: A Survey on Methods and Metrics,","venue":null,"work_id":"9b2358f7-2601-4274-ab96-04669edabd80","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.754508Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:b016da2b369f9d2578be588120f8ffd4d7f5e9496cc3ce831476ee08508efc6b","observation_id":"3fdea23a-9f9d-4a19-8025-a874fedfd1df","resolution":{"observed_at":"2026-08-16T11:14:35.884649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.818866Z","title":"Leakage-adjusted simulatability: Can models generate non-trivial explanations of their behavior in natural language?","venue":null,"work_id":"c330d54a-3fd5-4ecb-b596-71007b98bb61","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.761904Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e0b1b655323d763e0b6e31273359728647f37b4ddb277e14087bbdba58b6b0f5","observation_id":"0805957b-667f-482a-9030-00eefd64f05d","resolution":{"observed_at":"2026-08-16T11:14:35.827792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.039094Z","title":"REV: Information-theoretic evaluation of free-text rationales,","venue":null,"work_id":"5b58cfad-0272-49b9-9326-77fa3843ec25","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.730855Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:41fa5938f60bf079789c5ce8b781bf7e20e17bb5757d07aa01ada5ab92c53135","observation_id":"9f91952a-3cca-4886-b4d8-db24f7fb62e7","resolution":{"observed_at":"2026-08-16T11:14:36.046740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10059","last_updated":"2023-12-04T12:06:12Z","snapshot_observed_at":"2026-08-16T14:37:54.129627Z","submitted_at":"2023-12-04T12:06:12Z","title":"A collection of principles for guiding and evaluating large language models","version":1},"cited_work":{"arxiv_id":"2312.10059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.10059","snapshot_observed_at":"2026-08-16T11:14:33.967309Z","title":"A collection of principles for guiding and evaluating large language models","venue":"cs.CY","work_id":"c0d41a0d-4769-41ce-80cf-9e5f9d7a73a6","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.774376Z"},"links":{"cited_paper":"/paper/2312.10059","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:eb30d5aa0b300886b83e050ddf94e6f8f170326ec6460040f686d77405e21740","observation_id":"d339e3a7-ec55-4a88-ad0a-73714273e4a9","resolution":{"observed_at":"2026-08-16T11:14:33.976100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.941295Z","title":"Available: https://www.oxfordlearnersdictionaries.com/","venue":null,"work_id":"b630537f-fe50-4ad5-afd0-74237b5cdbe3","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.743200Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:cd165e37cdf078980da8b5c76fcb7de7ce18b2d012ba9ba7313988bd5b75db35","observation_id":"323866e7-6e58-48dd-97be-eb133c228396","resolution":{"observed_at":"2026-08-16T11:14:35.974511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.748684Z","title":"Measures for explainable AI: Explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.748684Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6467d39ead0d9cd78e503f6e08daf9291e47106b1593aa8ad5debdba29c9e47b","observation_id":"3ebabbc5-7f53-4593-b2dd-b92b6aead322","resolution":{"observed_at":"2026-08-16T11:14:33.748684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.795484Z","title":"Exploratory Data Analysis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.795484Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:7eb9413ab0c0ba56415cd84dd19f4948eb195ea2dc9c8234795d52fe1af0e710","observation_id":"0d4e0bf6-5dc3-487e-a5b4-8c3402e7de39","resolution":{"observed_at":"2026-08-16T11:14:33.795484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.716863Z","title":"Likert scales, levels of measurement and the “laws","venue":null,"work_id":"c44cdb31-7f4e-4406-ba7b-2c8de3687e97","year":2010},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.802601Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f4c6a60934d078fabf13aff66e4d549ed24c8faf923aeab1c4e17a7f40741f51","observation_id":"3887b22d-771c-477c-8fa3-19ed49b8bfd4","resolution":{"observed_at":"2026-08-16T11:14:35.726383Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.767813Z","title":"Measuring the Quality of Explanations: The System Causability Scale (SCS): Comparing Human and Machine Explanations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.767813Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e01c38d03012eb7010106b6cb847e37814829741ce6ddbab23e4e647f92eac40","observation_id":"abc4232b-48fb-4a5f-a94a-b64a6411855a","resolution":{"observed_at":"2026-08-16T11:14:33.767813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.691474Z","title":"A Critique and Improvement of the","venue":null,"work_id":"cf799334-7b45-4821-b0e9-a2fc877414ab","year":2000},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.817036Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:8f1c98322631b01d8fb1ef2f0070aebcd350221a99f270304de89b448da30222","observation_id":"c8523882-fc5c-4cef-b152-c000da61d6f0","resolution":{"observed_at":"2026-08-16T11:14:35.701353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.790109Z","title":null,"venue":null,"work_id":"c0c75ddb-9a23-4893-973c-e1d75f5fd95e","year":2008},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.781525Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:761395a05a52979ac2c5ab0dc85343abaf2742d843cc09bf62748bcec8d2cb39","observation_id":"6c757055-83d5-4cc2-95ec-1101625928ac","resolution":{"observed_at":"2026-08-16T11:14:35.796676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.746062Z","title":"Bhattacherjee, Social Science Research: Principles, Methods and Practices","venue":null,"work_id":"d84280a3-a973-4957-bc01-c2ae50582ea3","year":2012},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.788564Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:642d243e0185ba7651dae0c643844efe19602914fb13eaf8847ff0f0f9230d36","observation_id":"cf7422d9-6280-4b3d-bac9-58cef8b52da9","resolution":{"observed_at":"2026-08-16T11:14:35.760885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.809214Z","title":"Nonparametric Pairwise Multiple Comparisons in Independent Groups using Dunn’s Test,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.809214Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:21a8aad221bee96be70871dfe12d1f73a8cc6ded00c9431489e96d76673a29bf","observation_id":"a9d35239-64ad-4710-94e2-32d6b5fc3f7c","resolution":{"observed_at":"2026-08-16T11:14:33.809214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T11:14:33.547063Z","title":"Available: https://arxiv.org/abs/2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.547063Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c23b1e32f9ecaea28160d7e86d71c53e4e29b70f9c7b965223b38905c29176d2","observation_id":"5e509fde-6c7c-4448-9ebc-7f118718c2d1","resolution":{"observed_at":"2026-08-16T11:14:33.547063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.114150Z","title":"Available: https://www.prolific.com/","venue":null,"work_id":"b92b4324-ba64-413b-9397-429371bd9679","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.706941Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:421f0eb0e256dc56f93fb55d94d57cd2d7e464b508ab7f8dad7e3821055f884a","observation_id":"1bdaa55b-5841-4e5e-8125-86452fe0a676","resolution":{"observed_at":"2026-08-16T11:14:36.121111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.713678Z","title":"Available: https://aclanthology.org/2024.tacl-1.85/","venue":null,"work_id":"2f99e64d-622f-4e08-a420-9423aaa773b6","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.324532Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:903fa3916f266d0bbc8d165d078f3e39e127dafc5b1bb8546c64e82e6107d00c","observation_id":"07ded7da-bf85-45ac-bbfc-2168717e6cdf","resolution":{"observed_at":"2026-08-16T11:14:36.719529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T18:34:56.758952Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":12,"verified_fuzzy":36},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2504.16056."}