{"as_of":"2026-08-09T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c91341faac752b7d42925573da4f8230e2ca1ed9dfc9f51f44afe56d19e8dec","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:18:00.945501Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T03:11:23.755739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:36:55.530603Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.11120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11120","snapshot_observed_at":"2026-07-02T11:36:55.530603Z","title":"arXiv preprint arXiv:2506.11120 , year=","venue":null,"work_id":"d56ed360-e3e8-4d49-a5b4-621eeea9984d","year":null},"citing_paper":{"arxiv_id":"2606.05538","last_updated":"2026-06-04T00:43:20Z","snapshot_observed_at":"2026-08-04T07:21:00.293449Z","submitted_at":"2026-06-04T00:43:20Z","title":"Less is MoE: Trimming Experts in Domain-Specialist Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T03:11:23.755739Z"},"links":{"cited_paper":"/paper/2506.11120","citing_paper":"/paper/2606.05538"},"observation_digest":"sha256:f5b0be0ace7580723d0513d5be8d21111b0dac9e0c247c3e48f5254676be1914","observation_id":"a9f89fff-61e2-4123-91c0-10afe46d1e92","resolution":{"observed_at":"2026-07-02T11:36:55.532074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11120/citation-record","integrity":"/paper/2506.11120/integrity","json":"/paper/2506.11120/citation-record.json","paper":"/paper/2506.11120"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T05:18:00.602279Z","title":"The falcon series of open language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.602279Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:51d1eca699ae44d22f40fadd1c542302ff6f4b3618a8de79a676587e4f8b9b5c","observation_id":"8812d6d3-7c5e-40da-bfcc-9d79c5dbb4b9","resolution":{"observed_at":"2026-08-07T05:18:00.602279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.824607Z","title":"Croci, Marcelo Gennari do Nascimento, Torsten Hoefler, and James Hensman","venue":null,"work_id":"a57ee492-a074-4b7b-8d62-c295cc4c9cde","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.614868Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:bf9b1fa2c98f5769181ab0609eaffc6ad3cb7645f80d819026f36570932c03eb","observation_id":"e7b9fcf5-bad2-4041-9c7b-a2624ddeca42","resolution":{"observed_at":"2026-08-07T05:18:01.830614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.808086Z","title":"Qwen technical report, 2023","venue":null,"work_id":"006896e6-f8bc-4360-b625-7c2b18b891ee","year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.622330Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:0e2bf4836d72df10807207efbd37aca979c88503191c60f54a4c69d270fb76fc","observation_id":"625657ed-3f20-46a8-bea3-6a25380d045a","resolution":{"observed_at":"2026-08-07T05:18:01.813948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.630472Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.630472Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:847ecbf183c558d7a3564de0187001a9675383b7ea542bdc8aa0995f6f9f2d4f","observation_id":"e2f66436-8a7b-454e-a4be-f38f3def90df","resolution":{"observed_at":"2026-08-07T05:18:00.630472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.636791Z","title":"Piqa: Reasoning about physical common- sense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.636791Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:1e65244ff60de4290af01e841df7e5f947936b90aa62d82cba2a4221b800cff8","observation_id":"25aaba19-f0c7-4f21-afb6-b08f48dce34e","resolution":{"observed_at":"2026-08-07T05:18:00.636791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.772512Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"4faa38f6-7b4e-461e-807f-123c4a552d25","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.643358Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b56ef03432a7d9f53ef93ac01299392ca5e7d75c0eafe334089028700a96de96","observation_id":"1659951e-c763-42b4-8953-62918b8564d7","resolution":{"observed_at":"2026-08-07T05:18:01.777533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T05:18:00.653277Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.653277Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:6f0251a797858fb82bd5fdc2bfc9537eeb462dc980509339313b6b5645a59f8c","observation_id":"18aa9670-509f-44fa-a0cb-9a964110588e","resolution":{"observed_at":"2026-08-07T05:18:00.653277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04902","last_updated":"2024-04-08T22:42:49Z","snapshot_observed_at":"2026-07-30T16:56:04.978117Z","submitted_at":"2023-11-08T18:59:54Z","title":"Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04902","snapshot_observed_at":"2026-08-07T05:18:00.659057Z","title":"Beyond size: How gradients shape pruning decisions in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.659057Z"},"links":{"cited_paper":"/paper/2311.04902","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:2aae5133712bb7568d9e96524008ac85583fc26da1a7df66ee86ae9f10865e02","observation_id":"b3033720-e6be-482f-9e37-2aab8f6bb45d","resolution":{"observed_at":"2026-08-07T05:18:00.659057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.756663Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":"a21b427b-4c76-4d2d-ac52-430c801b0c60","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.666262Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:9277fe9d21d3e207968d77aff2dcf41fba4df166da56407d4d44044a340aa03a","observation_id":"a3a9c799-9d89-42b6-bf63-1e444515cd7e","resolution":{"observed_at":"2026-08-07T05:18:01.762396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.672644Z","title":"Optimal brain compression: A framework for accurate post-training quantization and pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.672644Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:773d477ea89c9a93659ad8d2c774b8b1404dfc0f14ec825700066aba6b4d2b76","observation_id":"a808ac6d-bae4-4ff6-b991-34dfee1ac399","resolution":{"observed_at":"2026-08-07T05:18:00.672644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.677706Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.677706Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b0c255aaca4db2239462a753295804989fee1e4bc96340869805716386f8526b","observation_id":"6ce87ca3-bea8-44ba-b5fa-161a1611014a","resolution":{"observed_at":"2026-08-07T05:18:00.677706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.684957Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.684957Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:e1f6b3d87b4c0eedc1be517c2f894611595b3ee76343aaa8c36cb2c01595aaab","observation_id":"e292cc65-18ce-42d8-8cd5-bd0b839af4f8","resolution":{"observed_at":"2026-08-07T05:18:00.684957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.692310Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.692310Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:a7249aa40bbdd2f06fef0bdf95482167af88469b3b97c21348f576761788cfbe","observation_id":"acd6ca35-4a99-4286-8e0b-f0d78b5c9c7d","resolution":{"observed_at":"2026-08-07T05:18:00.692310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.701312Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"b3f2253e-ea8b-4820-acd8-0491d2dbb989","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.701411Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b1afe405744608ac5026139c56e79b33fb80aff05c482ae33c923e00f15a77c7","observation_id":"8203a861-e8d9-44a2-b227-cb706533c4b0","resolution":{"observed_at":"2026-08-07T05:18:01.706038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.684204Z","title":"Functionary","venue":null,"work_id":"bc426a6d-211e-4c75-ae10-ddd635647620","year":null},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.710063Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:14f48ec598f33befac648e998545c82355f4b116b7968ec90e84d68c87b4d9da","observation_id":"1a70383c-f310-42fe-bf5e-62a421024e46","resolution":{"observed_at":"2026-08-07T05:18:01.689484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05015","last_updated":"2023-10-11T01:46:35Z","snapshot_observed_at":"2026-08-09T09:54:12.275399Z","submitted_at":"2023-10-08T05:16:28Z","title":"Compresso: Structured Pruning with Collaborative Prompting Learns Compact Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05015","snapshot_observed_at":"2026-08-07T05:18:00.717102Z","title":"Compresso: Structured pruning with collaborative prompting learns compact large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.717102Z"},"links":{"cited_paper":"/paper/2310.05015","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:d46300c28d5bb43e8c796c5ad74f49e4985f5f8ca68faa4376263029c90cb732","observation_id":"13c54924-4a5c-49da-ab09-b2bef57572b6","resolution":{"observed_at":"2026-08-07T05:18:00.717102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.667896Z","title":null,"venue":null,"work_id":"d4ae9b34-0018-4b35-8a59-655e1c04fb77","year":2015},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.729424Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:78ac23d68e8fd4bf288a5a97e3e3bd18ace36e6c431223fab019f96cb1addee2","observation_id":"cdddbc22-358d-4b2e-8324-6bb8e0923b03","resolution":{"observed_at":"2026-08-07T05:18:01.672515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.735598Z","title":"Optimal brain surgeon and general network pruning","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.735598Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:9e37b3a6405bed042417a734735060f4347afa8d7d9b315ce5671319bfda5683","observation_id":"7112f5ed-55fd-439d-b134-248144c36fec","resolution":{"observed_at":"2026-08-07T05:18:00.735598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.642864Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":"28dc3252-2927-46e7-81d0-1346fb1b6c2f","year":2017},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.743612Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b301b2c512be3672848bea3e5ab31a69cd0b256cd030275b0d8a71a1c5889635","observation_id":"db8abe49-b88e-4662-b869-e79f8f769d9d","resolution":{"observed_at":"2026-08-07T05:18:01.647842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.626834Z","title":"Optimal brain damage","venue":null,"work_id":"8836304b-4dd3-4397-9d68-369158eece08","year":1989},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.749932Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:1b4e4473651e5b14711dc9ab5ea0851c3aec7e99a8f167eb15d086361daa84c0","observation_id":"1ab74062-8c34-4389-b535-f339ec49b91f","resolution":{"observed_at":"2026-08-07T05:18:01.631729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.609052Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":"155c1031-b02b-414b-8915-4b95bbd7b254","year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.757400Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:eaf772cf55ad8d47a6efcc87ac6550b8cbf196b8382b2c23b6478931d7a86263","observation_id":"20deb705-1069-49d0-8185-30a97ac91cfc","resolution":{"observed_at":"2026-08-07T05:18:01.615735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-07T05:13:11.135540Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-07T05:18:00.764648Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.764648Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:0078b7258a1ea3e6b1717343d66d20164e00ca9649bacfea7bf5bc7667481c9f","observation_id":"6e33137f-c3f4-4600-a6ad-f2b8f83dc5af","resolution":{"observed_at":"2026-08-07T05:18:00.764648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.772997Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.772997Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:ea4e473c6418bf649414e565ba9c090d3a6ed9242457ff603cb98faf2bee3856","observation_id":"12bc2919-2ee0-421a-9fde-c11ed2675af0","resolution":{"observed_at":"2026-08-07T05:18:00.772997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.578529Z","title":"OpenELM: An efficient language model family with open training and inference framework","venue":null,"work_id":"f3ee5e5c-3e4a-49f2-b2e8-2fa010faf497","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.779379Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:ac8a9d4ff29be10bda1763f029407a2f122b2db976280e3330bae813477d7bc2","observation_id":"a9981811-6034-4088-a6bf-49cddfa8b35a","resolution":{"observed_at":"2026-08-07T05:18:01.583411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.785284Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.785284Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:6ea6c0b5626de9713323e803b4e7c2141c89e2b480122765cd46b39eb6484f33","observation_id":"76dda036-8239-434a-937c-789b849a60a4","resolution":{"observed_at":"2026-08-07T05:18:00.785284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.552675Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"b3235bb4-516b-4df1-8488-54e3d9891f06","year":2018},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.790067Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:34632a96dc4df102d22941839801d866f0d95d53a26519e9df2acc0fcb51bdc1","observation_id":"d8c25c6e-1fa4-4092-b4cd-4b61e61023e5","resolution":{"observed_at":"2026-08-07T05:18:01.557452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.536342Z","title":"Importance estimation for neural network pruning","venue":null,"work_id":"7cd11679-caf1-4d4e-988f-59c2ed6b4517","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.795500Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:a7cdb281fca6a69cfbad354ef400c7ad93ec0c7d046d1580029ca54656768e34","observation_id":"d9673bc7-7414-49cf-9e16-de23478d752e","resolution":{"observed_at":"2026-08-07T05:18:01.541531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-07T07:29:29.524604Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-07T05:18:00.800785Z","title":"Pruning convolutional neural networks for resource efficient inference","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.800785Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:827e174ea0622363a3910dbee70e30976ad7092f86db0d2446547b5171f99e21","observation_id":"7ba3b960-9222-43a0-8481-ec61c2ce9944","resolution":{"observed_at":"2026-08-07T05:18:00.800785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.517467Z","title":"Skeletonization: A technique for trimming the fat from a network via relevance assessment","venue":null,"work_id":"1f57fa39-2296-44ff-8434-be9190f71694","year":1988},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.807319Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:8444dfce4eb4165db358556cc557be3ebd9adb2cb9a8a9f435f4273c9f7f173b","observation_id":"eb1fd6d4-6c82-45b7-af3d-128aac6b52e5","resolution":{"observed_at":"2026-08-07T05:18:01.523255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.813987Z","title":"Compact language models via pruning and knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.813987Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:583c330f1c59ffb41908fe2b181b4075f285137c066c561b6d8eb66d7077e3db","observation_id":"08bbace6-84e0-48f8-853e-8cb4da6d71cc","resolution":{"observed_at":"2026-08-07T05:18:00.813987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.487495Z","title":"CrowS-pairs: A challenge dataset for measuring social biases in masked language models","venue":null,"work_id":"e229f8b6-9930-44f3-ac98-7674b0fc467f","year":2020},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.819573Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:ba3e27e6c75bb890ba900e8d02b5928c298f033682f8341f49903bd7c5a9e524","observation_id":"2ace9761-2f78-45b3-b806-09152f3e7cf2","resolution":{"observed_at":"2026-08-07T05:18:01.495252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.467347Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"5b1d8204-bf84-4321-83cf-bc4054425111","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.824828Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:67f4808188909af7c973b7264b3b2f9d904bdf8dc7af13a40d800b2d098920ec","observation_id":"b0dc668a-ebc5-4f60-95fc-22f0bf1e9ff9","resolution":{"observed_at":"2026-08-07T05:18:01.474197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.450259Z","title":"Revisiting self-distillation, 2022","venue":null,"work_id":"9b35b305-1969-433a-9617-c41e47626d73","year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.829627Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:5579bf44c5b2a6ed59d5b7482748d7df1bf84f0e2c7185bebf24a4be758da6c7","observation_id":"f1c0aca5-51f3-4f0e-9e81-b5c562c95525","resolution":{"observed_at":"2026-08-07T05:18:01.455223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.836703Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.836703Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:7115d35c0e056b0d448afe44309de8c9fae49622ae53a6e25160781e7da09245","observation_id":"0f9e8d22-86fe-4229-bb1d-1976fd5043be","resolution":{"observed_at":"2026-08-07T05:18:00.836703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.421006Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"827a2252-6528-4257-9ca5-47d038444ff3","year":2021},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.842031Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:2e7c5612b7c73853c724c74d819956fe35826c4f9ee0b1fb8d5324a25a2c7dfa","observation_id":"b2d7752f-b979-47ae-82c5-a04ed5ad0aa5","resolution":{"observed_at":"2026-08-07T05:18:01.426223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.402011Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"275ae3c6-fa2f-4671-b590-681ee4f1e843","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.848326Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b0ccf150b8acf95aa0e0f67523a89bb35dfdff57cce9f15e8307827c37d5eb3f","observation_id":"1a6d7fed-543b-404f-8482-084ce704ac35","resolution":{"observed_at":"2026-08-07T05:18:01.408252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.381189Z","title":"Amalgamating knowledge towards comprehensive classification","venue":null,"work_id":"d388fb26-2b66-44ac-9ee6-ca0f06822ba0","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.853219Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:701d6ecfb54e3cb5b9c880d67079928a8d30858561111d80efa40963b65c6047","observation_id":"e03ab5a8-29f2-4f77-9b17-149add4d7c1d","resolution":{"observed_at":"2026-08-07T05:18:01.386791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.361163Z","title":"Progressive network grafting for few-shot knowledge distillation","venue":null,"work_id":"db6ba54d-a820-4d3a-a2ad-5a502ba4d9a3","year":2021},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.858114Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:3b7169273252fbc5f6373b473542afc79e3e75ab61db65e1ac2f6e1e254a19e0","observation_id":"bcf4b02e-a27e-4fe3-bbf3-f208d0d07f30","resolution":{"observed_at":"2026-08-07T05:18:01.368161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.343360Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":"d326063c-bcb4-454b-bdbb-7f0b55937652","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.864548Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:a5cf357972a0bc24ee5bb7b7af8116ee369af106532d593756631c447fb9433f","observation_id":"81077838-92b6-4cd4-bdea-5fceb44c6939","resolution":{"observed_at":"2026-08-07T05:18:01.348763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07138","snapshot_observed_at":"2026-08-07T05:18:00.869557Z","title":"Learning compact vision tokens for efficient large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.869557Z"},"links":{"cited_paper":"/paper/2506.07138","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:aee926d21e6d56a2de8c0b34f20da380bf88b75114de7f4857ed5114cac539d1","observation_id":"c71ed3b0-259e-4ab7-9df1-52cbaf754290","resolution":{"observed_at":"2026-08-07T05:18:00.869557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16840","last_updated":"2024-02-26T18:59:03Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:59:03Z","title":"MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16840","snapshot_observed_at":"2026-08-07T05:18:00.874995Z","title":"Mobillama: Towards accurate and lightweight fully transparent gpt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.874995Z"},"links":{"cited_paper":"/paper/2402.16840","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:d25c3af1980892b49656a49e497ad0e20569fddcde9e58b5111a2dec50afaef6","observation_id":"7aa2ad72-1f46-46ef-a88e-45072a432edd","resolution":{"observed_at":"2026-08-07T05:18:00.874995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.324608Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":"d8d56705-1340-4d8b-9049-fb7e5ed354b0","year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.882942Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:7a418a4d8dfa54b56f688b9731550a176cc99b241f43d5e29a84740cf4530c88","observation_id":"78e6679a-bcb9-4277-bb50-f42df4b913bc","resolution":{"observed_at":"2026-08-07T05:18:01.330822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.306775Z","title":"LaMini-LM: A diverse herd of distilled models from large- scale instructions","venue":null,"work_id":"85b66c95-dd44-4747-91c6-fb5b616a5562","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.889575Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b3a4f776e0e29f9a0f9d9f60bb8f73579a3d9f15b405c9f4755c86455457f8f6","observation_id":"f1264099-5f0f-4388-9fc6-83c208d9a2c3","resolution":{"observed_at":"2026-08-07T05:18:01.311997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.287506Z","title":"Sheared LLaMA: Accelerating language model pre-training via structured pruning","venue":null,"work_id":"c736abea-9f3f-4d81-b4c4-15c871639913","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.895291Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:75c03d22b5e306c0a8a58431571b87406dd0ae930f763901e1c6415ea5db3a28","observation_id":"2915fee0-4dd4-4b65-a4df-9352a3f62240","resolution":{"observed_at":"2026-08-07T05:18:01.294103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.267235Z","title":"Outlier weighed layerwise sparsity (owl) a missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"6740a1de-6ffe-4352-8000-50c82eb9c5d7","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.901101Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:51effad676b1612575a63d69e6408561378b4b1366e03b03821373870e3b6af8","observation_id":"98954a94-d164-4709-b0a1-40f41b39c9ff","resolution":{"observed_at":"2026-08-07T05:18:01.272457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.247695Z","title":"Be your own teacher: Improve the performance of convolutional neural networks via self distillation","venue":null,"work_id":"8d0ae950-8b9e-4b6d-b29c-02c5f41023b1","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.908459Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:c31857492f882ca9d72e0a494738ed4ead01d54c6f5a362daf902309e7f17cbc","observation_id":"cea5167b-bad2-4919-98df-f348459342ec","resolution":{"observed_at":"2026-08-07T05:18:01.254986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.223879Z","title":"LoRAPrune: Structured pruning meets low-rank parameter-efficient fine-tuning","venue":null,"work_id":"28572d80-c003-4674-bb65-da3593fa287d","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.913433Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:286c06ef43e8eafefa6ac45c60c80c651db062b11dbf319c02e86793292958ec","observation_id":"126ed860-7599-41b3-81ad-f350f9cc52a3","resolution":{"observed_at":"2026-08-07T05:18:01.229170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.932104Z","title":"Tinyllama: An open-source small language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.932104Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:2ebb491147d321c262d4f322e6fb2be666b7a26f73a8a651392f1bf5bf159984","observation_id":"113da4f3-6025-4798-986d-88977a3da9f5","resolution":{"observed_at":"2026-08-07T05:18:00.932104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.179756Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":"8032e6b8-b11f-4be1-8534-ac73ff120c29","year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.945501Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:96c37ed6125ce55b142ec09b827ae697815af9b808046311415f492664d73bb6","observation_id":"b06d7cf2-3449-43c7-80dc-d9f2e60b725e","resolution":{"observed_at":"2026-08-07T05:18:01.186968Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.922317Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.922317Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b7e9e1a4510fbfaeb33d9c8dbe01cae6c0d7109988f7448423a90e97abd765ce","observation_id":"597da13f-ac1f-4420-88ae-2531553071de","resolution":{"observed_at":"2026-08-07T05:18:00.922317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T05:10:26.719939Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.11120."}