{"as_of":"2026-08-13T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80f0f579e077c3f72bc6a74d683fb8454c2fffab8f00afac579f119b6d6976be","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:38:52.024717Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15281/citation-record","integrity":"/paper/2411.15281/integrity","json":"/paper/2411.15281/citation-record.json","paper":"/paper/2411.15281"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.774537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.774537Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:775499be3c7694a19eb346b9f217016a6752fd152bc60f81ddb19a0571f91354","observation_id":"f3d4b98e-6203-4ea3-84f8-481944c31916","resolution":{"observed_at":"2026-08-12T14:38:51.774537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.778052Z","title":"Fluctuation-based adaptive structured pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.778052Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:30dde750ba36e8702e82e3d5919340cdec01b9a2666734d8ad82bb3f9dd5324f","observation_id":"6e161dd6-471d-400d-a50f-9a5dba66d90e","resolution":{"observed_at":"2026-08-12T14:38:51.778052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.780823Z","title":"Dynamic context pruning for efficient and interpretable autoregressive transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.780823Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:a88bfc12b5e73371d85b0ba0f6f9d4f1c44120a0fa6aa9241924e1223d759cb1","observation_id":"02aab24a-4e03-4b51-b3af-43518215b7cd","resolution":{"observed_at":"2026-08-12T14:38:51.780823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.783833Z","title":"A general language assistant as a laboratory for alignment, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.783833Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d0ec44d7fe40ba82e595c923944831bb507f6e4e244c0aa57ba43db3a6012b42","observation_id":"b49bea46-440c-4585-bf77-5a4d907f760d","resolution":{"observed_at":"2026-08-12T14:38:51.783833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.787009Z","title":"Mitigat- ing open-vocabulary caption hallucinations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.787009Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:a1f46b7e74990462d5e5bbf1f92a6028333ca536c54466aa69dcc96fdbd3cf7b","observation_id":"d4aa84aa-226c-415f-94ac-a90b796e9a9c","resolution":{"observed_at":"2026-08-12T14:38:51.787009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.790132Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow, March 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.790132Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d7eb627fce46540e0fdaddd05c293a1b19eb6de07d0c24016a7e06145da1218e","observation_id":"bac38b26-ef54-4f65-9184-f54dbebf4816","resolution":{"observed_at":"2026-08-12T14:38:51.790132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T14:38:51.793216Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.793216Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:4817e9a7a6597ac05aedc6dab74577225324a344b5a143afcba6feb523e12513","observation_id":"dfd730a8-8e37-4c5e-9891-b058b4c1b3cf","resolution":{"observed_at":"2026-08-12T14:38:51.793216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.796341Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.796341Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:2077ace9ad893693600273246a63474f2c03f019ac9fb8d6d7c20a0389616f15","observation_id":"b91a4d79-f0b6-4bf1-a0bb-ffe534159e3a","resolution":{"observed_at":"2026-08-12T14:38:51.796341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.799238Z","title":"Vision transformer slimming: Multi-dimension searching in continuous optimization space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.799238Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d87658ac0d799c5a366e6c9b4772492c79d87cc051ebd6d031e6d3645dbc10c7","observation_id":"92479429-200b-4edf-9fc0-11b80eed0654","resolution":{"observed_at":"2026-08-12T14:38:51.799238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.802481Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.802481Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:0ddade242854f23aefd74de27b2470673b517d90e148b4b4322636afdee9f840","observation_id":"b13b73c1-4e1b-42e8-b792-8ebfafee7847","resolution":{"observed_at":"2026-08-12T14:38:51.802481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.695112Z","title":"The lottery ticket hypothesis for pre-trained bert networks","venue":null,"work_id":"ffdd7add-f411-4ae8-bd5b-3ddc2e6bc061","year":2020},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.805518Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:43ec4298b8516f428789dfc5dec8f459400eb666eb3abba7bb547051a21ed892","observation_id":"01cc1d15-c44a-4cdf-a841-8966e90133a5","resolution":{"observed_at":"2026-08-12T14:38:52.698529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.686023Z","title":"The principle of diversity: Training stronger vision transformers calls for reducing all levels of redundancy","venue":null,"work_id":"e3c0ee0d-ae87-43f7-b976-e690a9149520","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.808327Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d6a1c08004e3cefecd6417c89b78411b9afa18821bcf97586dd00cbba612059f","observation_id":"f86d788e-745b-4e07-9c79-257d048ac7ca","resolution":{"observed_at":"2026-08-12T14:38:52.689473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.678194Z","title":"A toy model of universality: Reverse engineering how networks learn group operations","venue":null,"work_id":"f77c7202-1389-4807-8f7f-b50ec3d9e26a","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.811213Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:01b7923efcda1b3e12645d9cf13f1b28c201ea79e6c1dbc430bacb80e98d9ba1","observation_id":"fee15ab5-e6a7-492a-9566-7a05fb5d132d","resolution":{"observed_at":"2026-08-12T14:38:52.680942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T14:38:51.813816Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.813816Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d1b94a36d91fc97f6bae9820a686bb8790e7ba957512cc1a1ee63943aafcfd3b","observation_id":"dd75c708-4a6f-4750-a7f1-62719a01e8af","resolution":{"observed_at":"2026-08-12T14:38:51.813816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-12T06:03:03.703202Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T14:38:51.816837Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.816837Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:fc20500fe328e348eb7b028354caa9fbeccaf14e78e8ae49e1489655eabed3a2","observation_id":"3996ee05-cad3-4b1d-bff1-23af3959df71","resolution":{"observed_at":"2026-08-12T14:38:51.816837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04010","last_updated":"2020-10-06T11:45:07Z","snapshot_observed_at":"2026-08-12T18:20:31.046711Z","submitted_at":"2020-04-08T14:29:23Z","title":"Analyzing Redundancy in Pretrained Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04010","snapshot_observed_at":"2026-08-12T14:38:51.820203Z","title":"Analyzing redundancy in pretrained transformer models","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.820203Z"},"links":{"cited_paper":"/paper/2004.04010","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:6c21dc77b9ee7484b903d60b2e2540dfe555d92f0ea9081d360524aaa6d4d755","observation_id":"fbb301ab-1bab-4673-8ae0-54f5dd6d3740","resolution":{"observed_at":"2026-08-12T14:38:51.820203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.822860Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.822860Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:f5c603722112ac9b7a2f5e1ae6954bbab6b9f91f784d10943c4cad43a354cec2","observation_id":"5538669b-0403-47af-876a-931014f27133","resolution":{"observed_at":"2026-08-12T14:38:51.822860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.825418Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.825418Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:3e9b26e3ce69630dd14eac37f7086327b918287604d8db874a0b48b167f818d6","observation_id":"650b0c88-dbfe-41b6-b3cb-405e0417c8d8","resolution":{"observed_at":"2026-08-12T14:38:51.825418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.659902Z","title":"Eventful transformers: leveraging temporal redundancy in vision transformers","venue":null,"work_id":"8c7f92fa-e3a2-44c4-a1c3-7bb8ae0fc219","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.828153Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:669ba5b00f81b6f9637b909a4c16e1884acdbe95ba46fdbf41eb2a0458241146","observation_id":"f9609917-7f82-4be9-a255-a1b9eef0f188","resolution":{"observed_at":"2026-08-12T14:38:52.663161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.830907Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.830907Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:b5cb3b63321ad1315a92a0e346847f46cc7f49f5374f7a9fdc60ff7be305d2cc","observation_id":"a1f76e72-8720-422c-a01e-9072164333cf","resolution":{"observed_at":"2026-08-12T14:38:51.830907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.833616Z","title":"Depgraph: Towards any structural pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.833616Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:1c2726fdf6ea8543ab7b0f8eb84b2ac29a4c266d6c9db158449c5079b6e481cb","observation_id":"199df78c-ee4c-4a08-bc03-183021e11d32","resolution":{"observed_at":"2026-08-12T14:38:51.833616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.836416Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.836416Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:cc4bf6f0947301ac213c1a11ea935755d087f77f7a45b1f731de3adeee9532b0","observation_id":"4907c096-c9f4-4529-82a1-5959b9676cdd","resolution":{"observed_at":"2026-08-12T14:38:51.836416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-12T14:38:51.839216Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.839216Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:b5b6283e3a7b3cb3fc9c99a2e9fad1612d22c5a6d3f20844db42b44342e3083a","observation_id":"7e1c5090-53ce-408f-834f-467a84021cfa","resolution":{"observed_at":"2026-08-12T14:38:51.839216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09230","last_updated":"2023-12-14T18:55:47Z","snapshot_observed_at":"2026-07-06T17:02:01.491624Z","submitted_at":"2023-12-14T18:55:47Z","title":"Successor Heads: Recurring, Interpretable Attention Heads In The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09230","snapshot_observed_at":"2026-08-12T14:38:51.842513Z","title":"Successor heads: Recurring, interpretable attention heads in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.842513Z"},"links":{"cited_paper":"/paper/2312.09230","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:f2b820366f542a71090e2b15072357158e3ff9511938a523c34df207aa89de50","observation_id":"a0ba1185-ab48-45e3-9583-0794cbcd0c7e","resolution":{"observed_at":"2026-08-12T14:38:51.842513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.845580Z","title":"MiniLLM: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.845580Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:ce26e04dea2b50dcd8ace7259cd4a9ec1b2dfbe0800897bf9948c58bcb09b395","observation_id":"26169097-f8ff-4db5-af4b-4befc0b14ab3","resolution":{"observed_at":"2026-08-12T14:38:51.845580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.630849Z","title":"Learning efficient vision transformers via fine-grained manifold distillation","venue":null,"work_id":"c01cedd7-4fe6-4269-a5e2-a81287f5d018","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.848506Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:82b87bafd60d1edbe881c3226caa268ed8863ae22a1df24fb0d80834192f407f","observation_id":"414e3cc2-5e12-4c2a-9203-cec92ff814e8","resolution":{"observed_at":"2026-08-12T14:38:52.634244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.850924Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.850924Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:c937115d88ef43fb98cd2d1b2e7e1e948a06b717d2e996be0e695cce799991f8","observation_id":"131feb79-a177-4bfb-a74d-01897e54cf75","resolution":{"observed_at":"2026-08-12T14:38:51.850924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-12T23:37:03.154590Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-08-12T14:38:51.853118Z","title":"What matters in transformers? not all attention is needed","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.853118Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:4cc0c7d230db179b1fa8e8f3cfa3768c0fbc9bd70f07e1a645c2aa5dca171d0e","observation_id":"7485a9dc-058c-473a-8750-49079323c695","resolution":{"observed_at":"2026-08-12T14:38:51.853118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T14:38:51.855575Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.855575Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:57e3b998d6cadee51114de70ea8b8980f3ad1a7e5ae1082afe7f38dd818ee0a4","observation_id":"eb07f159-3abb-4775-ac42-e7edb1f28aaf","resolution":{"observed_at":"2026-08-12T14:38:51.855575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08190","last_updated":"2023-01-16T22:25:58Z","snapshot_observed_at":"2026-08-11T10:55:18.333734Z","submitted_at":"2021-10-15T16:42:56Z","title":"Sparse Progressive Distillation: Resolving Overfitting under Pretrain-and-Finetune Paradigm","version":4},"cited_work":{"arxiv_id":"2110.08190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08190","snapshot_observed_at":"2026-08-12T14:38:52.310908Z","title":"Sparse Progressive Distillation: Resolving Overfitting under Pretrain-and-Finetune Paradigm","venue":"cs.CL","work_id":"4310c13c-de2b-4358-8f14-297588e0bccc","year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.858131Z"},"links":{"cited_paper":"/paper/2110.08190","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:7c2af9444aefe3666b7935d58a9aaa711e7a661b1c3fa869a024a93f2d638ffb","observation_id":"390edfd7-ede8-4410-9e30-cc7a3240712d","resolution":{"observed_at":"2026-08-12T14:38:52.316704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19985","last_updated":"2024-07-30T17:26:22Z","snapshot_observed_at":"2026-08-12T23:12:53.105235Z","submitted_at":"2024-07-29T13:19:31Z","title":"Mixture of Nested Experts: Adaptive Processing of Visual Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19985","snapshot_observed_at":"2026-08-12T14:38:51.860966Z","title":"Mixture of nested experts: Adaptive processing of visual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.860966Z"},"links":{"cited_paper":"/paper/2407.19985","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:68b63185de681b26eecb63b95847e0bd320270ef1993a58747709e48d20dcf9f","observation_id":"ad95b5a0-f5e3-493d-a44e-54b6f12f8fb1","resolution":{"observed_at":"2026-08-12T14:38:51.860966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.616055Z","title":"Self-distillation into self-attention heads for improving transformer-based end-to-end neural speaker diarization","venue":null,"work_id":"86267d81-d4ce-406b-970c-1edb3025ef32","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.864184Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:650e695279ad6713f84910f25848b6be7b691103cfd3687adbca6a055f5ebf20","observation_id":"a3be0e74-894d-484d-9fa7-405a2e6d81d2","resolution":{"observed_at":"2026-08-12T14:38:52.619430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.606957Z","title":"Expedited training of visual conditioned language generation via redundancy reduction","venue":null,"work_id":"e4871e4c-f313-4049-b767-35de65a3e453","year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.867019Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:ba6f1c4a00aec04a38862fe6607363b075d41616d82c0bfcadcbf6b0f3f58a31","observation_id":"55eab72c-802c-498f-82b7-411ff9c34e9a","resolution":{"observed_at":"2026-08-12T14:38:52.610412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T14:38:51.869956Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.869956Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:e63b5c01525a958c03928fd5e74359988cdbf21d1f65ec599b2fc5e089c05db2","observation_id":"084e9234-9b0f-4e80-addb-0417bb2a341c","resolution":{"observed_at":"2026-08-12T14:38:51.869956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.599185Z","title":"Self-supervised 3d anatomy segmentation using self-distilled masked image transformer (smit)","venue":null,"work_id":"ad2c491f-fe39-4305-aeca-5df8c3199951","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.872978Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:9a7428cd512e62065c13278b0dfb37b9a0df7a7f9fcc1e17a9e0263d9f77ea94","observation_id":"14383e2d-b807-48c9-b653-95ee6e53d585","resolution":{"observed_at":"2026-08-12T14:38:52.602038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-10T14:27:02.964369Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-12T14:38:51.875902Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.875902Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:e1cbeec497ce3c63f3aeebf9f71b1582815eb28da48791f2e31bae5506a4bbb5","observation_id":"682ee29e-5d31-4b4a-9497-a16b0031564e","resolution":{"observed_at":"2026-08-12T14:38:51.875902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-08-11T02:47:07.358642Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-12T14:38:51.879159Z","title":"Shortened llama: A simple depth pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.879159Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:17f0c76c11f4a7c4c26c175d39b140ab3caa9cbc575433154ac4a7b51137095c","observation_id":"74b67fb5-c03e-424c-8183-147344f8fe73","resolution":{"observed_at":"2026-08-12T14:38:51.879159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02871","last_updated":"2023-06-09T08:57:07Z","snapshot_observed_at":"2026-08-06T07:55:14.638671Z","submitted_at":"2022-09-30T02:25:12Z","title":"Self-Distillation for Further Pre-training of Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02871","snapshot_observed_at":"2026-08-12T14:38:51.882149Z","title":"Self-distillation for further pre-training of transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.882149Z"},"links":{"cited_paper":"/paper/2210.02871","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:ba443b6c94b07c3794c93d81f13e49b3b0b5cbf90e5fd77642569f818b02efdc","observation_id":"e73ced7e-ee60-4cf1-998e-531e43d0c297","resolution":{"observed_at":"2026-08-12T14:38:51.882149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.591469Z","title":"Clustered imagenet labels for training production-friendly image classifier","venue":null,"work_id":"b930b3b1-73f7-4466-97a9-5a74e1e167b3","year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.884764Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d801dc3a0fec17ecd2a5c807251b07e163a65885a8c78bd7d2a2579e6450b87c","observation_id":"4113c3f4-3216-4e76-a6e1-48836cd0a659","resolution":{"observed_at":"2026-08-12T14:38:52.594211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.583023Z","title":"Knowledge distillation via the target-aware transformer","venue":null,"work_id":"37875993-169d-4355-b4d9-cd34e277d2d6","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.887144Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d1f2a417d0d0a4fd2fea69f8e4387fed5457e83874e9ac5b4e4e02153c3c7c70","observation_id":"5593dda4-a275-4e98-a5f3-4d9a0ef3351a","resolution":{"observed_at":"2026-08-12T14:38:52.585753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13824","last_updated":"2023-02-17T13:17:52Z","snapshot_observed_at":"2026-07-06T12:12:39.412868Z","submitted_at":"2021-11-27T06:20:53Z","title":"FQ-ViT: Post-Training Quantization for Fully Quantized Vision Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13824","snapshot_observed_at":"2026-08-12T14:38:51.889606Z","title":"Fq-vit: Post-training quantization for fully quantized vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.889606Z"},"links":{"cited_paper":"/paper/2111.13824","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:e889deb423bcf3f2d2b5599c68b6263a592109213ac527613f18ea486041ada6","observation_id":"8b84504f-67ac-4341-814b-58b247eef34d","resolution":{"observed_at":"2026-08-12T14:38:51.889606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.892356Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.892356Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:e367eb71eef102cbf0f29757f4c1ead6a16cc9477f636707348314a3e0255ae4","observation_id":"50ac9757-c5a3-4dfb-8f42-4646693131ec","resolution":{"observed_at":"2026-08-12T14:38:51.892356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.568848Z","title":"Oscillation-free quantization for low-bit vision transformers","venue":null,"work_id":"77187f6f-6ce1-4ec5-b39f-c3c26d640395","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.894734Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:b7b40b6867a1165f8f10ecf511b00bcea4415e1eae1ce07a06a357f353ebc4eb","observation_id":"3aa03e23-d79f-447a-8594-7510f5fce33e","resolution":{"observed_at":"2026-08-12T14:38:52.572215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.896973Z","title":"Post-training quantization for vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.896973Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:db4452aec360e3201e1a9c5e5b93df0dc6fad05ec5800044eb5c4b3f496af575","observation_id":"a0cf4fec-e8a2-451e-b519-75c6bbb1ef38","resolution":{"observed_at":"2026-08-12T14:38:51.896973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00749","last_updated":"2022-04-25T10:38:17Z","snapshot_observed_at":"2026-08-12T15:19:52.553281Z","submitted_at":"2021-04-01T20:01:57Z","title":"Anytime Dense Prediction with Confidence Adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00749","snapshot_observed_at":"2026-08-12T14:38:51.899751Z","title":"Anytime dense prediction with confidence adaptivity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.899751Z"},"links":{"cited_paper":"/paper/2104.00749","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:6d059d8dfe5f54cf6f0ef3f8715054d558d70e04cf2bc520248d5f434eddfd0d","observation_id":"106afdf3-ea68-44a8-a341-4635adc29ec7","resolution":{"observed_at":"2026-08-12T14:38:51.899751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.554955Z","title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations","venue":null,"work_id":"f7fd77ea-5840-4c7d-84a1-5d3dd65a7e63","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.902822Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:9b6daaaea8eb36cebff0ac3566c45a7cfbc4380f77c9ab61c14be6bb48a7eeed","observation_id":"7688bba1-7d21-40ad-8772-053af3629bdb","resolution":{"observed_at":"2026-08-12T14:38:52.558394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.905570Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.905570Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:afc8d12b10dfe0eb9484fa26479197d5f4ed21f9eb5a5cad181cfc3cdd4f10f4","observation_id":"89d96134-36af-4bb5-a78c-36ab88e259ad","resolution":{"observed_at":"2026-08-12T14:38:51.905570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04625","last_updated":"2023-10-06T23:37:24Z","snapshot_observed_at":"2026-08-09T04:15:15.554561Z","submitted_at":"2023-10-06T23:37:24Z","title":"Copy Suppression: Comprehensively Understanding an Attention Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04625","snapshot_observed_at":"2026-08-12T14:38:51.908556Z","title":"Copy suppression: Comprehensively understanding an attention head","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.908556Z"},"links":{"cited_paper":"/paper/2310.04625","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:37ad208f18270ab2fb7dc0e343241e1577a0f315e352778e7b3d20611fa3245c","observation_id":"8cc78494-02f8-4e58-ba88-8ed448c12c59","resolution":{"observed_at":"2026-08-12T14:38:51.908556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.911656Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.911656Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:b59f69b370e3dac1ecc6f4a556b8696fa7161444bfe04a89a54eaeedafd18c8c","observation_id":"0bd13a09-5670-464f-a3aa-340dc8418f03","resolution":{"observed_at":"2026-08-12T14:38:51.911656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08744","last_updated":"2024-05-06T14:31:32Z","snapshot_observed_at":"2026-08-08T01:26:59.154142Z","submitted_at":"2023-10-12T22:12:28Z","title":"Circuit Component Reuse Across Tasks in Transformer Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08744","snapshot_observed_at":"2026-08-12T14:38:51.914561Z","title":"Circuit component reuse across tasks in transformer language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.914561Z"},"links":{"cited_paper":"/paper/2310.08744","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:8f6064f6ad5c535e8c7317c91943afbfd64d10de7556e8826f282159bdabe230","observation_id":"caa4206b-3f0a-453a-ae07-76d0bcfe2ca4","resolution":{"observed_at":"2026-08-12T14:38:51.914561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.917590Z","title":"Zoom in: An introduction to circuits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.917590Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:fe5c90a9e2cecca140d0577c1d9c0bb7e0b8b88a948d674ac416ecdce4729d58","observation_id":"2baf1a4b-320a-45e0-82ef-de20738605bb","resolution":{"observed_at":"2026-08-12T14:38:51.917590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-12T14:38:51.919899Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.919899Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:42ae42c24c8fceb0edc6d94c98c33e1772847d1658f633a19db88c99bad59039","observation_id":"0ad33b7e-34c7-416e-887b-3928d987a573","resolution":{"observed_at":"2026-08-12T14:38:51.919899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.531318Z","title":"Ia-red 2: Interpretability-aware redundancy reduction for vision transformers","venue":null,"work_id":"cab4916c-d3b0-402d-9e4a-026e61f657a5","year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.922482Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:2dee504151a846e80a22fe30b1f464a611935bbd2376aa63d9fd3bbf78b9b0a5","observation_id":"f652ae6a-d2fb-4fc5-abb2-6ba6a042452c","resolution":{"observed_at":"2026-08-12T14:38:52.534655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.523390Z","title":"Self-evolving vision transformer for chest x-ray diagnosis through knowledge distillation","venue":null,"work_id":"0c362079-8f91-4252-b6cd-be296bcd542d","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.924867Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:ee98885e2955bde44fe06dff8ed25c93cab9bada393dfb3bd315e1baca6556b6","observation_id":"5add9e11-2b4b-45b8-be8d-75586f889ba1","resolution":{"observed_at":"2026-08-12T14:38:52.526272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.927037Z","title":"A practical review of mech- anistic interpretability for transformer-based language models.arXiv preprint arXiv:2407.02646, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.927037Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:6baeeb5e294f20ea067bd43c35e800777f14acb7feae0f171dbbeff34762da35","observation_id":"a20e40e5-ec2e-483d-b558-a50e0fc0c57f","resolution":{"observed_at":"2026-08-12T14:38:51.927037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.929776Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.929776Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:a8503d04428467ef38349650bc1f3b34b4442aa33f2cf1558c0e1e27ba088847","observation_id":"8c018973-c0ee-4a62-9d21-bf2519e8e086","resolution":{"observed_at":"2026-08-12T14:38:51.929776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-12T14:38:51.932616Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.932616Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:c4843b0d9a73ddea92326c76e3f801311890f3f8e683516b30b401d3605996e7","observation_id":"0f16e29e-3e9a-41c1-9fcd-3cabd2f40520","resolution":{"observed_at":"2026-08-12T14:38:51.932616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-12T14:38:51.935815Z","title":"Distilbert, a distilled version of bert: Smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.935815Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:a18b1a5908276a7f349df9aa62874d5ecc3ef945a0bd1bdaca4a338e2cedb49d","observation_id":"bdf3dd24-01e7-4af5-9c2b-c8b570da2546","resolution":{"observed_at":"2026-08-12T14:38:51.935815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.510989Z","title":"Confident adaptive language modeling","venue":null,"work_id":"6f3fe672-e9d1-4143-99ea-c048109fe318","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.938966Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:6f8fdc7a0c1e5f00245f3f0b8c2eff853c3ee1afe66d42309a4ea9502653bcd0","observation_id":"39d689fd-4cd5-4e07-8e20-31bc538d89af","resolution":{"observed_at":"2026-08-12T14:38:52.513563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-07-06T16:10:15.694898Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-12T14:38:51.941889Z","title":"Omniquant: Omnidirectionally calibrated quantiza- tion for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.941889Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:411f2ef18423dc92675a95c9176f1eb889b3fe60b3ed963d0994689359144944","observation_id":"391d1b87-f156-45bc-b39e-55f78eb52bd6","resolution":{"observed_at":"2026-08-12T14:38:51.941889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-12T04:14:58.866318Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T14:38:51.944839Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.944839Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:8d98c6def173c75f44287f9536ce0e0420e2888ef424e89d3f8015f3d55fa38d","observation_id":"9e457abb-0556-4269-abc2-bfc9f1873c4e","resolution":{"observed_at":"2026-08-12T14:38:51.944839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15054","last_updated":"2023-10-20T12:13:27Z","snapshot_observed_at":"2026-08-12T15:37:42.822543Z","submitted_at":"2023-05-24T11:43:47Z","title":"A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15054","snapshot_observed_at":"2026-08-12T14:38:51.947280Z","title":"A mechanistic interpretation of arithmetic reasoning in language models using causal mediation analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.947280Z"},"links":{"cited_paper":"/paper/2305.15054","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:f2ad9170fce0cd5f621d3d35eaabc441387d6cf52473a1349c534a30d24c57e6","observation_id":"54e6f198-ea37-4b4c-954b-1d271ad9dd34","resolution":{"observed_at":"2026-08-12T14:38:51.947280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.502502Z","title":"Tasked: transformer-based adversarial learning for human activity recognition using wearable sensors via self-knowledge distillation","venue":null,"work_id":"9407c0c6-69c9-4ef0-9a7b-61052aed45c6","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.949782Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:ff0446351c892eb96cf3185cb7a13c147ff34c04ad65bb1450e7addb273f1313","observation_id":"697491b3-5265-46f7-88e0-6c8627f8810b","resolution":{"observed_at":"2026-08-12T14:38:52.505781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.493373Z","title":"Self-distilled vision transformer for domain generalization","venue":null,"work_id":"da969f8d-c576-4aae-9829-9506b50c4e24","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.952400Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:c90e4a92d2410d920154ce7e805d6a4a8d5c365e7d14dd611ee45386e6220ee3","observation_id":"73e114a5-6a81-4076-92a5-f43ba06e4e2d","resolution":{"observed_at":"2026-08-12T14:38:52.496992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-10T17:57:35.491764Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-12T14:38:51.954669Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.954669Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:2060bfa63493c99676488819942816724c76f5ad12767233b354513146bd14cf","observation_id":"d3b10aa2-14bb-43f3-b59c-0b57d06a790a","resolution":{"observed_at":"2026-08-12T14:38:51.954669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02984","last_updated":"2020-04-14T23:54:36Z","snapshot_observed_at":"2026-08-06T09:03:09.275283Z","submitted_at":"2020-04-06T20:20:58Z","title":"MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02984","snapshot_observed_at":"2026-08-12T14:38:51.957799Z","title":"Mobilebert: a compact task-agnostic bert for resource-limited devices","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.957799Z"},"links":{"cited_paper":"/paper/2004.02984","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:8aef01abeb9f0cb8c1cca9d64450f9d32d5d7be6712348bf1b4b4c34bef2c7b5","observation_id":"8312c520-0e96-41d9-b045-14fd40262c2b","resolution":{"observed_at":"2026-08-12T14:38:51.957799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.960881Z","title":"Patch slimming for efficient vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.960881Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:e1af1f7a52ee4c3b64e1061582cf9a86ee7e465ebe924aceaed27718ed92604f","observation_id":"b47718a4-6be5-4669-90a5-67c84787c257","resolution":{"observed_at":"2026-08-12T14:38:51.960881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.479910Z","title":null,"venue":null,"work_id":"5e49909a-92dc-42e0-a63b-1d0907a8f340","year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.963709Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:921160409c41cd18eadb8e21fc1e39f80eb22e98c37a893c59144b42fbf6a33a","observation_id":"fc3cce1a-9e23-42a2-8fba-d94c5de0578b","resolution":{"observed_at":"2026-08-12T14:38:52.483135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.966919Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.966919Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:9fc8a9ce9da7b90ce2eabde1ffc00a9c4188463f2cac6779fa6af0cefa2553d6","observation_id":"8378a85f-e41e-4276-9c62-43ec2ac1af75","resolution":{"observed_at":"2026-08-12T14:38:51.966919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.969832Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.969832Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:d3d7ca1e038cde48ba2029cb7bffb0539fb8a6d70f49baac47961a93613e940a","observation_id":"e3fa46d1-7012-4a75-910a-88ec06df7c40","resolution":{"observed_at":"2026-08-12T14:38:51.969832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.462012Z","title":"Rkld: Reverse kl-divergence- based knowledge distillation for unlearning personal information in large language models, 2024","venue":null,"work_id":"d9b11ffd-44db-420c-a479-b708f984f5c9","year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.972731Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:172bc7a78da88a3834c687e7ef5977ffb3df0020fbd56085ebbb6226734ea71a","observation_id":"03c70042-9d43-43c0-8c76-c5f78c24529f","resolution":{"observed_at":"2026-08-12T14:38:52.464845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-12T14:38:51.975653Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.975653Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:5628f177f5096a620321864498c7b9dc064ca2f57d0073412299374b1c740495","observation_id":"8adb33bb-3086-440e-b335-7cab20402372","resolution":{"observed_at":"2026-08-12T14:38:51.975653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.454119Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"eeb7adde-811b-4627-90e1-e04583e7d1f1","year":2020},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.979027Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:5ff150e066dc134920490e51847937b14847706805cfb7c70ae170659f2d8bda","observation_id":"b62e5c21-9f43-4b81-ab10-ab17702fb178","resolution":{"observed_at":"2026-08-12T14:38:52.456906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.444727Z","title":"Last: Label-free self-distillation contrastive learning with transformer architecture for remote sensing image scene classification","venue":null,"work_id":"a064dc9a-6a50-4f47-9f5f-7af9db23783a","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.982279Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:5b035a9ab7b13bf52e7e1c3349cbabdb5ac0922dc5a0e749e6b2ce584692dfef","observation_id":"e24b8f23-3957-4d42-9397-6e0ec64b77d3","resolution":{"observed_at":"2026-08-12T14:38:52.448430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.435047Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers","venue":null,"work_id":"0000f963-f730-4bed-9aa1-5589c5f547e6","year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.984954Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:888b3d5f68149c858d2eed9351dc3165f85a0e3bdf48f1d6392d0466f693643b","observation_id":"1749f87a-2a79-4e35-ba69-ae658f8d1b8d","resolution":{"observed_at":"2026-08-12T14:38:52.438892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-12T14:38:51.987271Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.987271Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:47da403618b5e3b1e9fec39afffcf1c00468aa50ec442e1e6d260c15b16dda6c","observation_id":"23cc25b4-72e7-4e58-bf94-be7ee936f505","resolution":{"observed_at":"2026-08-12T14:38:51.987271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00408","last_updated":"2022-05-02T19:21:13Z","snapshot_observed_at":"2026-08-02T16:36:17.936691Z","submitted_at":"2022-04-01T13:09:56Z","title":"Structured Pruning Learns Compact and Accurate Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00408","snapshot_observed_at":"2026-08-12T14:38:51.990020Z","title":"Structured pruning learns compact and accurate models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.990020Z"},"links":{"cited_paper":"/paper/2204.00408","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:80abb46334f2489f2659b7794ed6ff4086287560f170ebf3364c3d9ee21fa3b0","observation_id":"233e4718-6d55-4085-a644-6d508d92c1f0","resolution":{"observed_at":"2026-08-12T14:38:51.990020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:51.992893Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.992893Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:9d98886a1d9a5360b348a8f37962b925ecf03905a9ca987e4d1d082331322699","observation_id":"33c2b9fc-d032-40a7-95a7-0384e79a0ba4","resolution":{"observed_at":"2026-08-12T14:38:51.992893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21018","last_updated":"2025-02-27T12:30:43Z","snapshot_observed_at":"2026-08-12T23:11:48.101497Z","submitted_at":"2024-07-30T17:59:08Z","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21018","snapshot_observed_at":"2026-08-12T14:38:51.995190Z","title":"Think: Thinner key cache by query-driven pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.995190Z"},"links":{"cited_paper":"/paper/2407.21018","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:c29065f72d37bd51854e84dfa934533a59e539cafa98f56858f10cd3fc5b8687","observation_id":"33c4be17-a40d-4aa6-935b-01e311898b3d","resolution":{"observed_at":"2026-08-12T14:38:51.995190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.420635Z","title":"X-pruner: explainable pruning for vision transformers","venue":null,"work_id":"41b28d5a-af2a-4720-acb7-01ac1949b8c3","year":2023},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:51.998085Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:01a06aa11e0cd61e55070ff942db61dbf3bd4f24225205f0e2bf857d02caa818","observation_id":"0273513d-35ee-4930-a305-18c2edda9540","resolution":{"observed_at":"2026-08-12T14:38:52.424277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08243","last_updated":"2022-03-15T20:38:22Z","snapshot_observed_at":"2026-07-06T12:48:20.464521Z","submitted_at":"2022-03-15T20:38:22Z","title":"Unified Visual Transformer Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08243","snapshot_observed_at":"2026-08-12T14:38:52.000864Z","title":"Unified visual transformer compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.000864Z"},"links":{"cited_paper":"/paper/2203.08243","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:925447e6fe19e485b5a470978d6200a95a7b0c6eb3ac1fe2db35174966be2b60","observation_id":"93c0355e-f848-45db-9b2f-12e6afd37318","resolution":{"observed_at":"2026-08-12T14:38:52.000864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01786","last_updated":"2022-04-05T07:35:52Z","snapshot_observed_at":"2026-08-12T12:44:42.648031Z","submitted_at":"2021-10-05T02:14:38Z","title":"MoEfication: Transformer Feed-forward Layers are Mixtures of Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01786","snapshot_observed_at":"2026-08-12T14:38:52.004555Z","title":"Moefication: Transformer feed-forward layers are mixtures of experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.004555Z"},"links":{"cited_paper":"/paper/2110.01786","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:f3adc79d16360fc296903dcf1c7c6712edfea9bc78fea570b23832d6c768483b","observation_id":"11a5dcf9-149d-4f7b-b713-3b8c2f8a1686","resolution":{"observed_at":"2026-08-12T14:38:52.004555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.412093Z","title":"Knowledge distillation based on transformed teacher matching","venue":null,"work_id":"afb89020-6401-4ffd-a381-3dbd4bc37fc8","year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.007595Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:a7afb1a8836aca6c0512f30e9c569e67e533ad54824326096520d109741ff743","observation_id":"caea50ba-6c6e-424d-bb5c-0cc1ee2e5027","resolution":{"observed_at":"2026-08-12T14:38:52.414808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.010319Z","title":"The clock and the pizza: Two stories in mechanistic explanation of neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.010319Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:94ed62c846e317fecde6f11001f573812e30b2b85236fb9f93f5ac65af737909","observation_id":"80958d0c-b3c7-4749-8de3-4432ec47e4ca","resolution":{"observed_at":"2026-08-12T14:38:52.010319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16554","last_updated":"2024-06-24T11:43:07Z","snapshot_observed_at":"2026-08-12T23:36:12.657828Z","submitted_at":"2024-06-24T11:43:07Z","title":"LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16554","snapshot_observed_at":"2026-08-12T14:38:52.013139Z","title":"Llama-moe: Building mixture-of-experts from llama with continual pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.013139Z"},"links":{"cited_paper":"/paper/2406.16554","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:6f050ea01cf78c1c9b7991bb0bc855e6df2e23e93b66ab9397dfcb0ea88ce881","observation_id":"19db123c-225d-4678-83db-042e11c80ad4","resolution":{"observed_at":"2026-08-12T14:38:52.013139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07675","last_updated":"2022-04-28T21:53:25Z","snapshot_observed_at":"2026-07-06T13:00:49.939370Z","submitted_at":"2022-04-15T23:19:37Z","title":"MoEBERT: from BERT to Mixture-of-Experts via Importance-Guided Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07675","snapshot_observed_at":"2026-08-12T14:38:52.016407Z","title":"Moe- bert: from bert to mixture-of-experts via importance-guided adaptation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.016407Z"},"links":{"cited_paper":"/paper/2204.07675","citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:10855d0ee06650ab6459b14869128cabb155c703211847f4f22557425c4806a3","observation_id":"e89b4d73-6cb9-4692-bfff-0be0ab6974aa","resolution":{"observed_at":"2026-08-12T14:38:52.016407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.399712Z","title":"Possible solutions could include:","venue":null,"work_id":"2cd13563-9ee5-4e5f-8c59-2f560d0a51ce","year":null},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.019705Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:48d0b035c6516918860265ea359043babff17ef8f0aa62ce1e4f916f781a0c04","observation_id":"2a226cfb-df33-4745-a251-066a3616abc2","resolution":{"observed_at":"2026-08-12T14:38:52.402343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.391223Z","title":null,"venue":null,"work_id":"e8c1910b-8b48-48d6-9666-880dc1953dfb","year":null},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.022253Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:10f7c5f7d9ffdcb4b849e3f924f958e275147e3b5890a22ee6b7eefa7b6a9027","observation_id":"da8cde43-a337-4086-a708-a2e5e522a007","resolution":{"observed_at":"2026-08-12T14:38:52.394336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:38:52.382267Z","title":null,"venue":null,"work_id":"a45af43d-57f6-4840-aebf-75646ce027b7","year":null},"citing_paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T14:38:52.024717Z"},"links":{"citing_paper":"/paper/2411.15281"},"observation_digest":"sha256:c59a802afc1b00087d2454f22a4df48dd0130d57689cd1a802af06af5533841e","observation_id":"35c4f703-c447-4c33-ad9e-f9b61206eaa1","resolution":{"observed_at":"2026-08-12T14:38:52.385463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15281","last_updated":"2024-11-22T16:11:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T15:20:09.925198Z","submitted_at":"2024-11-22T16:11:14Z","title":"ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2411.15281."}