{"as_of":"2026-08-12T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e79bd2e58891bd28f6b5a7f3e8926644533c4c55aea6654a504a1ef3be7a4b71","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:49:01.983631Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07890/citation-record","integrity":"/paper/2608.07890/integrity","json":"/paper/2608.07890/citation-record.json","paper":"/paper/2608.07890"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:01.879932Z","title":"DiEP: Adaptive mixture-of-experts compression through differentiable expert pruning.arXiv preprint arXiv:2509.16105, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.879932Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:ddcffda386f00e1f850572da92769ce55314496a99b47284edb4014865aa98cc","observation_id":"891266e0-263e-4b0a-812c-2e19b7558e02","resolution":{"observed_at":"2026-08-12T00:49:01.879932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00277","last_updated":"2022-06-02T03:44:04Z","snapshot_observed_at":"2026-08-10T23:05:00.856772Z","submitted_at":"2022-06-01T07:09:01Z","title":"Task-Specific Expert Pruning for Sparse Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00277","snapshot_observed_at":"2026-08-12T00:49:01.883488Z","title":"Task-specificexpertpruningforsparsemixture-of-experts.arXiv preprint arXiv:2206.00277, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.883488Z"},"links":{"cited_paper":"/paper/2206.00277","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:5a33c516bed23a170b8e66b55f934b22b0e48c92fdc96e804c057aca8735cec3","observation_id":"8e4da1fb-5c05-4358-9927-35aed7e48002","resolution":{"observed_at":"2026-08-12T00:49:01.883488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.588059Z","title":"A provably effective method for pruning experts in fine-tuned sparse mixture-of-experts","venue":null,"work_id":"d0029d5c-af44-481d-9a08-1c67d1caf50f","year":null},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.886972Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:0fbea015189a07e3fc193a9037e04f630552b5ff02442cc7014bef35d8199437","observation_id":"62b39d4a-1d0a-409e-8ab1-43192e79e837","resolution":{"observed_at":"2026-08-12T00:49:02.591859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.578329Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"bccbb388-fec0-451d-a1c0-f2d5f653711b","year":2019},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.890345Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:4c84bf15818e6be1b2aa1102a28268d0de1c2b5f9526154fbaca30b716916d35","observation_id":"fde8606f-f69b-4ae0-a773-5cc57c8d90a9","resolution":{"observed_at":"2026-08-12T00:49:02.581959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-12T00:49:01.893687Z","title":"Think you have solved question answering? try ARC, the AI2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.893687Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:85badd7716c82ffb9e385b999a4b68a977af71d85e1eb0e859d5121f035dd26d","observation_id":"afac1b59-746f-4cd5-abfb-41c7e752b8b5","resolution":{"observed_at":"2026-08-12T00:49:01.893687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T00:49:01.897288Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.897288Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:319d774d5804558b2a65183b04dd9d1567faa92f1f9405a57ba59abd3a1751b5","observation_id":"e3ca1928-df1c-4ea2-abf1-5a6354dd8255","resolution":{"observed_at":"2026-08-12T00:49:01.897288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-12T06:03:03.703202Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T00:49:01.900748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.900748Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:5df6ac885c5396c355ae2139d658598ce4ba8f847642e991abf84489645ed7bb","observation_id":"084f6780-ac34-4150-865a-b0b9955df576","resolution":{"observed_at":"2026-08-12T00:49:01.900748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-12T00:49:01.904132Z","title":"QLoRA: Efficient finetun- ing of quantized LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.904132Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:e65931819550780afa203e1adb8fd1e16cc5d3486e64b16a02e418c9d4b27f0d","observation_id":"157e458a-320c-46ce-976c-6967b58d8805","resolution":{"observed_at":"2026-08-12T00:49:01.904132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.568490Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":"837dd943-eefd-4400-90d8-0e1527ccfcba","year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.908739Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:8e96396a2db90ae4c940786c756f3f2f70302e972dc38a0f5223afdb561ed973","observation_id":"036ee345-af6c-415f-8f2b-39506d163821","resolution":{"observed_at":"2026-08-12T00:49:02.572169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.558803Z","title":"LightEval: A lightweight framework for LLM evaluation.https://github.com/huggingface/lighteval, 2023","venue":null,"work_id":"e5282afc-ed0e-4869-b961-0795821740ef","year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.911735Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:4b9272bf86a8ad8decb83f2184b496d943561271ac70612806a738d32aa1be37","observation_id":"a4f1cfb4-d4c0-4ede-8a9e-9160c8263fe2","resolution":{"observed_at":"2026-08-12T00:49:02.562429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.548672Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"97ac79f2-f5e1-4e2b-b8cf-d07284dcf49b","year":2019},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.914668Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:b3b2901b78200dd041bc1a37c2ec95a646d0f63f3c2420ee75deacc964652372","observation_id":"6eb2fba6-29fb-4a7f-88c4-ed08907ba91b","resolution":{"observed_at":"2026-08-12T00:49:02.552596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T00:49:01.917699Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.917699Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:31bd7ef0085ffa46bfc77bed0ce9fe18bf5689f03f2e6ebbf7bb07d720366875","observation_id":"918bfb6e-f589-4bae-98a8-343eaf2f895f","resolution":{"observed_at":"2026-08-12T00:49:01.917699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10159","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.364751Z","title":"Whatgetsactivated: Uncovering domain and driver experts in MoE language models.arXiv preprint arXiv:2601.10159, 2026","venue":null,"work_id":"b9b82e88-1e04-4471-bac1-3d8e953d29d0","year":2026},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.920863Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:61c7a356bb1e1ba2bd256d90cdfd3cbb460600d06199dee1e557b89ab7eb06cd","observation_id":"fb1789aa-30a0-4585-8c56-62f9d3a1e00e","resolution":{"observed_at":"2026-08-12T00:49:02.370354Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.02217","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.298582Z","title":"Isretraining-freeenough? thenecessityofroutercalibrationforefficient MoE compression.arXiv preprint arXiv:2603.02217, 2026","venue":null,"work_id":"49d85b96-4daa-41d8-8d02-6a0ba6b64b19","year":2026},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.923986Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:35b4e358116c4c9ec4ed0887126846193f371aad1cea08cabac5b37147cba149","observation_id":"ada29a1d-99c0-4f84-9947-0cfbe04b5298","resolution":{"observed_at":"2026-08-12T00:49:02.303879Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05586","last_updated":"2025-04-10T02:32:14Z","snapshot_observed_at":"2026-08-07T16:07:44.934790Z","submitted_at":"2025-04-08T00:49:08Z","title":"Finding Fantastic Experts in MoEs: A Unified Study for Expert Dropping Strategies and Observations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05586","snapshot_observed_at":"2026-08-12T00:49:01.926938Z","title":"Finding fantastic experts in MoEs: A unified study for expert dropping strategies and observations.arXiv preprint arXiv:2504.05586, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.926938Z"},"links":{"cited_paper":"/paper/2504.05586","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:a292c05f029e815a556fa617935bbb806620b2a5bf0089e929bb7612f5346350","observation_id":"61fbfbd6-6321-458f-afce-2f8738c702b4","resolution":{"observed_at":"2026-08-12T00:49:01.926938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T00:49:01.930118Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.930118Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:42288caa57b9df764065190ef26737b45b6267d5ed7685b56637d94c93814a56","observation_id":"668edeb3-9b5b-46f8-9d2e-8c89499caea9","resolution":{"observed_at":"2026-08-12T00:49:01.930118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.538248Z","title":"Memory-efficient NLLB-200: Language-specificexpertpruningofamassivelymultilingualmachinetranslationmodel","venue":null,"work_id":"da620981-7161-4ee4-8a16-a7fd0cdd1646","year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.933211Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:5d9517f5e5a40716cac3a620e450a463a77d94dfcd7738ff4c1a4aa245d7c3d7","observation_id":"70273fa2-e53b-49f0-b876-25863bed257d","resolution":{"observed_at":"2026-08-12T00:49:02.542119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13999","last_updated":"2026-05-13T04:13:39Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T18:29:28Z","title":"REAP the Experts: Why Pruning Prevails for One-Shot MoE compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13999","snapshot_observed_at":"2026-08-12T00:49:01.936166Z","title":"REAP the experts: Why pruning prevails for one-shot MoE compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.936166Z"},"links":{"cited_paper":"/paper/2510.13999","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:696f86ef2fdf051ba4c3763cbb1a8e43d596be8520aa0b1f52a01a4ea45b784a","observation_id":"c0aaf6a8-0f4e-4399-a981-702dd0f0062f","resolution":{"observed_at":"2026-08-12T00:49:01.936166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T00:49:01.939879Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.939879Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:0f2cf7e4553b25d21ce4eaf0f032c2acd1d86b3fb19fe36f4e79363d57302099","observation_id":"8bbb5269-70e9-497e-a708-2d9b61e8cda6","resolution":{"observed_at":"2026-08-12T00:49:01.939879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01334","last_updated":"2024-03-14T11:01:15Z","snapshot_observed_at":"2026-08-10T02:42:46.388949Z","submitted_at":"2023-10-02T16:51:32Z","title":"Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01334","snapshot_observed_at":"2026-08-12T00:49:01.943207Z","title":"Merge, then compress: Demystify efficient SMoE with hints from its routing policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.943207Z"},"links":{"cited_paper":"/paper/2310.01334","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:dacf633917154b5dc6a0731b3e12003269900bd84b7978472f03b2fe781f1679","observation_id":"c9863d2d-eca5-4e8a-ab06-bd41c10e4a7e","resolution":{"observed_at":"2026-08-12T00:49:01.943207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.527906Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":"5bde4aab-12cc-46cb-b158-5816a0d1b98e","year":2021},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.946445Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:3da76d982baea5cfca1ff35fed2d4046fb3784f85f7281a441e4138860dc66b0","observation_id":"bf37a876-1492-4c08-936b-a8f028faad5f","resolution":{"observed_at":"2026-08-12T00:49:02.531509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00945","last_updated":"2024-07-01T03:57:35Z","snapshot_observed_at":"2026-08-05T13:26:03.230242Z","submitted_at":"2024-07-01T03:57:35Z","title":"Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00945","snapshot_observed_at":"2026-08-12T00:49:01.949181Z","title":"Blaschko, Shengen Yan, Guohao Dai, Huazhong Yang, and Yu Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.949181Z"},"links":{"cited_paper":"/paper/2407.00945","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:8ea3cf7f66c3c306ec4c3724d520828aa490ec459d69611d85100cca02c420ea","observation_id":"a541499f-7628-4625-b67e-c2c8ef29dd68","resolution":{"observed_at":"2026-08-12T00:49:01.949181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05638","last_updated":"2022-08-26T16:23:29Z","snapshot_observed_at":"2026-07-06T13:08:59.614061Z","submitted_at":"2022-05-11T17:10:41Z","title":"Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05638","snapshot_observed_at":"2026-08-12T00:49:01.952312Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.952312Z"},"links":{"cited_paper":"/paper/2205.05638","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:ec787509aab71bfe41e031400e7f5b2d46e2a4d70dce24f6585be05586335319","observation_id":"91488c25-d831-41dd-938f-b4306befc0b7","resolution":{"observed_at":"2026-08-12T00:49:01.952312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.517593Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":"59acda52-99c1-418e-853e-3794f4df0311","year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.955798Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:957ce7d7ea0c3c3b93ba1e4e6703381dbecae072c2773f83a930fbd06c9748e8","observation_id":"1501c59d-cf2d-4ce1-9022-527a23fa0ca4","resolution":{"observed_at":"2026-08-12T00:49:02.521484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.507339Z","title":null,"venue":null,"work_id":"1bef47ce-f146-4fdf-9eba-0703894716cc","year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.958734Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:7264afb44c51e82d7ff80a6b168b9913bdd9603538326f0aaf74ed3e76c66bdb","observation_id":"3ef82a77-8cde-4d14-b1a4-1ebfe6ae5d10","resolution":{"observed_at":"2026-08-12T00:49:02.511001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05089","last_updated":"2024-04-07T22:13:43Z","snapshot_observed_at":"2026-08-10T22:55:54.897620Z","submitted_at":"2024-04-07T22:13:43Z","title":"SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05089","snapshot_observed_at":"2026-08-12T00:49:01.961675Z","title":"SEER-MoE:Sparseexpertefficiencythroughregularization for mixture-of-experts.arXiv preprint arXiv:2404.05089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.961675Z"},"links":{"cited_paper":"/paper/2404.05089","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:01d19834365d1f425f6395accc14b883baaeacad3fb91bf36c79fe838aa7bba9","observation_id":"9e90403c-22a1-48db-9172-f5027fa6feb6","resolution":{"observed_at":"2026-08-12T00:49:01.961675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.495573Z","title":"Qwen1.5-MoE: Matching 7B model performance with 1/3 activated parameters.https: //qwenlm.github.io/blog/qwen-moe/, 2024","venue":null,"work_id":"44ea5d0e-e696-4283-896b-7c51bca04938","year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.964966Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:113581ff5cdf0674a0a7d0f693b93fc757cebe5f2786341ca594938f1c44f8f4","observation_id":"97a3bce9-c087-4993-9250-a946bc1fff60","resolution":{"observed_at":"2026-08-12T00:49:02.500646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-12T04:14:58.866318Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T00:49:01.967993Z","title":"Outrageouslylargeneuralnetworks: Thesparsely-gatedmixture-of-expertslayer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.967993Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:8aa9931949c1fee0d6ad2c1004d1c1e3a8c6ddae7cb3eaea83bdc43134a7d9a7","observation_id":"7e846139-9d62-4abc-bce9-962c39b09373","resolution":{"observed_at":"2026-08-12T00:49:01.967993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-12T00:49:01.971209Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.971209Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:4c6f4db0258516f6cf46ade3b9cefb887db5654b968be050351d05096941a5af","observation_id":"b984f894-7398-4769-a8da-7eb04e365d00","resolution":{"observed_at":"2026-08-12T00:49:01.971209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.485020Z","title":"LoRA without regret","venue":null,"work_id":"87a778da-8b4d-4665-8ee2-1689b76a8843","year":null},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.974351Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:fd369c601be0d77b0467a9f866521b3903a22ca4c3f70f333787f11a2aa6e64b","observation_id":"1c1ff876-aaa7-4670-b552-d97ffb4eab24","resolution":{"observed_at":"2026-08-12T00:49:02.488748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-12T00:49:01.977418Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.977418Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:785fda006dfb8a6ac3fb86bd639054527218715d6359a7aa6d8b90846ac52843","observation_id":"717cab9f-b213-46b4-b318-1b12bb4fa1b3","resolution":{"observed_at":"2026-08-12T00:49:01.977418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12013","last_updated":"2024-10-15T19:22:27Z","snapshot_observed_at":"2026-08-12T22:22:24.990640Z","submitted_at":"2024-10-15T19:22:27Z","title":"MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12013","snapshot_observed_at":"2026-08-12T00:49:01.980607Z","title":"MoE-Pruner: Pruning mixture-of-experts large language model using the hints from its router.arXiv preprint arXiv:2410.12013, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.980607Z"},"links":{"cited_paper":"/paper/2410.12013","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:fbb1e3da77dc9c039716a9e382b09e087f0080fd0c32a6c59f47f4456e354c38","observation_id":"e1e88265-d0c6-4b5e-8580-a9fd5f552264","resolution":{"observed_at":"2026-08-12T00:49:01.980607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18425","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.105863Z","title":"MoE pathfinder: Trajectory-driven expert pruning.arXiv preprint arXiv:2512.18425, 2025","venue":null,"work_id":"467947ae-b74d-4c4a-879c-1fa01b257ce1","year":2025},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.983631Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:6afdab08432a4c5beff189daa4eed6baee87d36bca13dd68da3c5c8744ef79e3","observation_id":"24536dcf-c66d-4c6a-baf5-5c06b7590a19","resolution":{"observed_at":"2026-08-12T00:49:02.113892Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T23:15:35.937324Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.07890."}