{"as_of":"2026-08-05T11:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b0f008466a06c66c15c0bd33fb538d1a2fbb4af4a339fde875579045d04981c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:51:05.721834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:08:50.012079Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:27dbc6f772f1989868dbe1c143ccaae8cb85221bfa61f682f680cb8edca9b0f8","observation_id":"be36b2e7-608d-4942-b512-7d9e33db634f","resolution":{"observed_at":"2026-05-15T02:39:33.169470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2411.08982","last_updated":"2026-05-18T20:44:06Z","snapshot_observed_at":"2026-07-06T19:50:01.724540Z","submitted_at":"2024-11-13T19:18:08Z","title":"Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T17:04:13.905401Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2411.08982"},"observation_digest":"sha256:f30170d553e39825a4784161c39e7ea2d080cf0c8c51f5e204947965f23221f5","observation_id":"3cce7e1d-3d45-4a35-92ce-7874c9a6a402","resolution":{"observed_at":"2026-05-23T17:05:42.981077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:dffddf56c802b3a58dcf75263165060ebebabca9a48665e9af3f36d65080a0ab","observation_id":"04cc05ad-d4f1-40d2-a50f-9be1250037d4","resolution":{"observed_at":"2026-05-23T17:13:14.061601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2502.04416","last_updated":"2026-04-23T00:51:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-06T14:05:30Z","title":"Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T04:08:29.089438Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2502.04416"},"observation_digest":"sha256:55249b4da588bdcf9b1e24188aaac051b79715ec9fb593e0086c02797af4eb62","observation_id":"1e936820-78cb-4947-8138-fb9c67f9fa18","resolution":{"observed_at":"2026-05-23T04:12:31.024128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-04T21:51:05.721834Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07727","last_updated":"2025-09-09T13:28:41Z","snapshot_observed_at":"2026-08-04T21:51:02.865764Z","submitted_at":"2025-09-09T13:28:41Z","title":"MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T21:51:05.721834Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.07727"},"observation_digest":"sha256:8d1bb86bebcf9c41c3d7bb98ad85028411d729d93b68c40e8b08ceeed0c73abc","observation_id":"822ff542-9253-4c11-9d77-6273aba3864c","resolution":{"observed_at":"2026-08-04T21:51:05.721834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-04T19:27:19.418335Z","title":"Ma, J.; Li, F.; and Wang, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09267","last_updated":"2025-09-11T08:53:37Z","snapshot_observed_at":"2026-08-04T19:27:18.501150Z","submitted_at":"2025-09-11T08:53:37Z","title":"Unified Start, Personalized End: Progressive Pruning for Efficient 3D Medical Image Segmentation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:19.418335Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.09267"},"observation_digest":"sha256:83bf371ea89f623d7ae6531775609ec8f459dfa065875d6cb536ed83bc631f1c","observation_id":"e503e305-eb19-4b77-b620-c66d5a4e5d81","resolution":{"observed_at":"2026-08-04T19:27:19.418335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-04T17:57:25.160350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10377","last_updated":"2025-09-12T16:09:39Z","snapshot_observed_at":"2026-08-04T17:57:15.661725Z","submitted_at":"2025-09-12T16:09:39Z","title":"Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:25.160350Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.10377"},"observation_digest":"sha256:9c8b42e24f180c35bf34cdc8eabf414dfcf096c8b2dae760985638cde7632108","observation_id":"0283ff76-3549-4e48-8be1-a5c9d2fb79ea","resolution":{"observed_at":"2026-08-04T17:57:25.160350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-02T18:57:31.493788Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:eb63b70be8ddb192c635da8799d4358bac31b011aa9de052d4ef10c5b21d61cf","observation_id":"d35c89df-12f2-4f4e-85cb-b42da094b9be","resolution":{"observed_at":"2026-05-18T12:41:22.803615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-03T23:41:52.898841Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-04T04:11:07.086318Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.898841Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:cf9b0bd27cddae6d27501e46437ecf9b7869725cb75963cf0d56f68ae29ae6a7","observation_id":"1cd25960-a6da-476c-8de5-adbda4992407","resolution":{"observed_at":"2026-08-03T23:41:52.898841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-31T09:24:49.481740Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:160bc7ec104a2bdef665b045ec34e81bd3a57362bece64425f80a39e0aeec7b7","observation_id":"601b09f5-644d-4f07-a968-e1c972f721ed","resolution":{"observed_at":"2026-05-16T12:40:54.829536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2603.06003","last_updated":"2026-04-11T04:36:36Z","snapshot_observed_at":"2026-07-06T22:48:04.438669Z","submitted_at":"2026-03-06T08:02:58Z","title":"EvoESAP: Non-Uniform Expert Pruning for Sparse MoE","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T14:34:48.524592Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2603.06003"},"observation_digest":"sha256:e022549d4673c48369ebee458b0d53757f2357e2a3667b9a96275da8018ee955","observation_id":"a8dc26dd-950c-417a-9d1e-cd7f1aa050c4","resolution":{"observed_at":"2026-05-15T14:35:55.505976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.02715","last_updated":"2026-04-30T13:29:54Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T04:16:01Z","title":"FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T20:16:16.466375Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.02715"},"observation_digest":"sha256:11b24ab91323494f76be794cee9c8d9e19a3f663e055805ab3bf61557870ecb5","observation_id":"b3989a0d-4e18-4db4-8d27-4aa2352b11a4","resolution":{"observed_at":"2026-05-13T20:18:13.308753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-04T14:41:38.609117Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:16.555166Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:ca08c3592bba0a9a21720abed299edd732bfb455bddd08f3e96615ed8c65f5f4","observation_id":"46f94e26-bb0d-4f72-a72a-8bc6e83b628f","resolution":{"observed_at":"2026-05-10T03:29:21.482695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-04T14:41:38.609117Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T02:03:02.654035Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:7e9cf1be60eeafa08f2b43e81758f46098ae04969e021c9f3e778749346b1f63","observation_id":"cac8bb70-77c3-4759-b6f5-0b739b619197","resolution":{"observed_at":"2026-05-12T02:06:15.362277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.20156","last_updated":"2026-04-22T03:50:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T03:50:52Z","title":"Temporally Extended Mixture-of-Experts Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:39:39.492135Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.20156"},"observation_digest":"sha256:a99c3586fa44f5ac31727bd0d85a19931c111c1ed52cecb7603d214d301749fc","observation_id":"94f2ab8f-a75a-49cb-acad-49e2270e6646","resolution":{"observed_at":"2026-05-10T00:39:48.314205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.23036","last_updated":"2026-04-24T21:48:20Z","snapshot_observed_at":"2026-07-06T23:09:19.041332Z","submitted_at":"2026-04-24T21:48:20Z","title":"Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T12:03:58.279499Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.23036"},"observation_digest":"sha256:50d4140c5b774c030d784935861bf02d5f790d538937f06742e2de2f3888a0c1","observation_id":"c9372f65-d6c0-4c07-addc-dcaba4a9384f","resolution":{"observed_at":"2026-05-11T19:21:09.646812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-02T06:50:35.896043Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T06:47:25.155437Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:62594a008696c77f148a56a5a5b00c190dc62680b7d05d3bb53c1b451a907f30","observation_id":"042d1a9f-7455-48ff-93a5-397f2be0765d","resolution":{"observed_at":"2026-05-10T06:51:46.405151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-02T06:50:35.896043Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:ffd7ad15764119f32f72fb59eaaf362e767e83a0c3dd0a048737d6e0094d959a","observation_id":"a72b52a1-6a79-4870-9cc3-a46ce8901e92","resolution":{"observed_at":"2026-05-11T01:45:52.053900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T03:34:10.370956Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:6396bf7c084547a0307c6b3b48ee7c73123ca50f8430979f3f53c5cc22ea16c6","observation_id":"8b1db52f-d37f-4c5f-951d-fda88f01870b","resolution":{"observed_at":"2026-05-12T07:16:28.485473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-20T23:22:51.808346Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:81ccd37738fc4ba6711a37926f93ff279ccc4e180777070fa8e7b46e8875f5bc","observation_id":"8b1d5189-8889-42d4-8edc-44ec47436a21","resolution":{"observed_at":"2026-05-20T23:23:51.219912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.15484","last_updated":"2026-05-15T00:01:11Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T00:01:11Z","title":"When Does Sparse MoE Help in Vision? The Role of Backbone Compute Leverage in Sparse Routing","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-19T16:21:02.198882Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.15484"},"observation_digest":"sha256:1a02d62caa37fd525e95a33f47880b61ac8ec3eccb13d46c705eaae941db2f47","observation_id":"a8f8732b-b5f8-480f-a672-2627725cc172","resolution":{"observed_at":"2026-05-19T16:22:39.608550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.23078","last_updated":"2026-05-21T22:23:38Z","snapshot_observed_at":"2026-08-02T10:30:48.658412Z","submitted_at":"2026-05-21T22:23:38Z","title":"GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T05:33:06.719954Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.23078"},"observation_digest":"sha256:0fd8d8e31c14fb1f6b6c01abdc97593c75de0341eba1629535a516381faf65fb","observation_id":"8fe14920-7977-42ae-b05a-7b40f3205cab","resolution":{"observed_at":"2026-05-25T05:36:39.868047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.00079","last_updated":"2026-05-22T13:05:53Z","snapshot_observed_at":"2026-08-05T07:27:21.222843Z","submitted_at":"2026-05-22T13:05:53Z","title":"BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T15:38:18.616792Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.00079"},"observation_digest":"sha256:5ce308ecbfe77b3a7871308bfb4909052013680d9ce4babc067f6f24d7991fd2","observation_id":"4122790f-c394-4632-9378-fc589a2f737f","resolution":{"observed_at":"2026-06-30T15:44:48.441458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.04160","last_updated":"2026-06-02T19:23:46Z","snapshot_observed_at":"2026-08-02T20:31:55.411643Z","submitted_at":"2026-06-02T19:23:46Z","title":"Expert-Aware Refusal Steering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T10:04:13.562338Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.04160"},"observation_digest":"sha256:0a3fe839a9c1ba1c9ba0e46a3a25adf7169e2b966e483ac11e8a827d173b3d05","observation_id":"cd5e468b-b1a5-4354-b53c-5e4c6d067459","resolution":{"observed_at":"2026-07-02T03:26:29.122065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.18304","last_updated":"2026-06-16T06:53:27Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T06:53:27Z","title":"Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T02:07:44.237002Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.18304"},"observation_digest":"sha256:cd727177f76c6174f651a70e0b45a111e7f4d1604a3728c157a25a50826b989d","observation_id":"4959bbd2-0486-4e39-af8f-e7e1a649a509","resolution":{"observed_at":"2026-07-03T19:08:50.013861Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.29982","last_updated":"2026-06-29T08:57:59Z","snapshot_observed_at":"2026-08-01T06:08:24.359622Z","submitted_at":"2026-06-29T08:57:59Z","title":"Beyond Uniform Experts: Cost-Aware Expert Execution for Efficient Multi-Device MoE Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T04:27:02.915854Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.29982"},"observation_digest":"sha256:346ae7c05b3d24c0a3c10b3091c85472737ad011175e96ddab6a0993b17640da","observation_id":"39e3a7b9-a421-459d-a781-95c484fb4e55","resolution":{"observed_at":"2026-06-30T17:14:57.435789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-11T08:35:22.347459Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05116","last_updated":"2026-07-06T14:06:25Z","snapshot_observed_at":"2026-08-02T18:01:37.878392Z","submitted_at":"2026-07-06T14:06:25Z","title":"Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T08:35:22.347459Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2607.05116"},"observation_digest":"sha256:af8e70d552b158399a22e9adc4cd11acf4995a61f16d8df8d575ec945fd54672","observation_id":"c6e63b0b-f3f9-4024-b036-bbd514680b1d","resolution":{"observed_at":"2026-07-11T08:35:22.347459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.14800/citation-record","integrity":"/paper/2402.14800/integrity","json":"/paper/2402.14800/citation-record.json","paper":"/paper/2402.14800"},"outbound":[],"paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2402.14800."}