{"as_of":"2026-08-08T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98c0bff684f707c6dfc69967abac126f94a21067a90bfcfb2eed02b52bf2da66","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:50:28.595718Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.02345/citation-record","integrity":"/paper/2510.02345/integrity","json":"/paper/2510.02345/citation-record.json","paper":"/paper/2510.02345"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:27.130480Z","title":"Harder tasks need more experts: Dynamic routing in moe models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.130480Z"},"links":{"citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:cd21c7a9a7953293cd37c3abc5d9a0dc9e6bb615d631f31e5e7eb3ae31c4b903","observation_id":"842ad0e5-cb19-4cdd-b3e7-ae15c1dc1777","resolution":{"observed_at":"2026-08-04T14:50:27.130480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11586","last_updated":"2023-11-20T07:51:48Z","snapshot_observed_at":"2026-07-06T16:49:49.827884Z","submitted_at":"2023-11-20T07:51:48Z","title":"Attractive interactions in the microstructures of asymptotically flat black holes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11586","snapshot_observed_at":"2026-08-04T14:50:27.631899Z","title":"MoE-Lite: A parameter- efficient mixture-of-experts architecture for domain-specific pre-training.arXiv preprint arXiv:2311.11586,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.631899Z"},"links":{"cited_paper":"/paper/2311.11586","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:bed1615a484539ea581c7e079583eaf435e56cdc1b9c3d21a73f57f935a0e7dd","observation_id":"c0d083ba-e15b-41d2-af2f-1b0ef6372b06","resolution":{"observed_at":"2026-08-04T14:50:27.631899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-04T14:50:27.761856Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding.arXiv preprint arXiv:2006.16668,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.761856Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:44c32dad37c383adac005e4d1bb2d70780767dce283a9daa4ba5920b2eae5a30","observation_id":"4a3a2cc9-cdb7-4f7b-9dc5-f7d63a3cf313","resolution":{"observed_at":"2026-08-04T14:50:27.761856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10814","last_updated":"2024-10-16T02:00:24Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:44Z","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10814","snapshot_observed_at":"2026-08-04T14:50:28.006100Z","title":"Your mixture-of-experts LLM is secretly an embedding model for free.arXiv preprint arXiv:2410.10814,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.006100Z"},"links":{"cited_paper":"/paper/2410.10814","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:b41aa04db57c25296ad21829aa95d8f93b63fabef7ecce9710a0cf69a7bb056d","observation_id":"ef86f980-9d7c-4e0c-a8a2-de15c80d46b8","resolution":{"observed_at":"2026-08-04T14:50:28.006100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08212","last_updated":"2024-11-12T22:03:37Z","snapshot_observed_at":"2026-07-06T19:49:26.117662Z","submitted_at":"2024-11-12T22:03:37Z","title":"PERFT: Parameter-Efficient Routed Fine-Tuning for Mixture-of-Expert Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08212","snapshot_observed_at":"2026-08-04T14:50:28.127696Z","title":"Perft: Parameter- efficient routed fine-tuning for mixture-of-expert model.arXiv preprint arXiv:2411.08212,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.127696Z"},"links":{"cited_paper":"/paper/2411.08212","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:6a0852b25ce563127d6f37bf609e7b97de3a4882f644c0c0a8b8b05bf77028ca","observation_id":"e83e0882-1c5d-4f7a-9c65-94a13644f928","resolution":{"observed_at":"2026-08-04T14:50:28.127696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-04T14:50:28.415521Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.415521Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:0e943e40d79caa0604dff3c9c2b09e1e0c1900f8f140981dfb0b91e904d69420","observation_id":"0e2737ca-bfe9-4611-9c1b-b8a4addfac28","resolution":{"observed_at":"2026-08-04T14:50:28.415521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01433","last_updated":"2024-11-06T01:49:45Z","snapshot_observed_at":"2026-07-06T19:44:12.347359Z","submitted_at":"2024-11-03T04:25:46Z","title":"HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01433","snapshot_observed_at":"2026-08-04T14:50:28.595718Z","title":"Hobbit: A mixed precision expert offloading system for fast moe inference.arXiv preprint arXiv:2411.01433,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.595718Z"},"links":{"cited_paper":"/paper/2411.01433","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:cf2acbc7b64a84a80c834db15c3323689998472197d98af695a2f4c20524d21f","observation_id":"ef34f6ef-dd67-4d82-9aa9-c59c0f1b628e","resolution":{"observed_at":"2026-08-04T14:50:28.595718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05191","last_updated":"2022-12-10T03:44:16Z","snapshot_observed_at":"2026-07-06T14:28:56.301970Z","submitted_at":"2022-12-10T03:44:16Z","title":"SMILE: Scaling Mixture-of-Experts with Efficient Bi-level Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05191","snapshot_observed_at":"2026-08-04T14:50:27.001013Z","title":"Smile: Scaling mixture-of-experts with efficient bi-level routing.arXiv preprint arXiv:2212.05191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.001013Z"},"links":{"cited_paper":"/paper/2212.05191","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:480da0d116f8ce4614afb9ede0fa91f8de1a60c836a5f257d8cd6eba70db9986","observation_id":"5d2835ae-e076-4e3f-bdba-cb21a34e07ed","resolution":{"observed_at":"2026-08-04T14:50:27.001013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-04T14:50:28.305370Z","title":"OLMoE: Open mixture-of-experts language models.arXiv preprint arXiv:2409.02060,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.305370Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:2e23e17e2ac37e7bb4f773053b8f12566080cbaa7fa45d5b6bfcb2fad2c71fe2","observation_id":"edc589a1-f992-457c-a3b0-9b88ff96ed8e","resolution":{"observed_at":"2026-08-04T14:50:28.305370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15828","last_updated":"2025-02-20T05:58:53Z","snapshot_observed_at":"2026-08-07T18:02:55.408702Z","submitted_at":"2025-02-20T05:58:53Z","title":"A Stronger Mixture of Low-Rank Experts for Fine-Tuning Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15828","snapshot_observed_at":"2026-08-04T14:50:28.482094Z","title":"A stronger mixture of low-rank experts for fine-tuning foundation models.arXiv preprint arXiv:2502.15828,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.482094Z"},"links":{"cited_paper":"/paper/2502.15828","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:3273a4a747fb2f8f89807306a7c1e1e42b2da999d375e42f1040da57bf8e293b","observation_id":"21831690-3225-4fa1-9258-8824e506373c","resolution":{"observed_at":"2026-08-04T14:50:28.482094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-04T14:50:27.211029Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.211029Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:b994e7c610ba4a00a6bf40a1b09ef76da02807c80c89b7dd80ca16e6700d5b4e","observation_id":"1ac43f15-2835-4702-851f-0f824ce12644","resolution":{"observed_at":"2026-08-04T14:50:27.211029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-04T14:50:28.194239Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:28.194239Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:75bbeebc632d6bf0bb159dc9250311a869ac576c1a280fe549a930d691b38b66","observation_id":"97ac8fce-3ce6-4a5f-a526-1f0f6d874e6f","resolution":{"observed_at":"2026-08-04T14:50:28.194239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23266","last_updated":"2025-06-29T14:43:50Z","snapshot_observed_at":"2026-08-07T02:39:39.049338Z","submitted_at":"2025-06-29T14:43:50Z","title":"Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23266","snapshot_observed_at":"2026-08-04T14:50:27.875803Z","title":"Sub-moe: Efficient mixture-of-expert llms compression via subspace expert merging.arXiv preprint arXiv:2506.23266,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.875803Z"},"links":{"cited_paper":"/paper/2506.23266","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:46a8b161651b48c6d4f1a6c5fdd672ff5138a4e639655e7f96a2f8335fd3a1b8","observation_id":"6c0a9910-cf7e-472d-8cbc-5efe986b71f5","resolution":{"observed_at":"2026-08-04T14:50:27.875803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-04T14:50:26.925600Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.arXiv preprint arXiv:2101.03961,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:26.925600Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:d1e750b7a1d84f89a15370228e655da809fcf09744b512249975dc485542d0c8","observation_id":"3a987b89-a9f3-47b3-b2d8-29e48cb9c897","resolution":{"observed_at":"2026-08-04T14:50:26.925600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-04T14:50:26.916040Z","title":"GLaM: Efficient scaling of language models with mixture-of-experts.arXiv preprint arXiv:2112.06905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:26.916040Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:fe851cfaa3eada236e62f844ec873d768f19fefe97cfb00f42aad13833caca88","observation_id":"8cf3ad8a-9b48-4d79-aaee-355c18ad0f5c","resolution":{"observed_at":"2026-08-04T14:50:26.916040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08396","last_updated":"2022-04-18T16:48:19Z","snapshot_observed_at":"2026-08-06T11:48:25.823149Z","submitted_at":"2022-04-18T16:48:19Z","title":"StableMoE: Stable Routing Strategy for Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08396","snapshot_observed_at":"2026-08-04T14:50:26.881379Z","title":"Stablemoe: Stable routing strategy for mixture of experts.arXiv preprint arXiv:2204.08396,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:26.881379Z"},"links":{"cited_paper":"/paper/2204.08396","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:97a9b59e8ea20713849e7f29cb7ceb65f4507116ce41d2f8fc8142dbd3ae30dd","observation_id":"ca7fc450-2f3c-4e2f-bc11-8b76a80bf606","resolution":{"observed_at":"2026-08-04T14:50:26.881379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15798","last_updated":"2025-05-25T14:46:33Z","snapshot_observed_at":"2026-08-07T16:50:17.419337Z","submitted_at":"2025-03-20T02:31:57Z","title":"Mixture of Lookup Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15798","snapshot_observed_at":"2026-08-04T14:50:27.381965Z","title":"Mixture of lookup experts.arXiv preprint arXiv:2503.15798,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.381965Z"},"links":{"cited_paper":"/paper/2503.15798","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:fc731e35f784229d68bdb5dc45043a0caf1a7958cf4df9289eb13bb322343f53","observation_id":"4c2775ab-d0b7-4785-87a8-104764d258cc","resolution":{"observed_at":"2026-08-04T14:50:27.381965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07348","last_updated":"2024-10-09T18:01:27Z","snapshot_observed_at":"2026-08-02T18:32:34.607901Z","submitted_at":"2024-10-09T18:01:27Z","title":"MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07348","snapshot_observed_at":"2026-08-04T14:50:27.505927Z","title":"MoE++: Accelerating mixture-of-experts methods with zero- computa- tion experts.arXiv preprint arXiv:2410.07348,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:27.505927Z"},"links":{"cited_paper":"/paper/2410.07348","citing_paper":"/paper/2510.02345"},"observation_digest":"sha256:41a54c3dad0cf175d31d3e41a4d2ea4d9a2e9556c9f94fdf9c414c393aa25e78","observation_id":"85905def-4ea5-47ee-a46e-70d9ec76f4c0","resolution":{"observed_at":"2026-08-04T14:50:27.505927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.02345","last_updated":"2026-07-21T06:35:53Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T14:50:24.826478Z","submitted_at":"2025-09-27T10:45:58Z","title":"Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2510.02345."}