{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:GKT3LLXDIXJGJNZBMOQORECHY2","short_pith_number":"pith:GKT3LLXD","schema_version":"1.0","canonical_sha256":"32a7b5aee345d264b72163a0e89047c6b41645381d3fc20a00ec735b70e1e8a8","source":{"kind":"arxiv","id":"2412.14219","version":2},"attestation_state":"computed","paper":{"title":"A Survey on Inference Optimization Techniques for Mixture of Experts Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.DC"],"primary_cat":"cs.LG","authors_text":"Chao Li, Jiacheng Liu, Minyi Guo, Peng Tang, Pheng-Ann Heng, Wenfeng Wang, Xiaofeng Hou, Yuhang Ren","submitted_at":"2024-12-18T14:11:15Z","abstract_excerpt":"The emergence of large-scale Mixture of Experts (MoE) models represents a significant advancement in artificial intelligence, offering enhanced model capacity and computational efficiency through conditional computation. However, deploying and running inference on these models presents significant challenges in computational resources, latency, and energy efficiency. This comprehensive survey analyzes optimization techniques for MoE models across the entire system stack. We first establish a taxonomical framework that categorizes optimization approaches into model-level, system-level, and hard"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.14219","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-12-18T14:11:15Z","cross_cats_sorted":["cs.AI","cs.DC"],"title_canon_sha256":"d703dcd414320121d539cf03d5ed9a2e2ca1476261d49cd4001370ec1f356d35","abstract_canon_sha256":"3a84cb61df6defa1693c2a9f7b0a7e4514a5cef3e2ee59dff6ea233f4fa56132"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:03:50.327906Z","signature_b64":"/C9uo5qwPh3lUCKPydATmxaOAkBdCEi0TTx1amqrTZgaSwUr7G/b5ReeFZ19hCEfn39sSPdm3+7gp56ed7HBDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"32a7b5aee345d264b72163a0e89047c6b41645381d3fc20a00ec735b70e1e8a8","last_reissued_at":"2026-07-05T10:03:50.327350Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:03:50.327350Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Survey on Inference Optimization Techniques for Mixture of Experts Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.DC"],"primary_cat":"cs.LG","authors_text":"Chao Li, Jiacheng Liu, Minyi Guo, Peng Tang, Pheng-Ann Heng, Wenfeng Wang, Xiaofeng Hou, Yuhang Ren","submitted_at":"2024-12-18T14:11:15Z","abstract_excerpt":"The emergence of large-scale Mixture of Experts (MoE) models represents a significant advancement in artificial intelligence, offering enhanced model capacity and computational efficiency through conditional computation. However, deploying and running inference on these models presents significant challenges in computational resources, latency, and energy efficiency. This comprehensive survey analyzes optimization techniques for MoE models across the entire system stack. We first establish a taxonomical framework that categorizes optimization approaches into model-level, system-level, and hard"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.14219","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.14219/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.14219","created_at":"2026-07-05T10:03:50.327419+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.14219v2","created_at":"2026-07-05T10:03:50.327419+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.14219","created_at":"2026-07-05T10:03:50.327419+00:00"},{"alias_kind":"pith_short_12","alias_value":"GKT3LLXDIXJG","created_at":"2026-07-05T10:03:50.327419+00:00"},{"alias_kind":"pith_short_16","alias_value":"GKT3LLXDIXJGJNZB","created_at":"2026-07-05T10:03:50.327419+00:00"},{"alias_kind":"pith_short_8","alias_value":"GKT3LLXD","created_at":"2026-07-05T10:03:50.327419+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.29982","citing_title":"Beyond Uniform Experts: Cost-Aware Expert Execution for Efficient Multi-Device MoE Inference","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17889","citing_title":"CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2603.06003","citing_title":"EvoESAP: Non-Uniform Expert Pruning for Sparse MoE","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11537","citing_title":"Fast MoE Inference via Predictive Prefetching and Expert Replication","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04449","citing_title":"GEM: Graph-Enhanced Mixture-of-Experts with ReAct Agents for Dialogue State Tracking","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07857","citing_title":"Networking-Aware Energy Efficiency in Agentic AI Inference: A Survey","ref_index":71,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2","json":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2.json","graph_json":"https://pith.science/api/pith-number/GKT3LLXDIXJGJNZBMOQORECHY2/graph.json","events_json":"https://pith.science/api/pith-number/GKT3LLXDIXJGJNZBMOQORECHY2/events.json","paper":"https://pith.science/paper/GKT3LLXD"},"agent_actions":{"view_html":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2","download_json":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2.json","view_paper":"https://pith.science/paper/GKT3LLXD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.14219&json=true","fetch_graph":"https://pith.science/api/pith-number/GKT3LLXDIXJGJNZBMOQORECHY2/graph.json","fetch_events":"https://pith.science/api/pith-number/GKT3LLXDIXJGJNZBMOQORECHY2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2/action/storage_attestation","attest_author":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2/action/author_attestation","sign_citation":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2/action/citation_signature","submit_replication":"https://pith.science/pith/GKT3LLXDIXJGJNZBMOQORECHY2/action/replication_record"}},"created_at":"2026-07-05T10:03:50.327419+00:00","updated_at":"2026-07-05T10:03:50.327419+00:00"}