A structural pruning framework for MoE models that solves channel-score coverage maximization via attribution approximation, preserving accuracy at 50% or 25% pruning plus 4-bit quantization on DeepSeek and Qwen models.
Mcmoe: Complet- ing missing modalities with mixture of experts for incom- plete multimodal action quality assessment.arXiv preprint arXiv:2511.17397
3 Pith papers cite this work. Polarity classification is still indexing.
years
2026 3verdicts
UNVERDICTED 3representative citing papers
A diffusion model with dynamic modality gating and cross-modal mutual learning restores missing features in VLMs bi-directionally while preserving the original model's generalization.
GMENet synthesizes missing MRI sequences with gated cross-attention and fuses dual-sequence features via confidence-aware mixture-of-experts for improved glioma diagnosis on incomplete multi-center data.
citing papers explorer
-
Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression
A structural pruning framework for MoE models that solves channel-score coverage maximization via attribution approximation, preserving accuracy at 50% or 25% pruning plus 4-bit quantization on DeepSeek and Qwen models.
-
Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration
A diffusion model with dynamic modality gating and cross-modal mutual learning restores missing features in VLMs bi-directionally while preserving the original model's generalization.
-
GMENet: Generative Mixture of Experts Network for Multi-Center Glioma Diagnosis with Incomplete Imaging Sequences
GMENet synthesizes missing MRI sequences with gated cross-attention and fuses dual-sequence features via confidence-aware mixture-of-experts for improved glioma diagnosis on incomplete multi-center data.