MQuant quantizes multimodal LLMs to W4A8 using per-modality static scales, token reordering, and Hadamard-outlier suppression, claiming near-floating-point accuracy and up to 30% latency reduction on five MLLMs.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
MQuant quantizes multimodal LLMs to W4A8 using per-modality static scales, token reordering, and Hadamard-outlier suppression, claiming near-floating-point accuracy and up to 30% latency reduction on five MLLMs.