A modality-weighted quantization method improves accuracy of 3-bit and 4-bit vision-language models by protecting sensitive language tokens during calibration.
Madtp: Multi- modal alignment-guided dynamic token pruning for accel- erating vision-language transformer
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2024 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
A modality-weighted quantization method improves accuracy of 3-bit and 4-bit vision-language models by protecting sensitive language tokens during calibration.