Overlaying teacher integrated-gradient maps on 10% of training images improves knowledge-distilled students by about one percentage point on CIFAR-10 at 4.1x compression.
arXiv preprint arXiv:170906030
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Model compression using knowledge distillation with integrated gradients
Overlaying teacher integrated-gradient maps on 10% of training images improves knowledge-distilled students by about one percentage point on CIFAR-10 at 4.1x compression.