A fine-tuning policy that samples a token-preservation rate from a uniform distribution lets a model be accelerated at inference by setting a pruning knob, without retraining.
In 2023 60th ACM/IEEE Design Automation Confer- ence (DAC), pages 1–6
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Efficient Large Language Models with Zero-Shot Adjustable Acceleration
A fine-tuning policy that samples a token-preservation rate from a uniform distribution lets a model be accelerated at inference by setting a pruning knob, without retraining.