A VQ-AE-based module-scoring method picks steering locations in LLMs, improving truthfulness and knowledge-selection steering over ITI and SPARE baselines.
Steering gpt-2-xl by adding an activation vector
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering
A VQ-AE-based module-scoring method picks steering locations in LLMs, improving truthfulness and knowledge-selection steering over ITI and SPARE baselines.