Subtracting a difference-in-means activation vector from a transformer classifier's residual stream at inference time improves worst-group accuracy on biased benchmarks.
Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
No Training Wheels: Steering Vectors for Bias Correction at Inference Time
Subtracting a difference-in-means activation vector from a transformer classifier's residual stream at inference time improves worst-group accuracy on biased benchmarks.