A framework that uses LLM sparse autoencoder features as high-dimensional outcome variables, with new k-FWER controlling bootstrap tests and formalized autointerp evaluation, to make interpretable discoveries from unstructured data.
Title resolution pending
3 Pith papers cite this work. Polarity classification is still indexing.
years
2025 3representative citing papers
Introduces Modality Dominance Score (MDS) to measure modality-specific features in VLMs and applies training-free editing to improve bias mitigation, adversarial generation, and modality control.
TEXTER generates zero-shot textual explanations for image classifiers by isolating decision-critical features from contributing neurons, mapping them into CLIP space, and using sparse autoencoders for improved interpretability in Transformers.
citing papers explorer
-
Making Interpretable Discoveries from Unstructured Data: A High-Dimensional Multiple Hypothesis Testing Approach
A framework that uses LLM sparse autoencoder features as high-dimensional outcome variables, with new k-FWER controlling bootstrap tests and formalized autointerp evaluation, to make interpretable discoveries from unstructured data.
-
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
Introduces Modality Dominance Score (MDS) to measure modality-specific features in VLMs and applies training-free editing to improve bias mitigation, adversarial generation, and modality control.
-
Zero-Shot Textual Explanations via Translating Decision-Critical Features
TEXTER generates zero-shot textual explanations for image classifiers by isolating decision-critical features from contributing neurons, mapping them into CLIP space, and using sparse autoencoders for improved interpretability in Transformers.