The paper argues that perturbing benchmark questions with rule-based interventions gives a less contaminated, more interpretable evaluation of LLMs than static benchmarks or agent-generated questions.
Does data contamination make a difference? insights from intentionally contaminating pre-training data for language models
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.AI 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Unbiased Evaluation of Large Language Models from a Causal Perspective
The paper argues that perturbing benchmark questions with rule-based interventions gives a less contaminated, more interpretable evaluation of LLMs than static benchmarks or agent-generated questions.