Evaluation conditions like seed, dataset version, and answer ordering cause multi-point benchmark score swings in DeepSeek-R1-Distill and related reasoning models, undermining reliable comparison.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.AI 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
Evaluation conditions like seed, dataset version, and answer ordering cause multi-point benchmark score swings in DeepSeek-R1-Distill and related reasoning models, undermining reliable comparison.