A significance-based framework for multi-metric, multi-dataset LLM comparison, demonstrated on CrossCodeEval, reports all 15 tested models as statistically distinguishable by p-value while providing effect-size and visualization tools.
Statistical Power Analysis for the Behavioral Sciences
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
stat.AP 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Statistical multi-metric evaluation and visualization of LLM system predictive performance
A significance-based framework for multi-metric, multi-dataset LLM comparison, demonstrated on CrossCodeEval, reports all 15 tested models as statistically distinguishable by p-value while providing effect-size and visualization tools.