HELM establishes a multi-metric evaluation covering 30 language models on 42 scenarios (16 core) to raise average scenario coverage from 17.9% to 96% under uniform conditions while releasing all prompts, completions, and a toolkit.
Title resolution pending
1 Pith paper cite this work, alongside 70 external citations. Polarity classification is still indexing.
1
Pith paper citing it
70
external citations · OpenAlex
fields
cs.CL 1years
2022 1verdicts
ACCEPT 1representative citing papers
citing papers explorer
-
Holistic Evaluation of Language Models
HELM establishes a multi-metric evaluation covering 30 language models on 42 scenarios (16 core) to raise average scenario coverage from 17.9% to 96% under uniform conditions while releasing all prompts, completions, and a toolkit.