A 728-prompt multi-genre Chinese essay benchmark whose hierarchical, genre-specific LLM scoring aligns with human rankings better than a general-purpose writing baseline, especially with DeepSeek-R1 as judge.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
A 728-prompt multi-genre Chinese essay benchmark whose hierarchical, genre-specific LLM scoring aligns with human rankings better than a general-purpose writing baseline, especially with DeepSeek-R1 as judge.