A benchmark dataset pairing 647 human-written STEM lessons with generated, human-reviewed lesson plans across 240 topics, plus a proposed three-part evaluation pipeline.
In: Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Vol- ume 1: Long Papers)
1 Pith paper cite this work, alongside 3 external citations. Polarity classification is still indexing.
1
Pith paper citing it
3
external citations · OpenAlex
fields
cs.CY 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents
A benchmark dataset pairing 647 human-written STEM lessons with generated, human-reviewed lesson plans across 240 topics, plus a proposed three-part evaluation pipeline.