OMEGA is a templated math benchmark showing that LLMs, including RL-tuned models, generalize to harder instances but largely fail at compositional and transformative reasoning.
Creativity and artificial intelligence.Artificial intelligence, 103(1-2):347–356, 1998
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
method 1
citation-polarity summary
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1roles
method 1polarities
use method 1representative citing papers
citing papers explorer
-
OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
OMEGA is a templated math benchmark showing that LLMs, including RL-tuned models, generalize to harder instances but largely fail at compositional and transformative reasoning.