A new 105-question cosmology benchmark ranks nine retrieval-augmented generation systems, placing an OpenAI configuration first at 91.4 percent accuracy, with a calibrated AI judge that tracks human evaluation.
when citing the specific papers listed above
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
astro-ph.IM 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Evaluating Retrieval-Augmented Generation Agents for Autonomous Scientific Discovery in Astrophysics
A new 105-question cosmology benchmark ranks nine retrieval-augmented generation systems, placing an OpenAI configuration first at 91.4 percent accuracy, with a calibrated AI judge that tracks human evaluation.