RCO trains critic LLMs using refinement utility, the extent to which a critique improves a revised answer, as the reward, outperforming direct critique preference methods across five tasks.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Training Language Model to Critique for Better Refinement
RCO trains critic LLMs using refinement utility, the extent to which a critique improves a revised answer, as the reward, outperforming direct critique preference methods across five tasks.