Two co-trained reward models that filter each other's training batches via peer review and synchronized curriculum learning improve reward-model accuracy and downstream policy win-rates under injected preference noise.
Reward Function Design in Reinforcement Learning, pages 25–33
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
Two co-trained reward models that filter each other's training batches via peer review and synchronized curriculum learning improve reward-model accuracy and downstream policy win-rates under injected preference noise.