BNPO dynamically normalizes binary rewards using a Beta distribution with parameters adapted from the current batch, claiming reduced gradient variance and state-of-the-art math reasoning performance.
Reinforcement learning: An introduction
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
BNPO: Beta Normalization Policy Optimization
BNPO dynamically normalizes binary rewards using a Beta distribution with parameters adapted from the current batch, claiming reduced gradient variance and state-of-the-art math reasoning performance.