Pith. sign in

Reinforcement learning: An introduction

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it

fields

cs.LG 1

years

2025 1

verdicts

REJECT 1

representative citing papers

BNPO: Beta Normalization Policy Optimization

cs.LG · 2025-06-03 · reject · novelty 6.0

BNPO dynamically normalizes binary rewards using a Beta distribution with parameters adapted from the current batch, claiming reduced gradient variance and state-of-the-art math reasoning performance.

citing papers explorer

Showing 1 of 1 citing paper.

  • BNPO: Beta Normalization Policy Optimization cs.LG · 2025-06-03 · reject · none · ref 4

    BNPO dynamically normalizes binary rewards using a Beta distribution with parameters adapted from the current batch, claiming reduced gradient variance and state-of-the-art math reasoning performance.