Pith. sign in

The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation

4 Pith papers cite this work. Polarity classification is still indexing.

4 Pith papers citing it

citation-role summary

baseline 1

citation-polarity summary

fields

cs.LG 3 cs.CL 1

years

2026 4

verdicts

UNVERDICTED 4

roles

baseline 1

polarities

baseline 1

representative citing papers

On Advantage Estimates for Max@K Policy Gradients

cs.LG · 2026-06-04 · unverdicted · novelty 6.0

Proposes MaxPO using a Leave-Two-Out baseline for centered unbiased advantages in max@K policy gradients, with a unified derivation of finite-batch estimators.

citing papers explorer

Showing 4 of 4 citing papers.