Pith. sign in

← back to paper

Review history

arxiv: 2511.23310 · 2 revisions

Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards

  1. 2026-08-04 REJECT MODERATE v1.3.0-alltime-deepseek novelty 4.0
    168562 ms 68 in 19744 out 2026-08-04T06:41:20.925102+00:00
  2. 2026-08-03 REJECT MODERATE v1.3.0-alltime-deepseek novelty 4.0
    115883 ms 17988 in 12806 out 2026-08-03T19:31:55.589166+00:00