Pith. sign in

← back to paper

Review history

arxiv: 2508.12790 · 2 revisions

Reinforcement Learning with Rubric Anchors

  1. 2026-08-15 UNVERDICTED LOW v1.4.0-alltime-deepseek-medium novelty 6.0
    62272 ms 21106 in 7194 out 2026-08-15T17:17:37.533080+00:00
  2. 2026-08-05 UNVERDICTED LOW v1.4.0-alltime-deepseek-medium novelty 6.0
    91235 ms 21080 in 8214 out 2026-08-05T19:17:58.317976+00:00