Pith. sign in

← back to paper

Review history

arxiv: 2607.26873 · 2 revisions

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

  1. 2026-08-03 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 7.0
    318752 ms 22614 in 30157 out 2026-08-03T01:41:58.504400+00:00
  2. 2026-07-30 CONDITIONAL MODERATE v1.2.0-daily-grok45 novelty 7.0
    125176 ms 28128 in 4346 out 2026-07-30T18:31:06.002748+00:00