Pith. sign in

← back to paper

Review history

arxiv: 2601.02986 · 2 revisions

P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist

  1. 2026-08-03 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    126260 ms 23905 in 13437 out 2026-08-03T12:24:20.681556+00:00
  2. 2026-05-16 UNVERDICTED LOW v0.9.0 novelty 7.0
    33222 ms 5430 in 1005 out 2026-05-16T17:34:46.181441+00:00