Pith. sign in

← back to paper

Review history

arxiv: 2607.27203 · 2 revisions

Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

  1. 2026-07-30 CONDITIONAL MODERATE v1.2.0-grok45-kimik3 novelty 6.0
    56403 ms 17431 in 3516 out 2026-07-30T11:00:22.727617+00:00
  2. 2026-07-30 UNVERDICTED LOW v1.1.0-grok45 novelty 5.0
    51842 ms 6139 in 2639 out 2026-07-30T09:42:27.878136+00:00