Pith. sign in

← back to paper

Review history

arxiv: 2606.30420 · 2 revisions

Experience Augmented Policy Optimization for LLM Reasoning

  1. 2026-08-02 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    150919 ms 13641 in 16660 out 2026-08-02T09:27:38.768106+00:00
  2. 2026-06-30 UNVERDICTED LOW v0.9.1-grok novelty 5.0
    23613 ms 5748 in 1049 out 2026-06-30T06:50:26.463273+00:00