Pith. sign in

← back to paper

Review history

arxiv: 2506.15068 · 2 revisions

Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation

  1. 2026-08-15 CONDITIONAL HIGH v1.4.0-alltime-deepseek-medium novelty 5.0
    131040 ms 20420 in 14212 out 2026-08-15T19:44:29.392672+00:00
  2. 2026-08-07 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    452373 ms 20436 in 15483 out 2026-08-07T00:07:45.824753+00:00