Pith. sign in

← back to paper

Review history

arxiv: 2608.02831 · 2 revisions

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    107487 ms 20052 in 14442 out 2026-08-15T14:57:53.096620+00:00
  2. 2026-08-07 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    407450 ms 20097 in 10778 out 2026-08-07T00:07:10.056094+00:00