Pith. sign in

← back to paper

Review history

arxiv: 2509.22047 · 2 revisions

MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    119421 ms 18933 in 16986 out 2026-08-15T15:44:52.234984+00:00
  2. 2026-08-04 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 5.0
    215414 ms 18951 in 21349 out 2026-08-04T14:58:33.934748+00:00