Pith. sign in

← back to paper

Review history

arxiv: 2507.20150 · 2 revisions

The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models

  1. 2026-08-15 CONDITIONAL HIGH v1.4.0-alltime-deepseek-medium novelty 5.0
    176036 ms 34882 in 16974 out 2026-08-15T17:49:25.088151+00:00
  2. 2026-08-06 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    176050 ms 35319 in 16722 out 2026-08-06T13:42:27.098610+00:00