← back to paper
arxiv: 2607.10481 · 2 revisions
ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples