Pith. sign in

← back to paper

Review history

arxiv: 2509.25148 · 2 revisions

AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 4.0
    143443 ms 19016 in 17559 out 2026-08-15T15:43:21.490788+00:00
  2. 2026-08-04 REJECT MODERATE v1.3.0-alltime-deepseek novelty 4.0
    100648 ms 18982 in 16041 out 2026-08-04T13:47:13.664814+00:00