Pith. sign in

← back to paper

Review history

arxiv: 2608.09507 · 2 revisions

Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning

  1. 2026-08-14 CONDITIONAL HIGH v1.4.0-alltime-deepseek-medium novelty 6.0
    161519 ms 22526 in 18439 out 2026-08-14T04:14:48.726776+00:00
  2. 2026-08-11 CONDITIONAL MODERATE v1.4.0-daily-deepseek-medium novelty 5.0
    110430 ms 22481 in 12722 out 2026-08-11T15:57:19.496021+00:00