Pith. sign in

← back to paper

Review history

arxiv: 2608.06545 · 2 revisions

Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions

  1. 2026-08-15 ACCEPT MODERATE v1.4.0-alltime-deepseek-medium novelty 8.0
    102460 ms 73870 in 11358 out 2026-08-15T14:31:18.446116+00:00
  2. 2026-08-10 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 8.0
    118498 ms 73580 in 13795 out 2026-08-10T04:16:50.825807+00:00