Pith. sign in

← back to paper

Review history

arxiv: 2508.17445 · 2 revisions

TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    85886 ms 13441 in 8990 out 2026-08-15T17:03:25.594763+00:00
  2. 2026-08-05 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    156527 ms 13426 in 14270 out 2026-08-05T16:52:39.594756+00:00