Pith. sign in

← back to paper

Review history

arxiv: 2608.03545 · 2 revisions

Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

  1. 2026-08-08 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    157344 ms 21528 in 17494 out 2026-08-08T00:45:36.641544+00:00
  2. 2026-08-05 CONDITIONAL MODERATE v1.4.0-daily-deepseek-medium novelty 6.0
    121387 ms 21175 in 12218 out 2026-08-05T16:57:31.119996+00:00