Pith. sign in

← back to paper

Review history

arxiv: 2608.07371 · 2 revisions

Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

  1. 2026-08-15 CONDITIONAL HIGH v1.4.0-alltime-deepseek-medium novelty 6.0
    101497 ms 14662 in 13527 out 2026-08-15T14:27:26.931083+00:00
  2. 2026-08-10 CONDITIONAL MODERATE v1.4.0-daily-deepseek-medium novelty 6.0
    97889 ms 14687 in 12364 out 2026-08-10T05:28:30.868745+00:00