← back to paper
Review history
arxiv:
2608.09096
· 2 revisions
Evo-Bench: Can Language Models Improve Agent Harness?
-
2026-08-14
CONDITIONAL
MODERATE
v1.4.0-alltime-deepseek-medium
novelty 6.0
140872 ms
20697 in
15248 out
2026-08-14T04:16:33.353614+00:00
-
2026-08-11
CONDITIONAL
MODERATE
v1.4.0-daily-deepseek-medium
novelty 6.0
157895 ms
20697 in
15727 out
2026-08-11T23:38:43.423975+00:00