Pith. sign in

← back to paper

Review history

arxiv: 2506.14682 · 2 revisions

AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    128828 ms 39069 in 14122 out 2026-08-15T19:48:41.193631+00:00
  2. 2026-08-07 CONDITIONAL HIGH v1.4.0-alltime-deepseek-medium novelty 5.0
    115473 ms 39069 in 13677 out 2026-08-07T00:15:20.000772+00:00