Pith. sign in

← back to paper

Review history

arxiv: 2607.01153 · 2 revisions

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

  1. 2026-08-02 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    245252 ms 69 in 12497 out 2026-08-02T09:07:51.234749+00:00
  2. 2026-07-02 UNVERDICTED LOW v0.9.1-grok novelty 5.0
    26341 ms 5727 in 1027 out 2026-07-02T12:28:35.335206+00:00