SearchAuditBench and SearchAuditor let LLM auditors localize, attribute, and repair failures in long-horizon search agents, reaching a 32.3% end-to-end pass rate with GPT-5.5 versus 26.6% for the strongest baseline.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.AI 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents
SearchAuditBench and SearchAuditor let LLM auditors localize, attribute, and repair failures in long-horizon search agents, reaching a 32.3% end-to-end pass rate with GPT-5.5 versus 26.6% for the strongest baseline.