Across 690 adversarial clinical scenarios, high mean LLM scores still hide zero-score safety failures, so variance and hybrid clinician scoring better indicate medical reliability than average accuracy.
Title resolution pending
1 Pith paper cite this work, alongside 148 external citations. Polarity classification is still indexing.
1
Pith paper citing it
148
external citations · external index
fields
cs.CL 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models
Across 690 adversarial clinical scenarios, high mean LLM scores still hide zero-score safety failures, so variance and hybrid clinician scoring better indicate medical reliability than average accuracy.