GlobalDentBench shows frontier LLMs drop from 81% accuracy on multiple-choice questions to 22% on case-based questions with 31% unsafe rates in dental clinical recommendations.
Nature medicine31, 943–950 (2025)
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.AI 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
GlobalDentBench shows frontier LLMs drop from 81% accuracy on multiple-choice questions to 22% on case-based questions with 31% unsafe rates in dental clinical recommendations.