An ensemble of five LLM evaluators plus conformal prediction labeled surgical instructions as ambiguous or clear with 70% (Llama 3.2 11B) and 82.5% (Gemma 3 12B) accuracy, measured in-sample on the 40-instruction calibration set.
Large language models for human–robot interaction: A review,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.RO 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
LLM-based ambiguity detection in natural language instructions for collaborative surgical robots
An ensemble of five LLM evaluators plus conformal prediction labeled surgical instructions as ambiguous or clear with 70% (Llama 3.2 11B) and 82.5% (Gemma 3 12B) accuracy, measured in-sample on the 40-instruction calibration set.