On 130 obfuscated security protocols, GPT and DeepSeek verdicts are no substitute for ProVerif/OFMC: chat models over-alarm, reasoning models miss about half of true attacks, and confidence scores cannot distinguish correct from incorrect verdicts.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CR 1years
2026 1verdicts
ACCEPT 1representative citing papers
citing papers explorer
-
Evaluating Large Language Models for Symbolic Security Protocol Analysis
On 130 obfuscated security protocols, GPT and DeepSeek verdicts are no substitute for ProVerif/OFMC: chat models over-alarm, reasoning models miss about half of true attacks, and confidence scores cannot distinguish correct from incorrect verdicts.