ALRPHFS builds an adversarially refined library of semantic risk patterns and uses fast retrieval plus slow LLM reasoning to defend LLM agents, reporting best-in-class average accuracy near 80 percent.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CR 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
ALRPHFS: Adversarially Learned Risk Patterns with Hierarchical Fast \& Slow Reasoning for Robust Agent Defense
ALRPHFS builds an adversarially refined library of semantic risk patterns and uses fast retrieval plus slow LLM reasoning to defend LLM agents, reporting best-in-class average accuracy near 80 percent.