A frozen-encoder anchor-bank energy scorer for LLM safety achieves fast zero-shot moderation, but its own table shows the average accuracy is below baselines it compares against.
ToxicChat: Unveiling Hidden Toxicity in Real-World User-AI Conversations.Proceedings of EMNLP, pages 4694–4702, 2023
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
baseline 1
citation-polarity summary
fields
cs.AI 1years
2026 1verdicts
REJECT 1roles
baseline 1polarities
baseline 1representative citing papers
citing papers explorer
-
HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails
A frozen-encoder anchor-bank energy scorer for LLM safety achieves fast zero-shot moderation, but its own table shows the average accuracy is below baselines it compares against.