Pith. sign in

Google DeepMind

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it

fields

cs.CR 1

years

2025 1

verdicts

CONDITIONAL 1

representative citing papers

HauntAttack: When Attack Follows Reasoning as a Shadow

cs.CR · 2025-06-08 · conditional · novelty 6.0

HauntAttack embeds harmful instructions into reasoning-question conditions and reports a 70% average attack success rate across 11 large reasoning models, outperforming prior jailbreak baselines.

citing papers explorer

Showing 1 of 1 citing paper.

  • HauntAttack: When Attack Follows Reasoning as a Shadow cs.CR · 2025-06-08 · conditional · none · ref 3

    HauntAttack embeds harmful instructions into reasoning-question conditions and reports a 70% average attack success rate across 11 large reasoning models, outperforming prior jailbreak baselines.