Pith. sign in

Universal Adversarial Triggers for Attacking and Analyzing NLP

7 Pith papers cite this work, alongside 34 external citations. Polarity classification is still indexing.

7 Pith papers citing it
34 external citations · OpenAlex

years

2026 4 2023 3

representative citing papers

Low-Resource Languages Jailbreak GPT-4

cs.CL · 2023-10-03 · conditional · novelty 6.0

Translating unsafe inputs to low-resource languages jailbreaks GPT-4 at rates on par with or exceeding state-of-the-art attacks.

Universal Adversarial Triggers

cs.CL · 2026-05-18 · unverdicted · novelty 5.0

Combines POS filtering and perplexity loss to generate sensible universal adversarial triggers that drop SST sentiment accuracy to 0.04-0.12, with adversarial training raising it to 0.48.

citing papers explorer

Showing 7 of 7 citing papers.