Softplus-then-perturb with embedding-seeded Gaussian noise defeats PCA/averaging/RPCA dimension-extraction attacks on Mistral-7B and GPT-2 with only modest quality loss.
Title resolution pending
1 Pith paper cite this work, alongside 69 external citations. Polarity classification is still indexing.
1
Pith paper citing it
69
external citations · external index
fields
cs.CR 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Can Watermarking Techniques Help Prevent LLM Model Stealing?
Softplus-then-perturb with embedding-seeded Gaussian noise defeats PCA/averaging/RPCA dimension-extraction attacks on Mistral-7B and GPT-2 with only modest quality loss.