Pith. sign in

Targeted vaccine: Safety alignment for large language models against harmful fine-tuning via layer-wise perturbation

5 Pith papers cite this work. Polarity classification is still indexing.

5 Pith papers citing it

citation-role summary

background 2

citation-polarity summary

fields

cs.CR 3 cs.LG 2

roles

background 2

polarities

background 2

representative citing papers

Secure LLM Fine-Tuning via Safety-Aware Probing

cs.LG · 2025-05-22 · unverdicted · novelty 6.0

SAP locates safety-correlated directions via contrastive signals and perturbs hidden-state propagation with a lightweight probe to preserve safety while fine-tuning LLMs for task performance.

citing papers explorer

Showing 5 of 5 citing papers.