Membership inference attacks on LLMs score synthetic text as more 'member-like' than real training data, so using synthetic data as non-members produces misleading memorization conclusions.
Evaluations of machine learning privacy defenses are misleading
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Synthetic Data Can Mislead Evaluations: Membership Inference as Machine Text Detection
Membership inference attacks on LLMs score synthetic text as more 'member-like' than real training data, so using synthetic data as non-members produces misleading memorization conclusions.