MAETok shows that a masked-autoencoder-trained plain autoencoder, without variational constraints, reaches state-of-the-art ImageNet generation quality using only 128 latent tokens.
We use a classifier-free guidance scale of 2.0
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Masked Autoencoders Are Effective Tokenizers for Diffusion Models
MAETok shows that a masked-autoencoder-trained plain autoencoder, without variational constraints, reaches state-of-the-art ImageNet generation quality using only 128 latent tokens.