Energy-based AutoRegression (EAR) uses a strictly proper energy score to train a masked autoregressive Transformer on continuous image tokens, reaching ImageNet 256x256 FID 1.97 at 937M parameters while generating images in about one second.
cc/paper_files/paper/2019/file/ 8558cb408c1d76621371888657d2eb1d-Paper
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Continuous Visual Autoregressive Generation via Score Maximization
Energy-based AutoRegression (EAR) uses a strictly proper energy score to train a masked autoregressive Transformer on continuous image tokens, reaching ImageNet 256x256 FID 1.97 at 937M parameters while generating images in about one second.