A 32-token 1D image tokenizer, optimized at test time against CLIP or reconstruction losses, performs image editing, inpainting, and class-conditional generation without training a generative model.
High fidelity visualization of what your self-supervised representation knows about
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Highly Compressed Tokenizer Can Generate Without Training
A 32-token 1D image tokenizer, optimized at test time against CLIP or reconstruction losses, performs image editing, inpainting, and class-conditional generation without training a generative model.