An orthogonal similarity alignment learned from 100 images per task transfers task vectors from a YFCC100M-trained ViT to a LAION400M-trained ViT, reaching 71.9% average accuracy versus 72.9% for few-shot fine-tuning.
Emerging properties in self-supervised vision transformers
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Cross-Model Transfer of Task Vectors via Few-Shot Orthogonal Alignment
An orthogonal similarity alignment learned from 100 images per task transfers task vectors from a YFCC100M-trained ViT to a LAION400M-trained ViT, reaching 71.9% average accuracy versus 72.9% for few-shot fine-tuning.