SaPE2 adds a 2D content-dependent position bias to vision transformer attention and reports top-1 accuracy gains on CIFAR-10 and CIFAR-100 over several position-encoding baselines.
A survey of convolutional neural networks: analysis, applications, and prospects
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
A 2D Semantic-Aware Position Encoding for Vision Transformers
SaPE2 adds a 2D content-dependent position bias to vision transformer attention and reports top-1 accuracy gains on CIFAR-10 and CIFAR-100 over several position-encoding baselines.