A decoder transformer with learnable queries plus a low-rank parallel adapter for frozen DINOv2 achieves state-of-the-art visual place recognition on multiple benchmarks with reduced training memory.
MixVPR: Feature mixing for visual place recognition,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
baseline 1
citation-polarity summary
fields
cs.CV 1years
2024 1verdicts
CONDITIONAL 1roles
baseline 1polarities
baseline 1representative citing papers
citing papers explorer
-
EDTformer: An Efficient Decoder Transformer for Visual Place Recognition
A decoder transformer with learnable queries plus a low-rank parallel adapter for frozen DINOv2 achieves state-of-the-art visual place recognition on multiple benchmarks with reduced training memory.