A visual-language tracker with fine-grained attribute decomposition and a cross-modal token achieves top results on TNL2K, but its ablation data is internally inconsistent.
Mixformer: End-to-end tracking with iterative mixed atten- tion
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
A visual-language tracker with fine-grained attribute decomposition and a cross-modal token achieves top results on TNL2K, but its ablation data is internally inconsistent.