A visual-language tracker with fine-grained attribute decomposition and a cross-modal token achieves top results on TNL2K, but its ablation data is internally inconsistent.
Robust object modeling for visual tracking
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
A visual-language tracker with fine-grained attribute decomposition and a cross-modal token achieves top results on TNL2K, but its ablation data is internally inconsistent.