A CLIP-based network predicts a feature-map score defined as 80% NDS ratio plus 20% similarity to SOTA features; using it as an auxiliary loss gives a 3.89% average NDS gain on BEVFormer.
Grad-cam++: Gener- alized gradient-based visual explanations for deep con- volutional networks
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Decoupled Functional Evaluation of Autonomous Driving Models via Feature Map Quality Scoring
A CLIP-based network predicts a feature-map score defined as 80% NDS ratio plus 20% similarity to SOTA features; using it as an auxiliary loss gives a 3.89% average NDS gain on BEVFormer.