Fine-tuning a vision-language model on a synthetic 4-clue dataset and adding a self-critique inference loop improves robustness to domain shifts in object recognition.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
Fine-tuning a vision-language model on a synthetic 4-clue dataset and adding a self-critique inference loop improves robustness to domain shifts in object recognition.