Finedefics improves fine-grained image classification in multimodal LLMs by contrastively aligning image, attribute, and category embeddings, though its headline gains are measured against zero-shot baselines rather than equally fine-tuned ones.
As shown in Table 4, after employing our proposed method, LLaV A 1.5 gains an accuracy improvement by 13.97% on average, demonstrating the effectiveness and generalizability
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
Finedefics improves fine-grained image classification in multimodal LLMs by contrastively aligning image, attribute, and category embeddings, though its headline gains are measured against zero-shot baselines rather than equally fine-tuned ones.