A production system that combines object-detection-based image cropping and LLM-based text rewriting with CLIP fine-tuning reports large gains in multimodal retrieval and online recommendation metrics at Walmart scale.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.IR 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
A production system that combines object-detection-based image cropping and LLM-based text rewriting with CLIP fine-tuning reports large gains in multimodal retrieval and online recommendation metrics at Walmart scale.