TGQ-Former uses metadata-guided hybrid queries and dual-gated modulation to improve visual token selection in multimodal e-commerce retrieval, raising average Hit Rate@100 by 6.04% over baselines.
arXiv preprint arXiv:2502.15711(2025)
4 Pith papers cite this work. Polarity classification is still indexing.
citation-role summary
citation-polarity summary
years
2026 4roles
background 1polarities
background 1representative citing papers
REVEAL is a plug-and-play framework that refines visual feature extraction via task feedback and dynamically balances visual-text learning to improve multimodal recommendation performance.
DPPMG learns discrete modal-specific preferences via a dedicated GNN from multimodal user data, quantizes them into tokens, and feeds them into generators with a consistency reward to produce personalized text and images.
citing papers explorer
-
Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation
TGQ-Former uses metadata-guided hybrid queries and dual-gated modulation to improve visual token selection in multimodal e-commerce retrieval, raising average Hit Rate@100 by 6.04% over baselines.
-
Teach Multimodal Recommendation Model to See via Personalized Visual Extraction and Adaptive Learning
REVEAL is a plug-and-play framework that refines visual feature extraction via task feedback and dynamically balances visual-text learning to improve multimodal recommendation performance.
-
Discrete Preference Learning for Personalized Multimodal Generation
DPPMG learns discrete modal-specific preferences via a dedicated GNN from multimodal user data, quantizes them into tokens, and feeds them into generators with a consistency reward to produce personalized text and images.
- TRU: Targeted Reverse Update for Efficient Multimodal Recommendation Unlearning