BiMa combines scene-element-aware visual fusion with VAE-based text disentanglement, reporting SOTA retrieval and stronger OOD generalization, but its dataset-derived taxonomy dictionary risks leakage.
”factual” or ”emotional”: Stylized image captioning with adaptive learning and attention
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance
BiMa combines scene-element-aware visual fusion with VAE-based text disentanglement, reporting SOTA retrieval and stronger OOD generalization, but its dataset-derived taxonomy dictionary risks leakage.