VAEmo achieves state-of-the-art audio-visual emotion recognition by pre-training a unified encoder and aligning it with MLLM-generated emotion captions.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
VAEmo achieves state-of-the-art audio-visual emotion recognition by pre-training a unified encoder and aligning it with MLLM-generated emotion captions.