WavFusion fuses wav2vec 2.0 audio features with text and visual features using gated cross-modal attention and a homogeneous-feature margin loss, reporting modest state-of-the-art gains on IEMOCAP and MELD.
In Applied Information Processing Systems: Proceedings of ICCET 2021, pages 83–92
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2024 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
WavFusion fuses wav2vec 2.0 audio features with text and visual features using gated cross-modal attention and a homogeneous-feature margin loss, reporting modest state-of-the-art gains on IEMOCAP and MELD.