Combining probabilities from fine-tuned wav2vec2 and ViViT models gives modest emotion-recognition results, but the evaluation design does not support a reliable conclusion.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2024 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Multimodal Sentiment Analysis based on Video and Audio Inputs
Combining probabilities from fine-tuned wav2vec2 and ViViT models gives modest emotion-recognition results, but the evaluation design does not support a reliable conclusion.