A relevance-guided audio-visual fusion network (AVRSP) improves video saliency prediction on six datasets by adaptively suppressing irrelevant audio and combining multi-scale visual features.
Vinet: Pushing the limits of visual modality for audio- visual saliency prediction,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2024 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
A relevance-guided audio-visual fusion network (AVRSP) improves video saliency prediction on six datasets by adaptively suppressing irrelevant audio and combining multi-scale visual features.