Modality dropout training makes audio-visual target speaker extraction robust when audio or video is missing, across normalization layers and in causal configurations.
Humans use auxiliary information, such as spatial and visual cues as well as speaker familiarity, to selectively attend to auditory stimuli [1]
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
eess.AS 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction
Modality dropout training makes audio-visual target speaker extraction robust when audio or video is missing, across normalization layers and in causal configurations.