An audio-visual speaker diarization system using cross-attention and self-attention fusion achieves an 8.18% diarization error rate on the MISP 2025 Challenge, a 47.3% relative improvement over the baseline.
Lip-reading with densely connected temporal convolutional networks,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.SD 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge
An audio-visual speaker diarization system using cross-attention and self-attention fusion achieves an 8.18% diarization error rate on the MISP 2025 Challenge, a 47.3% relative improvement over the baseline.