A vision-integrated neural speech codec that uses lip images, via explicit fusion or distillation, improves decoded speech quality and noise robustness at 6 kbps.
VNSC is built upon the speech-modal MDCTCodec, with visual information extracted from lip images flowing into the speech coding process
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
eess.AS 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Vision-Integrated High-Quality Neural Speech Coding
A vision-integrated neural speech codec that uses lip images, via explicit fusion or distillation, improves decoded speech quality and noise robustness at 6 kbps.