Pith. sign in

Vision-Integrated High-Quality Neural Speech Coding

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it
abstract

This paper proposes a novel vision-integrated neural speech codec (VNSC), which aims to enhance speech coding quality by leveraging visual modality information. In VNSC, the image analysis-synthesis module extracts visual features from lip images, while the feature fusion module facilitates interaction between the image analysis-synthesis module and the speech coding module, transmitting visual information to assist the speech coding process. Depending on whether visual information is available during the inference stage, the feature fusion module integrates visual features into the speech coding module using either explicit integration or implicit distillation strategies. Experimental results confirm that integrating visual information effectively improves the quality of the decoded speech and enhances the noise robustness of the neural speech codec, without increasing the bitrate.

citation-role summary

background 1

citation-polarity summary

fields

eess.AS 1

years

2025 1

verdicts

CONDITIONAL 1

roles

background 1

polarities

background 1

representative citing papers

Vision-Integrated High-Quality Neural Speech Coding

eess.AS · 2025-05-29 · conditional · novelty 6.0

A vision-integrated neural speech codec that uses lip images, via explicit fusion or distillation, improves decoded speech quality and noise robustness at 6 kbps.

citing papers explorer

Showing 1 of 1 citing paper.

  • Vision-Integrated High-Quality Neural Speech Coding eess.AS · 2025-05-29 · conditional · none · ref 1 · internal anchor

    A vision-integrated neural speech codec that uses lip images, via explicit fusion or distillation, improves decoded speech quality and noise robustness at 6 kbps.