A single 3D Gaussian Splatting network learns to lip-sync multiple speakers from audio, matching per-speaker models in quality while training about 6.8x faster.
Generative adversarial net- works (gans) for audio-visual speech recognition in artificial intelligence iot
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting
A single 3D Gaussian Splatting network learns to lip-sync multiple speakers from audio, matching per-speaker models in quality while training about 6.8x faster.