A unified model synthesizes binaural singing from scene images using a consistency Schrödinger bridge, enabling one-step generation.
VS-Singer consists of a modal interaction network, a decoder based on consistency Schr ¨odinger bridge and a spatially-aware feature enhancement module
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\"odinger Bridge
A unified model synthesizes binaural singing from scene images using a consistency Schrödinger bridge, enabling one-step generation.