A unified model synthesizes binaural singing from scene images using a consistency Schrödinger bridge, enabling one-step generation.
7) Sep- Stereo [35], a model that converts mono audio to binaural audio using scene images
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\"odinger Bridge
A unified model synthesizes binaural singing from scene images using a consistency Schrödinger bridge, enabling one-step generation.