Noro adds a dual-branch reference encoder and a contrastive speaker loss so one-shot voice conversion stays accurate when the reference clip is noisy, and its reference encoder doubles as a competitive self-supervised speaker encoder.
Noise-Robust V oice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and En- vironment,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2024 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
Noro adds a dual-branch reference encoder and a contrastive speaker loss so one-shot voice conversion stays accurate when the reference clip is noisy, and its reference encoder doubles as a competitive self-supervised speaker encoder.