A voice conversion pipeline conditions FastSpeech 2 on predicted likability ratings, achieving partial subjective control but with degraded identity and content at strong settings.
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
1 Pith paper cite this work. Polarity classification is still indexing.
abstract
Perceived voice likability plays a crucial role in various social interactions, such as partner selection and advertising. A system that provides reference likable voice samples tailored to target audiences would enable users to adjust their speaking style and voice quality, facilitating smoother communication. To this end, we propose a voice conversion method that controls the likability of input speech while preserving both speaker identity and linguistic content. To improve training data scalability, we train a likability predictor on an existing voice likability dataset and employ it to automatically annotate a large speech synthesis corpus with likability ratings. Experimental evaluations reveal a significant correlation between the predictor's outputs and human-provided likability ratings. Subjective and objective evaluations further demonstrate that the proposed approach effectively controls voice likability while preserving both speaker identity and linguistic content.
citation-role summary
citation-polarity summary
fields
eess.AS 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
A voice conversion pipeline conditions FastSpeech 2 on predicted likability ratings, achieving partial subjective control but with degraded identity and content at strong settings.