Whisper encoder features plus a ResNet34 classifier detect AI-generated singing voices on the Singfake dataset, beating standard audio features and a Wav2vec2-based baseline in reported tests.
Midi-voice: Expressive zero-shot singing voice synthesis via midi-driven priors,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.SD 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Deepfake Detection of Singing Voices With Whisper Encodings
Whisper encoder features plus a ResNet34 classifier detect AI-generated singing voices on the Singfake dataset, beating standard audio features and a Wav2vec2-based baseline in reported tests.