Averaging a small number of audio embeddings per class outperforms zero-shot text-embedding classification for CLAP-based audio classification.
Our few-shot approach, uti- lizing a small number of audio samples, consistently outper- formed zero-shot classifiers on different datasets by 2 to 10 % points in accuracy
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.SD 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
Improving Audio Classification by Transitioning from Zero- to Few-Shot
Averaging a small number of audio embeddings per class outperforms zero-shot text-embedding classification for CLAP-based audio classification.