Soft audio-caption relevance labels estimated from caption text similarity improve text-based audio retrieval over binary-labels contrastive training.
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
eess.AS 1years
2024 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Text-based Audio Retrieval by Learning from Similarities between Audio Captions
Soft audio-caption relevance labels estimated from caption text similarity improve text-based audio retrieval over binary-labels contrastive training.