Soft audio-caption relevance labels estimated from caption text similarity improve text-based audio retrieval over binary-labels contrastive training.
Large-Scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
eess.AS 1years
2024 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
Text-based Audio Retrieval by Learning from Similarities between Audio Captions
Soft audio-caption relevance labels estimated from caption text similarity improve text-based audio retrieval over binary-labels contrastive training.