S-DCCA, a supervised deep CCA model with attention-based audio chunk selection, retrieves music videos from audio snippets with slightly better MAP than CCA baselines.
Cross-modal retrieval with correspondence autoencoder
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.MM 1years
2019 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA
S-DCCA, a supervised deep CCA model with attention-based audio chunk selection, retrieves music videos from audio snippets with slightly better MAP than CCA baselines.