Text-embedding clustering for batch sampling outperforms audio-embedding clustering on objective metrics in low-data text-to-music generation, with moderate cluster counts best on metrics and larger counts better for structural coherence in listening tests.
NeurIPS , year =
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
UT-AISTimprt submission for ICME 2026 Grand Challenge on Academic Text-to-Music Generation
Text-embedding clustering for batch sampling outperforms audio-embedding clustering on objective metrics in low-data text-to-music generation, with moderate cluster counts best on metrics and larger counts better for structural coherence in listening tests.