A hierarchical self-supervised encoder on piano-roll images learns musical structure at different time scales, and a flow-matching decoder generates variations and inpaints gaps on CPU.
Bittner, Juan José Bosch, David Rubinstein, Gabriel Meseguer-Brocal, and Sebastian Ewert
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.SD 1years
2026 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation
A hierarchical self-supervised encoder on piano-roll images learns musical structure at different time scales, and a flow-matching decoder generates variations and inpaints gaps on CPU.