A hierarchical self-supervised encoder on piano-roll images learns musical structure at different time scales, and a flow-matching decoder generates variations and inpaints gaps on CPU.
Self-supervised learning from images with a joint- embedding predictive architecture
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation
A hierarchical self-supervised encoder on piano-roll images learns musical structure at different time scales, and a flow-matching decoder generates variations and inpaints gaps on CPU.