{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:DMWAKR3BEZRFDKVPLK7HNT3M3P","short_pith_number":"pith:DMWAKR3B","schema_version":"1.0","canonical_sha256":"1b2c054761266251aaaf5abe76cf6cdbdec83d0bd0f0f14963c389b27ca5c513","source":{"kind":"arxiv","id":"2408.14340","version":3},"attestation_state":"computed","paper":{"title":"Foundation Models for Music: A Survey","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG","eess.AS"],"primary_cat":"cs.SD","authors_text":"Anders {\\O}land, Anton Ragni, Bleiz MacSen Del Sette, Charalampos Saitis, Chenghua Lin, Chris Donahue, Christos Plachouras, Elona Shatri, Emmanouil Benetos, Fabio Morreale, Ge Zhang, Gus Xia, Gy\\\"orgy Fazekas, Huan Zhang, Ilaria Manco, Jiawen Huang, Julien Guinot, Liwei Lin, Luca Marinelli, Max W. Y. Lam, Megha Sharma, Qiuqiang Kong, Roger B. Dannenberg, Ruibin Yuan, Shangda Wu, Shih-Lun Wu, Shiyin Kang, Shun Lei, Shuqi Dai, Simon Dixon, Wenhao Huang, Wenhu Chen, Xingjian Du, Xingwei Qu, Xu Tan, Yinghao Ma, Yizhi Li, Zeyue Tian, Zhiyong Wu, Zhizheng Wu, Ziyang Ma, Ziyu Wang","submitted_at":"2024-08-26T15:13:14Z","abstract_excerpt":"In recent years, foundation models (FMs) such as large language models (LLMs) and latent diffusion models (LDMs) have profoundly impacted diverse sectors, including music. This comprehensive review examines state-of-the-art (SOTA) pre-trained models and foundation models in music, spanning from representation learning, generative learning and multimodal learning. We first contextualise the significance of music in various industries and trace the evolution of AI in music. By delineating the modalities targeted by foundation models, we discover many of the music representations are underexplore"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.14340","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.SD","submitted_at":"2024-08-26T15:13:14Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG","eess.AS"],"title_canon_sha256":"f70e77a0e99bc78d54e0cc5489f53ee02a57335e8fbec5c6f84eff720f972840","abstract_canon_sha256":"8b5202e4046cb5b8ece700b5b1920394abd27ed5cfc20319af37899c5d3311d5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:02:24.858548Z","signature_b64":"/RfAeH9kt/T3RKLJrUJPWThJR49J0pc+jPUXHEeJI18akeRrBLdgvZ/YrL6TGq5QwlDt5H+LFRHLSFxtqLicAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1b2c054761266251aaaf5abe76cf6cdbdec83d0bd0f0f14963c389b27ca5c513","last_reissued_at":"2026-07-05T09:02:24.858072Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:02:24.858072Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Foundation Models for Music: A Survey","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG","eess.AS"],"primary_cat":"cs.SD","authors_text":"Anders {\\O}land, Anton Ragni, Bleiz MacSen Del Sette, Charalampos Saitis, Chenghua Lin, Chris Donahue, Christos Plachouras, Elona Shatri, Emmanouil Benetos, Fabio Morreale, Ge Zhang, Gus Xia, Gy\\\"orgy Fazekas, Huan Zhang, Ilaria Manco, Jiawen Huang, Julien Guinot, Liwei Lin, Luca Marinelli, Max W. Y. Lam, Megha Sharma, Qiuqiang Kong, Roger B. Dannenberg, Ruibin Yuan, Shangda Wu, Shih-Lun Wu, Shiyin Kang, Shun Lei, Shuqi Dai, Simon Dixon, Wenhao Huang, Wenhu Chen, Xingjian Du, Xingwei Qu, Xu Tan, Yinghao Ma, Yizhi Li, Zeyue Tian, Zhiyong Wu, Zhizheng Wu, Ziyang Ma, Ziyu Wang","submitted_at":"2024-08-26T15:13:14Z","abstract_excerpt":"In recent years, foundation models (FMs) such as large language models (LLMs) and latent diffusion models (LDMs) have profoundly impacted diverse sectors, including music. This comprehensive review examines state-of-the-art (SOTA) pre-trained models and foundation models in music, spanning from representation learning, generative learning and multimodal learning. We first contextualise the significance of music in various industries and trace the evolution of AI in music. By delineating the modalities targeted by foundation models, we discover many of the music representations are underexplore"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.14340","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.14340/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.14340","created_at":"2026-07-05T09:02:24.858129+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.14340v3","created_at":"2026-07-05T09:02:24.858129+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.14340","created_at":"2026-07-05T09:02:24.858129+00:00"},{"alias_kind":"pith_short_12","alias_value":"DMWAKR3BEZRF","created_at":"2026-07-05T09:02:24.858129+00:00"},{"alias_kind":"pith_short_16","alias_value":"DMWAKR3BEZRFDKVP","created_at":"2026-07-05T09:02:24.858129+00:00"},{"alias_kind":"pith_short_8","alias_value":"DMWAKR3B","created_at":"2026-07-05T09:02:24.858129+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05196","citing_title":"Unified Audio Intelligence Without Regressing on Text Intelligence","ref_index":255,"is_internal_anchor":true},{"citing_arxiv_id":"2606.12555","citing_title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08722","citing_title":"Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2504.00470","citing_title":"Less is More: Efficient Black-box Attribution via Minimal Interpretable Subset Selection","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04613","citing_title":"VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P","json":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P.json","graph_json":"https://pith.science/api/pith-number/DMWAKR3BEZRFDKVPLK7HNT3M3P/graph.json","events_json":"https://pith.science/api/pith-number/DMWAKR3BEZRFDKVPLK7HNT3M3P/events.json","paper":"https://pith.science/paper/DMWAKR3B"},"agent_actions":{"view_html":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P","download_json":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P.json","view_paper":"https://pith.science/paper/DMWAKR3B","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.14340&json=true","fetch_graph":"https://pith.science/api/pith-number/DMWAKR3BEZRFDKVPLK7HNT3M3P/graph.json","fetch_events":"https://pith.science/api/pith-number/DMWAKR3BEZRFDKVPLK7HNT3M3P/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P/action/storage_attestation","attest_author":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P/action/author_attestation","sign_citation":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P/action/citation_signature","submit_replication":"https://pith.science/pith/DMWAKR3BEZRFDKVPLK7HNT3M3P/action/replication_record"}},"created_at":"2026-07-05T09:02:24.858129+00:00","updated_at":"2026-07-05T09:02:24.858129+00:00"}