{"as_of":"2026-08-13T15:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2fb9d19ec4c2645da557ad2e1abe1a4acb7fccbd99e158b77dab3710d6c5a9d","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:22:18.146028Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12641/citation-record","integrity":"/paper/2411.12641/integrity","json":"/paper/2411.12641/citation-record.json","paper":"/paper/2411.12641"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-12T18:49:23.347422Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-12T17:22:17.824039Z","title":"MusicLM: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.824039Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:bb71bfe689d75282d65bd527d9148bfd86b80fcf89b34dec2cc12cd6da19ad7a","observation_id":"990d35bb-ab15-4a86-b710-5824cc4d88dc","resolution":{"observed_at":"2026-08-12T17:22:17.824039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.314322Z","title":"Look, listen, and learn more: Design choices for deep audio embeddings","venue":null,"work_id":"92c42b0d-23a1-4bed-8453-fdbc6ce24c58","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.846659Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:0ecdecf11509c0dc3e2bf656611ce65dd97357a79a4498a1afd109a3f6ff9ea8","observation_id":"d34cade4-29f9-4155-a4e3-af00fe1ce649","resolution":{"observed_at":"2026-08-12T17:22:19.319985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T17:22:17.850829Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.850829Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:eb18601eda92c821a9639df2dd147eda8de423b8f3fb67f6610fd4f8417d6bd7","observation_id":"c1dbbc6d-6d7c-4958-b17f-ec351a2cf76e","resolution":{"observed_at":"2026-08-12T17:22:17.850829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-08-13T10:44:31.553245Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-12T17:22:17.865512Z","title":"LP-MusicCaps: LLM-based pseudo music captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.865512Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:39e8abe61635db4aee49f42d0af00e973888d65244e597b63f2d438f62db7c17","observation_id":"e601f507-1b25-4895-bf77-6822b18f1367","resolution":{"observed_at":"2026-08-12T17:22:17.865512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12662","last_updated":"2023-01-30T04:53:23Z","snapshot_observed_at":"2026-08-13T12:55:29.316334Z","submitted_at":"2023-01-30T04:53:23Z","title":"SingSong: Generating musical accompaniments from singing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12662","snapshot_observed_at":"2026-08-12T17:22:17.869956Z","title":"Singsong: Generating musical accompaniments from singing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.869956Z"},"links":{"cited_paper":"/paper/2301.12662","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:b262b5605db3bdf45a89d442da375359f711bee112606703bac8b7815da27adc","observation_id":"86c8d089-5c58-4df5-955c-7d032858bf5d","resolution":{"observed_at":"2026-08-12T17:22:17.869956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.302072Z","title":"Joint music and language attention models for zero-shot music tagging","venue":null,"work_id":"cb7a42a3-08e4-4dc4-b684-4e36a20a8ac4","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.874701Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:57cc0e4ed3ced86fd1e803de334aa9c2b7a6887a36ea91742f79da9f1d879d60","observation_id":"5b17c951-e43c-4d6e-ba22-54cbf1d17685","resolution":{"observed_at":"2026-08-12T17:22:19.306287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10301","last_updated":"2024-07-29T14:52:26Z","snapshot_observed_at":"2026-08-13T00:55:04.612841Z","submitted_at":"2024-04-16T06:09:33Z","title":"Long-form music generation with latent diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10301","snapshot_observed_at":"2026-08-12T17:22:17.879005Z","title":"Fast timing-conditioned latent audio diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.879005Z"},"links":{"cited_paper":"/paper/2404.10301","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:cb224346bd1c1170bcefc7cf7993bbea3a3712dd25396d6d9a3d37bda5ce9715","observation_id":"c37ee982-b157-47eb-8672-99a29fa3df47","resolution":{"observed_at":"2026-08-12T17:22:17.879005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04686","last_updated":"2023-07-12T17:06:41Z","snapshot_observed_at":"2026-08-13T10:58:54.722946Z","submitted_at":"2023-07-10T16:42:03Z","title":"VampNet: Music Generation via Masked Acoustic Token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04686","snapshot_observed_at":"2026-08-12T17:22:17.883184Z","title":"Hugo Flores Garcia, Prem Seetharaman, Rithesh Kumar, and Bryan Pardo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.883184Z"},"links":{"cited_paper":"/paper/2307.04686","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:8b3bf87d5732fa0d2c3b495a51c2f188bc658afe2300d421c4024f000d56a514","observation_id":"214f2509-3365-4596-b4c2-900f898a8b6c","resolution":{"observed_at":"2026-08-12T17:22:17.883184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.289649Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"52b26af8-8e28-4e50-99e8-faa38007812f","year":2017},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.887501Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:14e073ba6c1de5d322bdd15b4c55ea512e6dd15f186c9c85535751c955d908be","observation_id":"506b6021-d676-4bda-b7e1-a3572e26369f","resolution":{"observed_at":"2026-08-12T17:22:19.294067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08753","last_updated":"2024-07-30T18:58:01Z","snapshot_observed_at":"2026-08-13T05:50:14.114776Z","submitted_at":"2023-10-12T22:43:38Z","title":"CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08753","snapshot_observed_at":"2026-08-12T17:22:17.891727Z","title":"Compa: Addressing the gap in compositional reasoning in audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.891727Z"},"links":{"cited_paper":"/paper/2310.08753","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:37f66af7ee2c7a022758f495122ca54d8e90f894a3876bf9d1540d294fdb4b20","observation_id":"40bc01b0-0948-4894-8ce8-254c2ef195ae","resolution":{"observed_at":"2026-08-12T17:22:17.891727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14360","last_updated":"2023-12-12T06:55:08Z","snapshot_observed_at":"2026-08-13T10:26:01.043953Z","submitted_at":"2023-08-28T07:11:42Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14360","snapshot_observed_at":"2026-08-12T17:22:17.896554Z","title":"Instructme: An instruction guided music edit and remix framework with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.896554Z"},"links":{"cited_paper":"/paper/2308.14360","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f94d3ba96aba5863997ca607ad678ed0fb060a4f2cd1ed14766dbffbbb379178","observation_id":"eca96272-26cb-4398-8d2b-0d765900055d","resolution":{"observed_at":"2026-08-12T17:22:17.896554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T17:22:17.905866Z","title":"Cheng-Zhi Anna Huang, Tim Cooijmans, Adam Roberts, Aaron Courville, and Douglas Eck","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.905866Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:85d65d76cf39108d4ea8a8a175af1b5aa79b006f21238371dbf929fa8b5c7bd4","observation_id":"de35cce0-8fe5-440a-9b0a-fdbdb3d63b6b","resolution":{"observed_at":"2026-08-12T17:22:17.905866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11255","last_updated":"2024-12-09T16:15:07Z","snapshot_observed_at":"2026-08-13T05:22:29.804412Z","submitted_at":"2023-11-19T06:50:52Z","title":"M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11255","snapshot_observed_at":"2026-08-12T17:22:17.914502Z","title":"M 2ugen: Multi-modal music understanding and generation with the power of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.914502Z"},"links":{"cited_paper":"/paper/2311.11255","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:125755fec99a1a91dc4c3b6d6dc37bbbb71054e9d2390939a394e7177387e52f","observation_id":"524d5f25-d188-48a5-8ee9-4bfb8847f6c7","resolution":{"observed_at":"2026-08-12T17:22:17.914502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.274644Z","title":null,"venue":null,"work_id":"a0c23215-ef3f-433f-a038-a9cf09aaefe9","year":2016},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.919166Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:4fba7cb1fe15371da237596698a3ba8cff4c5457b59c7de0f03323043b911ce9","observation_id":"b5579418-771a-4633-a14e-002d6cbfc947","resolution":{"observed_at":"2026-08-12T17:22:19.280963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10384","last_updated":"2023-12-28T15:08:07Z","snapshot_observed_at":"2026-08-13T05:23:20.781324Z","submitted_at":"2023-11-17T08:21:56Z","title":"Retrieval Augmented Generation of Symbolic Music with LLMs","version":2},"cited_work":{"arxiv_id":"2311.10384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.10384","snapshot_observed_at":"2026-08-12T17:22:18.869890Z","title":"Retrieval Augmented Generation of Symbolic Music with LLMs","venue":"cs.SD","work_id":"8331ecd2-2830-4d9d-bac4-bb2f6ca62594","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.928087Z"},"links":{"cited_paper":"/paper/2311.10384","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:de155c2d7febd133a523502bf67000e08f0b8b4c85ffdb8bc152038f5f7764f8","observation_id":"b0111806-a9f6-4f14-af0e-a808c2b3e499","resolution":{"observed_at":"2026-08-12T17:22:18.874918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-12T17:22:17.932668Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.932668Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d3fd7f63eeeb0357a73345108dc2a119ebfa01cbb486cae789edf7666dbf5801","observation_id":"7959ab72-2e7a-45c1-94b1-1a48bcaa3460","resolution":{"observed_at":"2026-08-12T17:22:17.932668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T17:22:17.941042Z","title":"Auto-encoding variational Bayes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.941042Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:5ab53f57efdffe7e7ceff76a3bf2ce3d2e23f0e24ef766ce244f786513c85a37","observation_id":"3bb143b2-f6e4-474b-86cc-4b67d6bef4cc","resolution":{"observed_at":"2026-08-12T17:22:17.941042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02252","last_updated":"2025-02-01T00:25:09Z","snapshot_observed_at":"2026-08-13T00:39:00.042112Z","submitted_at":"2024-04-02T19:18:42Z","title":"SMITIN: Self-Monitored Inference-Time INtervention for Generative Music Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02252","snapshot_observed_at":"2026-08-12T17:22:17.949611Z","title":"Smitin: Self-monitored inference-time intervention for generative music transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.949611Z"},"links":{"cited_paper":"/paper/2404.02252","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:853925562bce08196978c4a821c3bb75ea156d5948be384af655e126ad5aeea2","observation_id":"c664983b-0f43-43a8-8a62-8aaabf079cfa","resolution":{"observed_at":"2026-08-12T17:22:17.949611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-10T10:27:54.456913Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-12T17:22:17.953788Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.953788Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e8ad38acaf73c408a1d5b3cb97f4d43083cce88c79ee05c6f0e9db2cb050daa2","observation_id":"a7f48f30-1d70-4f13-99b9-16df11f82b7d","resolution":{"observed_at":"2026-08-12T17:22:17.953788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02060","last_updated":"2024-10-02T22:11:31Z","snapshot_observed_at":"2026-08-12T22:32:05.468262Z","submitted_at":"2024-10-02T22:11:31Z","title":"PerTok: Expressive Encoding and Modeling of Symbolic Musical Ideas and Variations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02060","snapshot_observed_at":"2026-08-12T17:22:17.957983Z","title":"Peike Li, Boyu Chen, Yao Yao, Yikai Wang, Allen Wang, and Alex Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.957983Z"},"links":{"cited_paper":"/paper/2410.02060","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:9a516468fe88f8fc8fdda20ddd71b39cd94e97e2a5cb58322dcc255f14fc89b2","observation_id":"e13e77da-de29-4894-a1f3-33bcdf016491","resolution":{"observed_at":"2026-08-12T17:22:17.957983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17162","last_updated":"2024-10-06T21:36:20Z","snapshot_observed_at":"2026-08-13T05:40:08.895490Z","submitted_at":"2023-10-26T05:24:38Z","title":"Content-based Controls For Music Large Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17162","snapshot_observed_at":"2026-08-12T17:22:17.962109Z","title":"Content-based controls for music large language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.962109Z"},"links":{"cited_paper":"/paper/2310.17162","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:9cb6cef13a777fb537c9a49c44453b3342e05cfcdee22c93650f773cd4908b9f","observation_id":"1f7e1e4f-e84d-4d2f-83ce-0fc66c659fb9","resolution":{"observed_at":"2026-08-12T17:22:17.962109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09508","last_updated":"2024-10-06T21:26:48Z","snapshot_observed_at":"2026-08-13T04:18:50.093901Z","submitted_at":"2024-02-14T19:00:01Z","title":"Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09508","snapshot_observed_at":"2026-08-12T17:22:17.966629Z","title":"Arrange, inpaint, and refine: Steerable long-term music audio generation and editing via content- based controls","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.966629Z"},"links":{"cited_paper":"/paper/2402.09508","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:bdb93d38269a93f3841bc139267cca80f16fc641900fe03d3637f9f00346714e","observation_id":"1d9d8692-1128-4c04-a4e4-833456fff121","resolution":{"observed_at":"2026-08-12T17:22:17.966629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-13T12:55:40.566213Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-12T17:22:17.970735Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.970735Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:8f5a5cf711c21716209c7f5aa232d333ba67e7ac13520723c37cb91d96cc4152","observation_id":"6e8c9f1b-e2b0-4c2d-9d5a-ed0418f56f1d","resolution":{"observed_at":"2026-08-12T17:22:17.970735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T17:22:17.974840Z","title":"Audi- oldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.974840Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:854239ddf5b06e7ea511c847e881ef449d8bbee7ca134eedb1c981241643abad","observation_id":"7f74cdce-4863-49dc-8d77-68473f76c2d0","resolution":{"observed_at":"2026-08-12T17:22:17.974840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.248636Z","title":"Novice-AI music co-creation via AI-steering tools for deep generative models","venue":null,"work_id":"2c514279-f3fd-4e5e-bec2-1ec38e2ad8a0","year":2020},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.979035Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:61b69f243e90c95ae33ebde1d3c0395d96bf6d149314e0c88bfdc110fe1cd46c","observation_id":"d54e9a4e-c430-4d5f-bba0-18693ff386d3","resolution":{"observed_at":"2026-08-12T17:22:19.252792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00110","last_updated":"2023-05-31T18:34:16Z","snapshot_observed_at":"2026-08-13T11:27:58.316142Z","submitted_at":"2023-05-31T18:34:16Z","title":"MuseCoco: Generating Symbolic Music from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00110","snapshot_observed_at":"2026-08-12T17:22:17.982833Z","title":"MuseCoco: Generating symbolic music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.982833Z"},"links":{"cited_paper":"/paper/2306.00110","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:fbf5edd7620029cad52aa5d42d3b0e2166f2f15a1fe5a1bda809ed2994b0a75c","observation_id":"3ae3d660-10ae-42dd-be2d-40be5d851534","resolution":{"observed_at":"2026-08-12T17:22:17.982833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08152","last_updated":"2019-06-29T04:29:48Z","snapshot_observed_at":"2026-08-10T07:59:38.303098Z","submitted_at":"2019-06-19T15:25:29Z","title":"Learning Disentangled Representations of Timbre and Pitch for Musical Instrument Sounds Using Gaussian Mixture Variational Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08152","snapshot_observed_at":"2026-08-12T17:22:17.986909Z","title":"Learning disentangled repre- sentations of timbre and pitch for musical instrument sounds using gaussian mixture variational autoencoders","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.986909Z"},"links":{"cited_paper":"/paper/1906.08152","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:2cc97e3b63b056558bd9fd0a3edd6e0ace0a8f34e09fd92dc8f1d41767586fb5","observation_id":"45537720-6e91-4814-9d5e-00371d492646","resolution":{"observed_at":"2026-08-12T17:22:17.986909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-12T17:22:17.991759Z","title":"The Song Describer Dataset: A corpus of audio captions for music-and- language evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.991759Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:0d020757655badaaef5d27b3fff5967463bf45d5eace84d86f5519baf4b82b54","observation_id":"1f262fcf-3f34-4c01-86fd-2ff4870db5d6","resolution":{"observed_at":"2026-08-12T17:22:17.991759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.236404Z","title":"Cutting music source separation some Slakh: A dataset to study the impact of training data quality and quantity","venue":null,"work_id":"e86ddfd7-5b5e-42a2-a244-a5409cca7cc4","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.996053Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:33d8148185f28e8f1e86063cb200325bdd79b0c1317bb96e6fa58d145d072b25","observation_id":"6bec592a-7b1c-4b21-ad97-ddd546f84ca9","resolution":{"observed_at":"2026-08-12T17:22:19.240664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.000506Z","title":"2019.8937170","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.000506Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:c2d99ff2dd2a1f7637a3a5e86ea150d942789a42b4d445a6fe9c8f695842c29a","observation_id":"e2c73553-2e83-4041-9037-efc495714b3e","resolution":{"observed_at":"2026-08-12T17:22:18.000506Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.224322Z","title":"Stem- gen: A music generation model that listens","venue":null,"work_id":"2ce1adf0-4842-4ea4-bc2c-b83cbce1ce34","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.012749Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:646d163808846ac5c3b030a2545277cb99200e4f3194a2c1dd3ae751681e2c7b","observation_id":"2b7d0675-2c8f-4c2f-9d98-1e41803c0269","resolution":{"observed_at":"2026-08-12T17:22:19.228074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.212213Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"e580f0e0-7587-42a7-9ac0-170311b7f572","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.016660Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:9d972c3f68e3f41b36e0c7a4ee85ad34e41e39dbcb2629647a59334c90cf1302","observation_id":"94ce5295-f9f1-49ab-9bfe-e085ba0f4556","resolution":{"observed_at":"2026-08-12T17:22:19.216388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.198744Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"62751efa-333c-4c2d-b550-d16488ff79f3","year":2014},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.020738Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:46962adaab2e40917f695216029ba88c0feee6c95099d70ab9e90c28ecc9a4c5","observation_id":"1e186346-0f81-47ff-b771-832e2a9a2092","resolution":{"observed_at":"2026-08-12T17:22:19.203529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05365","last_updated":"2018-03-22T21:59:40Z","snapshot_observed_at":"2026-07-06T06:23:28.649177Z","submitted_at":"2018-02-15T00:05:11Z","title":"Deep contextualized word representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05365","snapshot_observed_at":"2026-08-12T17:22:18.033393Z","title":"Karol J Piczak","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.033393Z"},"links":{"cited_paper":"/paper/1802.05365","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:2e56ecd30980d1d34b55d7b7b03ffb871d44f2d71cac54215be276e0db1dc209","observation_id":"6505c8e3-76a5-42cf-97d2-7044012f2901","resolution":{"observed_at":"2026-08-12T17:22:18.033393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.166822Z","title":"Generalized multi-source inference for text conditioned music diffusion models","venue":null,"work_id":"0c20a629-7863-4413-8d58-2f0a8226a29b","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.037046Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:db7f5cc2dfdc10256813a81722229de53965fbf3154c0e2cf1950f2a8e96299f","observation_id":"da217417-315c-4b64-89c0-cda45a3910bb","resolution":{"observed_at":"2026-08-12T17:22:19.171499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.041327Z","title":"Paguri: a user experience study of creative interaction with text-to-music models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.041327Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:80895b0e60b89ecb59cc457ff66085a6dcf9585e4ec5083bd4c082561fc02432","observation_id":"72792de0-2abd-4dfd-ba04-aea455bc04d8","resolution":{"observed_at":"2026-08-12T17:22:18.041327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12563","last_updated":"2024-07-30T09:44:09Z","snapshot_observed_at":"2026-08-12T23:20:21.261214Z","submitted_at":"2024-07-17T13:47:17Z","title":"Audio Conditioning for Music Generation via Discrete Bottleneck Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12563","snapshot_observed_at":"2026-08-12T17:22:18.045976Z","title":"Audio conditioning for music generation via discrete bottleneck features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.045976Z"},"links":{"cited_paper":"/paper/2407.12563","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f17bdf1e1dd71a68a92fe20281b7d496302c8d5239dca706f0c09eca17afdb32","observation_id":"a8511da5-b9d9-409a-846c-139d67be53a5","resolution":{"observed_at":"2026-08-12T17:22:18.045976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.152801Z","title":null,"venue":null,"work_id":"8c25534e-a66e-4c18-af0d-147ac3718c20","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.050497Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:5b608af0ce4219452608239286ce5000a2688b3342ad0584738424182c2e5400","observation_id":"c3572c32-6a17-4956-85e2-3fb128887240","resolution":{"observed_at":"2026-08-12T17:22:19.157232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.86838","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.496119Z","title":"URL https://doi.org/10.1109/ICASSP.2019.8683855","venue":null,"work_id":"f5201553-545c-4e63-8d81-56b1d18e30b8","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.062013Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:ea4a0b6371e753dd96ffb4e5e430dea94094cb73b948f6584b81385e8e508e88","observation_id":"b6032a99-19c9-43ad-a077-09b2585925e6","resolution":{"observed_at":"2026-08-12T17:22:18.502761Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10970","last_updated":"2024-06-16T15:06:06Z","snapshot_observed_at":"2026-08-12T23:41:43.708838Z","submitted_at":"2024-06-16T15:06:06Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10970","snapshot_observed_at":"2026-08-12T17:22:18.066712Z","title":"Joint audio and sym- bolic conditioning for temporally controlled text-to-music generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.066712Z"},"links":{"cited_paper":"/paper/2406.10970","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:53fa27207d431c9429f533fa9c9ea81d63052e6ee6118a4b3ca9ea27dcad2e28","observation_id":"2f28cfb2-25c1-4eb9-8f49-b09ede1b1942","resolution":{"observed_at":"2026-08-12T17:22:18.066712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.15474","last_updated":"2020-07-29T16:01:45Z","snapshot_observed_at":"2026-07-06T09:43:11.111715Z","submitted_at":"2020-07-29T16:01:45Z","title":"Music FaderNets: Controllable Music Generation Based On High-Level Features via Low-Level Feature Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.15474","snapshot_observed_at":"2026-08-12T17:22:18.071838Z","title":"Music FaderNets: Controllable music generation based on high-level features via low-level feature modelling","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.071838Z"},"links":{"cited_paper":"/paper/2007.15474","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:11f258485a79f732dae431f18561d844a47343093e410ed94045491b424af074","observation_id":"bee62ef0-c927-4586-b0fa-f3c5a1a85f37","resolution":{"observed_at":"2026-08-12T17:22:18.071838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:22:18.077072Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.077072Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f788625ce59cb22fc514b11861b1c406241e444e6a1e8ebb93c61e6614b18386","observation_id":"4ae40fbd-b2da-456a-8d2d-f086b3d3373c","resolution":{"observed_at":"2026-08-12T17:22:18.077072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.138867Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"57fb2438-d9cb-455e-8a1c-7a75540bf9a3","year":1921},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.081609Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:a5a5d3b030b8638ba02d071de1ec3b28461245e7c1d6a63012e7945a859e694f","observation_id":"36568fc4-9e0d-42c1-8a3e-651dd21d23c3","resolution":{"observed_at":"2026-08-12T17:22:19.143365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-13T01:24:25.628327Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T17:22:18.085750Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.085750Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:8c4ba5281cd7d457fbd7607e6667e39a32e9d240e6c1e9ffd879747d02a69b6f","observation_id":"5f8e728e-061b-4156-9bd6-00b3c5458970","resolution":{"observed_at":"2026-08-12T17:22:18.085750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-12T17:22:18.094014Z","title":"Shiqi Wei, Gus Xia, Yixiao Zhang, Liwei Lin, and Weiguo Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.094014Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:3f33fb0008e8d0c40104bb38bc65f5ccdf806cb3090b80291704191007204bd0","observation_id":"e141c705-cb91-474c-a455-2ec8c01301d8","resolution":{"observed_at":"2026-08-12T17:22:18.094014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11216","last_updated":"2023-01-04T01:06:19Z","snapshot_observed_at":"2026-08-13T13:38:34.384750Z","submitted_at":"2022-11-21T07:19:17Z","title":"Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11216","snapshot_observed_at":"2026-08-12T17:22:18.098324Z","title":"Exploring the efficacy of pre-trained checkpoints in text-to-music generation task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.098324Z"},"links":{"cited_paper":"/paper/2211.11216","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:27860fbb67f2c4a8f6f5fabb90e1d864a22ea9d9591950c5caedffbae0c96989","observation_id":"7fa745de-7c50-45fe-b3b1-1506c629e7b0","resolution":{"observed_at":"2026-08-12T17:22:18.098324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02084","last_updated":"2025-06-16T16:49:05Z","snapshot_observed_at":"2026-08-12T22:32:03.858064Z","submitted_at":"2024-10-02T23:10:21Z","title":"Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02084","snapshot_observed_at":"2026-08-12T17:22:18.102619Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.102619Z"},"links":{"cited_paper":"/paper/2410.02084","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:7641620dd8d8bebed6870500e1b6429f8347d794e399af7408cfa9f731de28dd","observation_id":"5b21ed84-4989-4f8d-8f77-4858ca1e080e","resolution":{"observed_at":"2026-08-12T17:22:18.102619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.124830Z","title":"Iteratta: An interface for exploring both text prompts and audio priors in generating music with text-to-audio models","venue":null,"work_id":"b1969bc3-ac97-48ea-a0db-6d25d1c5b4d4","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.106545Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:937f559874ab74eab569bd7fef2362046242ad4d610ffd18ee94b3352741f376","observation_id":"deaafc50-5a0a-4bd1-8afd-eccaff0c3403","resolution":{"observed_at":"2026-08-12T17:22:19.129595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-13T05:59:53.255898Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-12T17:22:18.110641Z","title":"UniAudio: An audio foundation model to- ward universal audio generation.CoRR, abs/2310.00704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.110641Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:92efbfe1d855e2936af122966c21c2d513a5a54716f7b950b5dcfee64f1a3f35","observation_id":"2703ed64-5d4f-4d4a-a51c-7e9cbb6c0e02","resolution":{"observed_at":"2026-08-12T17:22:18.110641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-13T05:59:53.255898Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-12T17:22:18.114817Z","title":"URL https://doi.org/10.48550/arxiv.2310.00704","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.114817Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:327559007f1d1411e1e79fadf64bd10a096a094ee354a37f7919c06694e02822","observation_id":"d7d3a452-f80f-4be2-879c-54b11508117a","resolution":{"observed_at":"2026-08-12T17:22:18.114817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19180","last_updated":"2024-12-17T04:08:33Z","snapshot_observed_at":"2026-08-13T06:08:17.456092Z","submitted_at":"2023-10-29T22:51:49Z","title":"JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation","version":4},"cited_work":{"arxiv_id":"2310.19180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19180","snapshot_observed_at":"2026-08-12T17:22:18.256143Z","title":"JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation","venue":"cs.SD","work_id":"4d3da90b-7457-4dd7-ba4a-d0e291cd2e8d","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.119324Z"},"links":{"cited_paper":"/paper/2310.19180","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:4d525dbe6fd867c7e2b794019e8ff8d9e95bc6900e9adbbb3ad992bb8e73af68","observation_id":"12264b63-e1f6-41f7-bfb4-7b46197d5f43","resolution":{"observed_at":"2026-08-12T17:22:18.262901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16153","last_updated":"2024-02-25T17:19:41Z","snapshot_observed_at":"2026-08-13T04:10:33.294152Z","submitted_at":"2024-02-25T17:19:41Z","title":"ChatMusician: Understanding and Generating Music Intrinsically with LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16153","snapshot_observed_at":"2026-08-12T17:22:18.123882Z","title":"Chatmusician: Understanding and generating music intrinsically with llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.123882Z"},"links":{"cited_paper":"/paper/2402.16153","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:8e572cbfe892fcca3b22704bd90fc8d89b335b6ccdf10ecaefd4bd8dc730617a","observation_id":"7aaae18c-fb86-4487-a150-aefcaa3649a6","resolution":{"observed_at":"2026-08-12T17:22:18.123882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-12T17:22:18.128284Z","title":"LLaMA-Adapter: Efficient fine- tuning of language models with zero-init attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.128284Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:8cc2cfe50a130aac8079382cafe170aa1095106aa4a864b1fb5f5cf9321c078c","observation_id":"3dedc977-28b4-44cd-a5de-2858df3024b6","resolution":{"observed_at":"2026-08-12T17:22:18.128284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.110299Z","title":"Cosmic: A conversational interface for human-ai music co-creation","venue":null,"work_id":"aa4e8d06-6ecd-4f5b-aef3-4026e47a8fa8","year":2021},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.132747Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:a8bc04e5ac85e6375dff3677dc7e05b5c8b662aa178aa33d698a20bdef95d167","observation_id":"7d503132-40d5-45a0-8a85-75d23867d85b","resolution":{"observed_at":"2026-08-12T17:22:19.115111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11671","last_updated":"2022-08-24T17:07:37Z","snapshot_observed_at":"2026-08-13T14:39:31.667678Z","submitted_at":"2022-08-24T17:07:37Z","title":"Interpreting Song Lyrics with an Audio-Informed Pre-trained Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11671","snapshot_observed_at":"2026-08-12T17:22:18.136706Z","title":"Interpreting song lyrics with an audio-informed pre-trained language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.136706Z"},"links":{"cited_paper":"/paper/2208.11671","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:650d39afddcc1eb93f1a45f04ddd5da2b840800637ce97acc6d36e16a355b4fc","observation_id":"28009de3-3aab-4a83-b2f9-07d17531f7d8","resolution":{"observed_at":"2026-08-12T17:22:18.136706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T17:22:18.141425Z","title":"Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Xiaolei Wang, Yupeng Hou, Yingqian Min, Beichen Zhang, Junjie Zhang, Zican Dong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.141425Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:df3add6e114e2324956fce6b85fe3dfbeef9a60984d5b32ed39e2e11b381d0b7","observation_id":"4c418d10-b949-4159-add6-a74d84190332","resolution":{"observed_at":"2026-08-12T17:22:18.141425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-08-13T04:45:56.006574Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-12T17:22:18.146028Z","title":"Masked audio generation using a single non-autoregressive transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.146028Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:5e387725becbb190005a9be85166887056ab1d43b5814e8229d2ff2e5683119c","observation_id":"b00db70a-dfd9-42df-9df6-e87647de670c","resolution":{"observed_at":"2026-08-12T17:22:18.146028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08384","last_updated":"2024-10-30T14:33:27Z","snapshot_observed_at":"2026-08-12T23:44:22.650111Z","submitted_at":"2024-06-12T16:34:26Z","title":"Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08384","snapshot_observed_at":"2026-08-12T17:22:18.008497Z","title":"Diff-a-riff: Musical accompaniment co-creation via latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.008497Z"},"links":{"cited_paper":"/paper/2406.08384","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:b5e81e184c869f57669cb3fbe415ba21ced3290f01fc5a1a6d5c5ff301739d2e","observation_id":"f06bdcae-e553-4106-812e-acbba9ecca99","resolution":{"observed_at":"2026-08-12T17:22:18.008497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05496","last_updated":"2023-08-10T10:59:24Z","snapshot_observed_at":"2026-08-13T10:37:19.524135Z","submitted_at":"2023-08-10T10:59:24Z","title":"Exploring XAI for the Arts: Explaining Latent Space in Generative Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05496","snapshot_observed_at":"2026-08-12T17:22:17.829212Z","title":"Exploring xai for the arts: Explaining latent space in generative music","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.829212Z"},"links":{"cited_paper":"/paper/2308.05496","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:9eac37f5b83574ea343a81a6cdebf4ecbe40fc82bb06c0a045598e85eaa7db57","observation_id":"a57bb2bc-47fd-4c40-afeb-66e9746f6412","resolution":{"observed_at":"2026-08-12T17:22:17.829212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.090093Z","title":"2003.819861","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.090093Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:754d427d37806528472818c8981e490fb25a5348776aa016619015684c1e092b","observation_id":"6bbe475b-5897-4987-86d2-2ab251e89d31","resolution":{"observed_at":"2026-08-12T17:22:18.090093Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15487","last_updated":"2024-07-08T20:15:33Z","snapshot_observed_at":"2026-08-12T23:40:33.917758Z","submitted_at":"2024-06-18T00:02:15Z","title":"Improving Text-To-Audio Models with Synthetic Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15487","snapshot_observed_at":"2026-08-12T17:22:17.945138Z","title":"Improving text- to-audio models with synthetic captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.945138Z"},"links":{"cited_paper":"/paper/2406.15487","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:438191b20fc392231430281f0ff5bbb2ed7f750e0a326d5e2b81a662d91c8a2b","observation_id":"370d21ad-03b8-494f-a600-fbf4f2ef17dc","resolution":{"observed_at":"2026-08-12T17:22:17.945138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.183064Z","title":"MoisesDB: A dataset for source separation beyond 4-stems","venue":null,"work_id":"6406f56d-6942-4970-83ef-b727f1b672fd","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.024699Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:42013538be8d903152ebdf7947cf99c95d280f65900e67501b04cfbc5bf57daf","observation_id":"d803a4f9-532f-4a98-844a-4347d9fe9899","resolution":{"observed_at":"2026-08-12T17:22:19.189399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02255","last_updated":"2024-07-22T09:34:46Z","snapshot_observed_at":"2026-08-12T23:50:34.732900Z","submitted_at":"2024-06-04T12:21:55Z","title":"MidiCaps: A large-scale MIDI dataset with text captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02255","snapshot_observed_at":"2026-08-12T17:22:18.004318Z","title":"Mustango: Toward controllable text-to- music generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.004318Z"},"links":{"cited_paper":"/paper/2406.02255","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d177291f8927c9fd546e1cf5883ceb6bb4e49b91a1ffb37641817fd374858610","observation_id":"b6bd2d2e-5f02-4445-ac86-2279b1482464","resolution":{"observed_at":"2026-08-12T17:22:18.004318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.06801","last_updated":"2020-11-13T08:01:20Z","snapshot_observed_at":"2026-08-05T09:36:49.705323Z","submitted_at":"2020-11-13T08:01:20Z","title":"A Comprehensive Survey on Deep Music Generation: Multi-level Representations, Algorithms, Evaluations, and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.06801","snapshot_observed_at":"2026-08-12T17:22:17.923559Z","title":"URL https://doi.org/10.21437/ Interspeech.2016-1176","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.923559Z"},"links":{"cited_paper":"/paper/2011.06801","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:854dc023c8b484dd89692febae4908664d8f3c38289661d0ec0c639cbad5519e","observation_id":"91e7ac71-eccd-4b9e-a718-16e7989b14e1","resolution":{"observed_at":"2026-08-12T17:22:17.923559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.261241Z","title":"Au- diocaps: Generating captions for audios in the wild","venue":null,"work_id":"bdce9e29-9ed4-464f-a1f6-966c4cd93bab","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.936966Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:6817094e66e95e93f255ff343e8de530e64b8e8e5f82e551420b2eab755c2d74","observation_id":"bf5cb6ad-9aa4-430d-ae8a-95a11b661c7a","resolution":{"observed_at":"2026-08-12T17:22:19.265481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-08-13T14:38:40.695481Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-12T17:22:17.910125Z","title":"Masked autoencoders that listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.910125Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:baaad61b1c773fa1a616965c0b3c93b390b3b8a116a87239b053050e8d3be7cb","observation_id":"0035bc81-1603-4cf1-8b24-b65ea1e86213","resolution":{"observed_at":"2026-08-12T17:22:17.910125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17645","last_updated":"2025-05-30T22:33:14Z","snapshot_observed_at":"2026-08-13T04:08:59.286926Z","submitted_at":"2024-02-27T16:15:28Z","title":"SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17645","snapshot_observed_at":"2026-08-12T17:22:17.861124Z","title":"Songcomposer: A large language model for lyric and melody composition in song generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.861124Z"},"links":{"cited_paper":"/paper/2402.17645","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:b009d62bbf652c9dab89e8719a020c4c796b71e2137394aae2d5e86941f1d7ca","observation_id":"ca295f9c-16c9-4a67-9d7e-c3ddf8763784","resolution":{"observed_at":"2026-08-12T17:22:17.861124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-12T17:22:17.855404Z","title":"Jukebox: A generative model for music","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.855404Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:2cab4635c54a2d123742aee645f0084ac5cfe0e56088bc6ea48e6b4c3d6e65a3","observation_id":"08a68021-b2fe-4f82-9568-cfe8712a4d44","resolution":{"observed_at":"2026-08-12T17:22:17.855404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.339968Z","title":"Musicldm: Enhancing novelty in text- to-music generation using beat-synchronous mixup strategies","venue":null,"work_id":"895a9012-f244-4bb5-a20e-f1d1c55d1179","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.838339Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:fc14a29a86a38369a8e50b0b89d2ee3c54132b9209022a33b2f7acb20ffd27c6","observation_id":"5decd465-1463-4b20-b74a-8ff02ef74acb","resolution":{"observed_at":"2026-08-12T17:22:19.343974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.351837Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":"22dc8707-773a-406a-9948-1113446cd8c6","year":2022},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.833825Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:82d56db64b438145dae04dcdd6908ea5ae8a52417f798c4fe12093832ac353fd","observation_id":"56994326-27b9-4dee-bca5-b81e86bbbaf9","resolution":{"observed_at":"2026-08-12T17:22:19.355936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.328439Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":"0ee1abfc-c583-4ca1-9101-2336a676f105","year":2021},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.842502Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:99c38fa9b64d9012f8c8ed1ea185feca7cb43549a57c16657131b1fd92b76668","observation_id":"0a50e756-deba-4490-bf58-6fdf0d6ea5b5","resolution":{"observed_at":"2026-08-12T17:22:19.332606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2411.12641."}