{"as_of":"2026-08-18T11:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27beb0cf50b31e5ed584b2203ebfbf0126259b8f3d5608eb583fc00b7c72316a","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:11:21.815871Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:47:16.261408Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13535","snapshot_observed_at":"2026-08-01T17:47:16.261408Z","title":"Musflow: Multimodal music generation via conditional flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.261408Z"},"links":{"cited_paper":"/paper/2504.13535","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:3dcd0e948d267489736710defe6d8f436a85366f11c7e5122ae9bbff603f45eb","observation_id":"ca7e1a6e-c0c6-48aa-822c-4ee85ac8c138","resolution":{"observed_at":"2026-08-01T17:47:16.261408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13535/citation-record","integrity":"/paper/2504.13535/integrity","json":"/paper/2504.13535/citation-record.json","paper":"/paper/2504.13535"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-16T12:11:21.641417Z","title":"Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, An- toine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.641417Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:a418924bd64140d81838eb8eb29f4a93c672ce8447fb49ef606463dee01473b2","observation_id":"bab73e31-f868-48c3-a044-a8b7b5fbb413","resolution":{"observed_at":"2026-08-16T12:11:21.641417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.538237Z","title":null,"venue":null,"work_id":"6dd3f6f2-8aab-4db6-9be3-695dfbb3ae37","year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.645347Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:ee857d2346e6da97c4eef669ddcb9c47973e048f94cdc1de37028ef52d12e088","observation_id":"8e744918-65b9-4ce2-9121-10de19610530","resolution":{"observed_at":"2026-08-16T12:11:22.540969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.530777Z","title":null,"venue":null,"work_id":"04c5ccd8-7c28-4a8a-9bbf-6f86aed181bf","year":2020},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.648413Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:848e67147985cfc3d11ae41e1486e8237abd3215b667c2e17f5be9de49c043e8","observation_id":"bfc9aaea-ae31-4867-a80e-5d3879c0deb5","resolution":{"observed_at":"2026-08-16T12:11:22.533286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.522500Z","title":null,"venue":null,"work_id":"6d91f392-dca6-4ddb-b233-3d2ec19c3c30","year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.651505Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:91873a39f6aca7bd740d2f2d040e1183f69328bb6c8dfd6ac1bac99ce5208607","observation_id":"e8c0f4d5-23b4-4b53-9b9f-4f9c42956d53","resolution":{"observed_at":"2026-08-16T12:11:22.525375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.513656Z","title":null,"venue":null,"work_id":"e9888a4e-374b-41d2-8f50-5cedbb301228","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.658019Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:b155689d5b2f73ec9b8c437f8aa15c52eaddc3209c623f149ba1039c838a5339","observation_id":"f733c5c3-77f3-45b5-a829-ad18ca1b8c3d","resolution":{"observed_at":"2026-08-16T12:11:22.517291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.661156Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.661156Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:77c554f9b539ec6a033182637c3c5d9108534623f690587567c6bd4a673a89ce","observation_id":"71ea3f83-6683-4584-9a86-b7896aac1d71","resolution":{"observed_at":"2026-08-16T12:11:21.661156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.664316Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.664316Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:34bb6b77dfbef513a2ffc5fb6bb30309af693a29b6ece4f096e5cd96731e6ac9","observation_id":"34a35781-690d-42ef-85d1-8151e3543e08","resolution":{"observed_at":"2026-08-16T12:11:21.664316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.667210Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.667210Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:f7c228fa7abb253759b4af7cba2791aa16003b4cf268e1242951c12893a0d671","observation_id":"7e8bf7e9-fd10-42e3-b58b-e7f72daf7d64","resolution":{"observed_at":"2026-08-16T12:11:21.667210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.494664Z","title":null,"venue":null,"work_id":"0524e45b-bc67-4aa2-9b38-520f0d1d5802","year":2013},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.670037Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:fc0d9851e7c237e6a48d46c07b69e3aad9b8fce4a06752ddb1f9efbaf605c691","observation_id":"3bd39129-67a3-4e29-be53-fc85c5b85d6c","resolution":{"observed_at":"2026-08-16T12:11:22.499231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.486305Z","title":null,"venue":null,"work_id":"521d283a-fe06-4fa4-ace1-dbf1d610f782","year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.672864Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:59192fb784a67ab1cc06a733d0bc02fbfea12283010172e0f6f756443895e02d","observation_id":"ba5f9c6a-c6bc-42da-94dc-e16a74edc120","resolution":{"observed_at":"2026-08-16T12:11:22.489378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.681394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.681394Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:91a81c8bc0e8e4a0906fa0c76e9e6070893367ad7f4652945cbe33b612c71b5c","observation_id":"e490761d-c60c-4f45-b413-e442215d7c54","resolution":{"observed_at":"2026-08-16T12:11:21.681394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.684564Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.684564Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:880c8f3af0c9a0394066d7078f388f9004b4925f27aecd524901f5897ce76392","observation_id":"de4e2f64-2b99-4d11-b6d8-0ba4108cc4aa","resolution":{"observed_at":"2026-08-16T12:11:21.684564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T12:11:21.687365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.687365Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:d3446c718cd0226e70cb1edadd8979615a9b5212d472f8bc5afde4d82822479f","observation_id":"8e2f73c9-f065-4d40-83a6-3cf7c6235e63","resolution":{"observed_at":"2026-08-16T12:11:21.687365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.473435Z","title":null,"venue":null,"work_id":"79c3cb3c-6006-4fdf-84e7-2f14867eec04","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.690516Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:ab6f2b69568af98b8ef44fa99469299a3ff49e7a29617bb8d76f1b3b0e55c987","observation_id":"33547ec9-1e58-488a-8a82-341a7e0d78f5","resolution":{"observed_at":"2026-08-16T12:11:22.476491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.693188Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.693188Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:32a23802a25179ca960094a46688a2e4fa82142c6c1a264ac791bde984c87c0a","observation_id":"db282f7b-07d4-4ac7-a8ea-f50ed8afe1e3","resolution":{"observed_at":"2026-08-16T12:11:21.693188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.698820Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.698820Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:7bbc4f643b666121854f0356c4de663e3169f5a9d006f01dbd2483ff1cef331b","observation_id":"12d15ccd-d22a-4ec8-8390-941e0dd74f56","resolution":{"observed_at":"2026-08-16T12:11:21.698820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07827","last_updated":"2024-09-12T08:19:25Z","snapshot_observed_at":"2026-08-16T13:19:13.693814Z","submitted_at":"2024-09-12T08:19:25Z","title":"Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07827","snapshot_observed_at":"2026-08-16T12:11:21.701812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.701812Z"},"links":{"cited_paper":"/paper/2409.07827","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:673869111551a8d04bdb8718c9a18e8723d14a7e2a20413a1c47206b9d96dad6","observation_id":"d14e1437-7dcd-455f-aa4b-745d70e9c9d9","resolution":{"observed_at":"2026-08-16T12:11:21.701812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.704997Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.704997Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:2548d5bf02eef40eff1d8c20b7c4373f20f10dd0de6e9bf3f785793445b4e27a","observation_id":"4a9dda62-3cca-4404-b01d-f4a0433081d7","resolution":{"observed_at":"2026-08-16T12:11:21.704997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.707907Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.707907Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:69cacab44e27f998b89d8f2e75e05b4dc2d98e103a53978bb488d0bbfa13aaf1","observation_id":"737c44fb-5228-46c1-8576-33dd3386aaa7","resolution":{"observed_at":"2026-08-16T12:11:21.707907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-17T19:40:07.322177Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-16T12:11:21.714787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.714787Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:7985d4e3c4e6f508f55f778222aac7448fdd42fcabe4b032b4f2ae2bdcda587c","observation_id":"d9ce4144-7390-49cf-9355-917ad3029a93","resolution":{"observed_at":"2026-08-16T12:11:21.714787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.718133Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.718133Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:98e897263269bfa14cb4b90c53bd71450a53fcef99cddc3d932dccb2b9a6fd23","observation_id":"0c0fbb37-718a-49dc-913b-44e2f152df70","resolution":{"observed_at":"2026-08-16T12:11:21.718133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.720898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.720898Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:b630d00cccc11b836c6abac2d975548ba375ebaf16a619a06abec9fdfe4dd63e","observation_id":"7ce6872f-5fd7-4e7d-92e5-a3594db64d06","resolution":{"observed_at":"2026-08-16T12:11:21.720898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.724428Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.724428Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:30a0834a93bafb4aa98abe3c44de45d598b09d591b156b9fbbf067f8135e92e7","observation_id":"2fb7f5d5-fc4c-4ad2-976b-4d05d670cf92","resolution":{"observed_at":"2026-08-16T12:11:21.724428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.438560Z","title":null,"venue":null,"work_id":"14d7e65d-03c8-4590-9c2c-0b78358fb6c3","year":2020},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.727443Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:959038057d32909bb15c0965bebdbbb47a7453121b899a6cdd48577a477a6450","observation_id":"ce9b3e8f-9528-438c-8acf-5bd5fc44ca23","resolution":{"observed_at":"2026-08-16T12:11:22.441590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.730716Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.730716Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:04664db0c893ea63ce49dee7d31cfa7511dc0b56aadff5ad37fd179169ffc0b4","observation_id":"41c6a5b6-34eb-405f-90a3-2bff7167713c","resolution":{"observed_at":"2026-08-16T12:11:21.730716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.733402Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.733402Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:314b66cfa9f5fdbacc432cd1836ef5e3769bbec405d58e82d5994aa190b59f69","observation_id":"8a467df1-08ee-44ef-86ef-27b304986c1a","resolution":{"observed_at":"2026-08-16T12:11:21.733402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.736099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.736099Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:2d989009162cf61aeb7830cca2326f7e82d51118f38d679170d0f07317215b8f","observation_id":"8c002cdb-48ed-463e-bd77-2adfed4a2390","resolution":{"observed_at":"2026-08-16T12:11:21.736099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.416963Z","title":null,"venue":null,"work_id":"82a183ab-7ac1-4305-8b9a-e65b79ec1172","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.738685Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:4c37390c741138968dac1feb849231ffbc67b9f03b70ca4fb3035d0a6a706fd4","observation_id":"76357cbe-feba-4fa3-ad8d-863f3095d748","resolution":{"observed_at":"2026-08-16T12:11:22.419768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-14T20:34:51.960761Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-16T12:11:21.741316Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.741316Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:4988f74cbae42e81cbd26247e3360a5c44706c9c3a3e7e1c21067a9204bfd173","observation_id":"3cad79b2-1f66-4003-bbc9-e8c9c821337f","resolution":{"observed_at":"2026-08-16T12:11:21.741316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.409284Z","title":null,"venue":null,"work_id":"16978ffc-9326-484f-8ac0-2267ea3cff17","year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.744383Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:9f2ec52f115b96d53f283e25a6592fbaa510aff40eb206a055ff4a367958f17d","observation_id":"439fb4c1-6380-4058-9f05-5f8d763b8879","resolution":{"observed_at":"2026-08-16T12:11:22.411997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.401244Z","title":null,"venue":null,"work_id":"7c749d59-06ae-408b-81c4-c7e22a09ddd7","year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.750644Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:94ce5f55f3eef92adb21724256af41d77449d253d5262882bfc54a9e94e2862b","observation_id":"3248299a-ee7f-472f-a2af-d2a2d00a930a","resolution":{"observed_at":"2026-08-16T12:11:22.403966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.753323Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.753323Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:cd4731ba8105f234be1cc4d2eaaea3c0636b063bdb74271e651ab0bb9e633e68","observation_id":"99f7696c-fb37-4ae5-b467-478b87e0ffc4","resolution":{"observed_at":"2026-08-16T12:11:21.753323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.756065Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.756065Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:74a7d8119934247bb5c9fb8503e777748276c5aa6ce89c949209063fadb8c4c6","observation_id":"64fee752-ffcf-4ce7-834f-8ccdf6384df2","resolution":{"observed_at":"2026-08-16T12:11:21.756065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-13T09:14:45.905037Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-16T12:11:21.747459Z","title":"arXiv preprint arXiv:2412.06660 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.747459Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:43447bd479cc356e2d5f08dea91cc73e6d6cd2d5b7fe74dafefc2fcaba20c85a","observation_id":"01cb6a01-0e0e-46ef-862d-aca1924d2a4e","resolution":{"observed_at":"2026-08-16T12:11:21.747459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00567","last_updated":"2020-03-18T09:54:55Z","snapshot_observed_at":"2026-08-14T19:40:34.002536Z","submitted_at":"2018-03-01T18:28:43Z","title":"Computational Optimal Transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00567","snapshot_observed_at":"2026-08-16T12:11:21.765146Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.765146Z"},"links":{"cited_paper":"/paper/1803.00567","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:580af2c1af75a048811030cfb34a5540f93c197fe5a0829a99ab718eda8d39d2","observation_id":"a39bd7ac-0229-4b0a-b202-e2b11929eeac","resolution":{"observed_at":"2026-08-16T12:11:21.765146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.375431Z","title":null,"venue":null,"work_id":"3e29ac0b-136f-4846-a5de-d9196db2096a","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.768373Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:3c5b14fb3ad57ece7e73afd9edf5580e7a92357382090d33dc89cbb00b13dfbb","observation_id":"d1e40660-dba6-4c9c-a5d7-9c4f940a17ab","resolution":{"observed_at":"2026-08-16T12:11:22.379065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.772060Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.772060Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:cb50d8597cd100aa425d2df3423c367f37e39d85a137af8bb7684b1d551d7867","observation_id":"f64497ba-db0b-4fac-8588-eae1975a31e4","resolution":{"observed_at":"2026-08-16T12:11:21.772060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.758732Z","title":"In ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.758732Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:95960d53f614d403207a050fe01fcde4796166c4707e7aeeaa404f1794130bdd","observation_id":"68fae117-0a1f-4e47-b5a6-49f8315c17bb","resolution":{"observed_at":"2026-08-16T12:11:21.758732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.384766Z","title":null,"venue":null,"work_id":"b98162e8-44ff-48a4-9d22-b1f3f7e89dd0","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.761518Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:2b6ebee8aaeac1de12919e5f4add32e25b85f8f101a53f8d3ccbb08209e37478","observation_id":"cf66318f-81ea-4228-ad45-0f39f6b2b9f0","resolution":{"observed_at":"2026-08-16T12:11:22.390872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.349046Z","title":null,"venue":null,"work_id":"ff30331b-bab3-4c1b-bd1e-2425ce1dec70","year":2013},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.780589Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:d6137359b4e414b865e419d70b3d65a81838927ccee8d4716781990c3ae39286","observation_id":"49cd7df0-b3a8-4efc-9bec-f7bfda32bfd8","resolution":{"observed_at":"2026-08-16T12:11:22.351781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.340832Z","title":null,"venue":null,"work_id":"84c7e1fe-0fbb-43d3-acb1-4f781fbf1552","year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.783576Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:165cc4812fa9fb0083d8ed4166333d031fa8f0abcac0359a6ed1a88b59907157","observation_id":"861ad469-7ba5-4f6b-9ac4-49489e5aae20","resolution":{"observed_at":"2026-08-16T12:11:22.343645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.331583Z","title":null,"venue":null,"work_id":"bdeec37d-78d6-4798-9f7b-198fece087da","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.786491Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:ec573998c20504374ddbea0a6bf47abf811a8a1c225ef1ae7bf02ebd18ee5f19","observation_id":"ca599b8a-a71e-482d-b3c7-34738f63f798","resolution":{"observed_at":"2026-08-16T12:11:22.335438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.361820Z","title":null,"venue":null,"work_id":"e8a84efd-ff4e-4edc-aba1-6461b2f0e115","year":2022},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.775149Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:8e2f672377ffb678989c9f380146ca638aafd41bb6d2e0d747f872ed40737834","observation_id":"e9c2eb91-4446-404c-bdca-a24837ac82f9","resolution":{"observed_at":"2026-08-16T12:11:22.364658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.777815Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.777815Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:039c535bd7b6ac52c1cd32cb675f70a6351fd8fc20874a1895e71c0425748cb2","observation_id":"47813f0f-1e45-46a9-a1d1-da02e95665a9","resolution":{"observed_at":"2026-08-16T12:11:21.777815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.317682Z","title":null,"venue":null,"work_id":"a9ddd90e-2351-4620-ab42-cbec8561d61a","year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.795020Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:2de588e5ee176b97e966495945db6d0351620f9931e19b55e41350e1e370ac51","observation_id":"35355ecb-5b6d-4f1e-887b-efaed55dddb8","resolution":{"observed_at":"2026-08-16T12:11:22.321451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T12:11:21.798243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.798243Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:b6b380b11ba51263fa30d4ed24405b1f65d45efcc68acf99252375e2b0ee67b6","observation_id":"0207909b-6aca-488f-b999-74aa8c2221bc","resolution":{"observed_at":"2026-08-16T12:11:21.798243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.801303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.801303Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:e75306ee8dd8513e4540c7712fc69763cadfb6d7f15d95659250165a10308e66","observation_id":"55633a54-7303-4335-8a08-2f201593f440","resolution":{"observed_at":"2026-08-16T12:11:21.801303Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.789194Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.789194Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:0025b83b1222800897827dd6e3cf890a939bc406fbf076b2877e73482b1e0061","observation_id":"1d967dac-2ff2-4e37-bd64-4909578f1eb9","resolution":{"observed_at":"2026-08-16T12:11:21.789194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.792227Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.792227Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:ee8ae4d203ddac1c07cbf32253305537dbcf28effbd5d9feaef19c8599886f7d","observation_id":"271bdf36-5f22-4ecb-8df9-b8f9d1ddd967","resolution":{"observed_at":"2026-08-16T12:11:21.792227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.303385Z","title":null,"venue":null,"work_id":"4eb67862-af14-4a0f-96dc-fa7505bb520e","year":2021},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.810176Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:1e140d439f1eab5e65da21ede6589a8ddcafc57bf5975e8dbfaae47fe8988120","observation_id":"15b3269f-8813-4a92-af84-a6041ff3f666","resolution":{"observed_at":"2026-08-16T12:11:22.307119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12982","last_updated":"2023-08-24T00:49:08Z","snapshot_observed_at":"2026-08-16T15:06:13.838613Z","submitted_at":"2023-08-24T00:49:08Z","title":"A Survey of AI Music Generation Tools and Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12982","snapshot_observed_at":"2026-08-16T12:11:21.812928Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.812928Z"},"links":{"cited_paper":"/paper/2308.12982","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:f56bc7a161c7ca85f1c6cea2dac70a16b98762943e27d31ee12e7204f9f0dcbd","observation_id":"98311d7d-ec74-40ed-882b-238d101637fb","resolution":{"observed_at":"2026-08-16T12:11:21.812928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.815871Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.815871Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:7ff1a1b41533750973f60bbea766a3f76ee28a006b3ac7ef50a7e1eb2f9e2d61","observation_id":"bf9a2346-9ff3-46d2-90a6-f216243cd8ea","resolution":{"observed_at":"2026-08-16T12:11:21.815871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.804000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.804000Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:cffff26388de02c2b4eee56f59c84f304fe03852615bf6bf4975ea497be99adf","observation_id":"ada4399d-9ce2-4ba5-8f29-f4e655ab9f53","resolution":{"observed_at":"2026-08-16T12:11:21.804000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-16T13:00:31.714279Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-16T12:11:21.807185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.807185Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:a1fb292f1f072f32f319eb67627acdfc9f7b9bd162cb2fdfc8f0668d888fb0ba","observation_id":"62152b7c-9982-4fd8-899b-ad266e56986d","resolution":{"observed_at":"2026-08-16T12:11:21.807185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-08-14T21:26:53.042056Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-16T12:11:21.676866Z","title":"arXiv:1612.01840 [cs.SD] https: //arxiv.org/abs/1612.01840","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.676866Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:a58f91222ccb5bea5e80db0eda5393dbaa53db49acee7c85275597f1e2e369af","observation_id":"5d51f611-753a-4d92-91d2-078b0943e5cb","resolution":{"observed_at":"2026-08-16T12:11:21.676866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:21.654803Z","title":"Knowledge-Based Systems 248 (2022), 108859","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.654803Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:8502b0beacf4b697a07db4547494807f25c7eb1edc88929d3f5aeb922623f4eb","observation_id":"f1b53914-1f17-4a66-aa23-8cd001e66d09","resolution":{"observed_at":"2026-08-16T12:11:21.654803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:11:22.455557Z","title":"In The Twelfth International Conference on Learning Representations","venue":null,"work_id":"6bdcf441-950b-46b3-a7b0-f3930a84fd82","year":null},"citing_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:21.710945Z"},"links":{"citing_paper":"/paper/2504.13535"},"observation_digest":"sha256:e3291ba239304672a989f18aed8a2a4f992cde1e3f34b0d4345cab2648fb9690","observation_id":"ad04e2e0-164b-48b8-a4fb-270ddbdb537a","resolution":{"observed_at":"2026-08-16T12:11:22.459160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2504.13535."}