{"as_of":"2026-08-08T07:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b8f0985fa536fa276a4e818d8b1f1e763049975ee410d68a46dd70cb12f7807","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:12:25.051290Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T03:24:50.604019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T03:25:58.959457Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":"2506.08570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08570","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-regressive vs flow-matching: a comparative study of modeling paradigms for text-to-music generation.arXiv preprint arXiv:2506.08570","venue":null,"work_id":"dfc1954c-d746-49b3-b031-0a0784dda031","year":null},"citing_paper":{"arxiv_id":"2605.22717","last_updated":"2026-05-21T16:54:07Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:54:07Z","title":"Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T03:24:50.604019Z"},"links":{"cited_paper":"/paper/2506.08570","citing_paper":"/paper/2605.22717"},"observation_digest":"sha256:f77ba2f5d0e2277b71fd99a3ae6cbd400f91de9c74cfb78caa063e3530d0ae84","observation_id":"f4742ac3-e44c-4d1c-98b7-df88847bfe8f","resolution":{"observed_at":"2026-05-22T03:25:58.963026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08570/citation-record","integrity":"/paper/2506.08570/integrity","json":"/paper/2506.08570/citation-record.json","paper":"/paper/2506.08570"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T05:12:24.497950Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.497950Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:ecdb259906d8004fe35daef3064247226bf3cae2f5ab11a22cedad18c27db708","observation_id":"0096660f-871f-4f0e-9921-735bdbe7c9b1","resolution":{"observed_at":"2026-08-07T05:12:24.497950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.372102Z","title":"To better isolate the runtime overheads, we discard cross attention layers (that can’t use KV-cache) and replace the AR softmax + top-p sampling with argmax sampling","venue":null,"work_id":"42c4fc67-d257-4e6f-9272-0692e4fb2bb5","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:25.051290Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:ee45859c55bee6ca9fa47d3199f8181a601cfe0de168d21af84cd3f51ea93140","observation_id":"69a424d1-a53f-4f37-ae08-1898b22aa4ec","resolution":{"observed_at":"2026-08-07T05:12:26.383222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T05:12:24.578248Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.578248Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:97cb0e7befb9331fdfe3f7d56fd2039649ef040b2f59669f26ede67bfcad1ce0","observation_id":"cc849a7e-e830-490c-8dbf-f0b1f2038b41","resolution":{"observed_at":"2026-08-07T05:12:24.578248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-07T05:12:24.591213Z","title":"Juke- box: A generative model for music.arXiv preprint arXiv:2005.00341,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.591213Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:8c0219d6b5720142ddca2282905773c4b1a86cf425c499fcc7cddcf650b48bdb","observation_id":"370594a1-d1f5-4a9a-ac07-984436ba69ac","resolution":{"observed_at":"2026-08-07T05:12:24.591213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04930","last_updated":"2016-06-15T19:38:14Z","snapshot_observed_at":"2026-08-08T01:41:31.725218Z","submitted_at":"2016-06-15T19:38:14Z","title":"Deep Learning for Music","version":1},"cited_work":{"arxiv_id":"1606.04930","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.04930","snapshot_observed_at":"2026-08-07T05:12:26.098842Z","title":"Deep Learning for Music","venue":"cs.LG","work_id":"6636282c-54fa-4247-85cc-3e3dfddd67b0","year":2016},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.628168Z"},"links":{"cited_paper":"/paper/1606.04930","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:a1e1faddb83722b4ada19211c3484e8d9555788d85959c92df100cd1a4113a5c","observation_id":"ee8b33c5-403e-4093-ab81-1975daca5ff6","resolution":{"observed_at":"2026-08-07T05:12:26.108926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-07T05:12:24.675049Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algorithms.arXiv preprint arXiv:1812.08466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.675049Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:21a580cb3863fa85e0a2b56c61fdffefb247dbf827cdb39d3786437d2d55112a","observation_id":"e1e0b60a-add0-4290-9c89-987a37e75f8d","resolution":{"observed_at":"2026-08-07T05:12:24.675049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-07-06T18:41:18.308899Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-07T05:12:24.684386Z","title":"High fidelity text-guided music editing via single-stage flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.684386Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:029f6833f37283ebad7a46a3e84efe5b9e03b0d19b322edc8ac1ec22e62048b3","observation_id":"344845c2-e6e4-484d-ad1c-2d00f9e4bc5e","resolution":{"observed_at":"2026-08-07T05:12:24.684386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12796","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:25.821326Z","title":"A survey on cross-modal interaction between music and multimodal data.arXiv preprint arXiv:2504.12796,","venue":null,"work_id":"eaaaaa4d-8970-47df-b833-4e32937e2e06","year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.701724Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:01325d9590de88490c6aaac3fb8de2726681740e6557cdb3fa96ec3d63873cde","observation_id":"b4c3981d-e8dc-4eef-99ac-37f248a70e58","resolution":{"observed_at":"2026-08-07T05:12:25.845961Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-07T05:12:24.715076Z","title":"Flowmatchingguideandcode","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.715076Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:0ecba25bb30e124ca4ee937b77b8be1dce9c84d0866acd307ed15c10589c80fd","observation_id":"a865798b-639b-42b2-b9ac-b4fa0f017fc4","resolution":{"observed_at":"2026-08-07T05:12:24.715076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:12:24.725538Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.725538Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:4b0d248344d2404605f811cce13715297c61dff9ec6a4f69df6f00d3af0feebd","observation_id":"747f30dd-9cd3-4e9b-9666-bfeba7dd8d19","resolution":{"observed_at":"2026-08-07T05:12:24.725538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.780419Z","title":"Mir_eval: Atransparentimplementationofcommonmirmetrics","venue":null,"work_id":"5019a688-18cd-4023-a9f1-231a25766b50","year":2014},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.757852Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:1a461ccb7d513155f52d98089736c66c2f476d4db0e2544d1e7a544cdd585ab3","observation_id":"60b6d1a4-2957-473e-ab9c-0cd06e8b607f","resolution":{"observed_at":"2026-08-07T05:12:26.802705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07461","last_updated":"2025-05-16T07:57:01Z","snapshot_observed_at":"2026-08-07T08:27:37.546459Z","submitted_at":"2025-02-11T11:12:19Z","title":"JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07461","snapshot_observed_at":"2026-08-07T05:12:24.775106Z","title":"Jamendomaxcaps: A large scale music- caption dataset with imputed metadata.arXiv:2502.07461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.775106Z"},"links":{"cited_paper":"/paper/2502.07461","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:b78f20d33b48b0ac262b9d227acb01689c1d488562053acf2364b03aa94ba85e","observation_id":"52b54cc5-0bbf-4d3a-a748-68c7a2994cbb","resolution":{"observed_at":"2026-08-07T05:12:24.775106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:12:24.798822Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.798822Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:64e54c965a8860ec974a1c249e913e98ff9986c269ba901554325bdb10a404c6","observation_id":"e155b3ba-2f58-472d-b99e-8182c9ac2f55","resolution":{"observed_at":"2026-08-07T05:12:24.798822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10970","last_updated":"2024-06-16T15:06:06Z","snapshot_observed_at":"2026-07-06T18:31:45.125236Z","submitted_at":"2024-06-16T15:06:06Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10970","snapshot_observed_at":"2026-08-07T05:12:24.814309Z","title":"Joint audio and symbolic conditioning for temporally controlled text-to-music generation.arXiv preprint arXiv:2406.10970,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.814309Z"},"links":{"cited_paper":"/paper/2406.10970","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:96b1dd5a6406305a1dc0d7fab566b00378c67d9b66457357c678e70f2f138e5b","observation_id":"af9cee56-48e0-4d39-bfeb-37e3996fa753","resolution":{"observed_at":"2026-08-07T05:12:24.814309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-07T05:12:24.833982Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound.arXiv preprint arXiv:2502.05139,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.833982Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:9cadb48c66e3186fdb61f36f0857e603ef3129e04246534280b723a99654595d","observation_id":"75b82d8c-b7c3-4758-8eaa-cfd69bf3107b","resolution":{"observed_at":"2026-08-07T05:12:24.833982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T05:12:24.856067Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.856067Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:e228cdf91fb5a63f73bcca3d2250156975218f6a436a280d04e630fa8aa3938f","observation_id":"25c4f62d-2778-41f1-879b-66735e0cfc0f","resolution":{"observed_at":"2026-08-07T05:12:24.856067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12982","last_updated":"2023-08-24T00:49:08Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T00:49:08Z","title":"A Survey of AI Music Generation Tools and Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12982","snapshot_observed_at":"2026-08-07T05:12:24.890167Z","title":"A survey of ai music generation tools and models.arXiv preprint arXiv:2308.12982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.890167Z"},"links":{"cited_paper":"/paper/2308.12982","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:22b40a7d6ed7debdb5c89b99334ea82162184a9adf2301d37cb4aa170cc5fc3a","observation_id":"b743b388-2dad-45b3-bd29-672b2f5f2ae2","resolution":{"observed_at":"2026-08-07T05:12:24.890167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.670422Z","title":null,"venue":null,"work_id":"9438d4e9-6ad1-40ed-9c93-aa555a4e3253","year":2019},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.918290Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:2aee7a65318120e70916971ad27b7a8500cabb849e955b63de48b92b573824ad","observation_id":"fd73db9a-cc4e-4996-90eb-03eeac81a52b","resolution":{"observed_at":"2026-08-07T05:12:26.692444Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.629727Z","title":null,"venue":null,"work_id":"962b43b5-233b-4493-af74-265f5984a216","year":2023},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.939938Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:f5ce420990934d64fd63b5b72347cb0eb76861184082b0a8e2673c23a6e3a799","observation_id":"35b49900-877d-406a-bf71-a2e165185c05","resolution":{"observed_at":"2026-08-07T05:12:26.643915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.560526Z","title":null,"venue":null,"work_id":"3d8d7ddc-9e9d-41bd-aa12-5d33f8081eca","year":2023},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.955669Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:bf900f66c74eb94b90e6a82ee2ba2bf8a03deff6160aa2290f5785e5ab2552f0","observation_id":"2d11e0b4-b15c-4bfb-8a92-e6cd1ba13de7","resolution":{"observed_at":"2026-08-07T05:12:26.569331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.506123Z","title":"For the FM case we perform slight modifications similarly to Tal et al","venue":null,"work_id":"98a2a2d8-85eb-44bf-9cb6-24ae16537e21","year":2024},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.986929Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:3a217e4dad96bb523bb1459e6932f52e46ef02f1b4138cc3ad749c0d12e607e3","observation_id":"230ad7ee-db56-41a6-a5a7-9b06867879e7","resolution":{"observed_at":"2026-08-07T05:12:26.530464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.469864Z","title":null,"venue":null,"work_id":"d33b8378-1b9b-43fe-9ab1-86d9523aae98","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:25.011025Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:4342e66c278bd7f9c3f6fa2e16e5a8819834e1a66a49738cbea458fc2e7e757e","observation_id":"35324411-32cd-42e8-a34a-27769c5d90fb","resolution":{"observed_at":"2026-08-07T05:12:26.479577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.425240Z","title":null,"venue":null,"work_id":"42e14f2a-c100-49d4-9501-690757e9884b","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:25.036504Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:be055cd437d1d8c4d3513024449b7f448035deafd7b6855daddd72be19dbb56f","observation_id":"ac83068b-dee0-47ce-84b0-4728fa2bd53c","resolution":{"observed_at":"2026-08-07T05:12:26.436932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T05:12:24.749224Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1956,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.749224Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:0c54a7d3020447355b2da645bb14475471b4b900283ab59e93a85427debcd803","observation_id":"8a376d8f-dff3-419e-b723-7df51cba5bc3","resolution":{"observed_at":"2026-08-07T05:12:24.749224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.934203Z","title":"Stable audio open","venue":null,"work_id":"046b424b-ed5c-4c76-8ea1-eaaf7ac9f993","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1980,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.619879Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:29e1bc94c5c7a533d25bae7d372dd6cd46fe82ca5f619bbaa06c0da424b057fb","observation_id":"4a873016-ce04-4310-9b0b-526ff1f98f07","resolution":{"observed_at":"2026-08-07T05:12:26.942927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.841615Z","title":"Tunes by technology: A comprehensive survey of music generation models","venue":null,"work_id":"0cdc5d33-3d16-4e72-8284-41e81d95bb4d","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.735028Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:8abad49d7711e0a9a7f261ca5163bfc483f25d06ef90f0b2dda3465d230d1dbe","observation_id":"4fbd030f-8a32-41c1-916e-4fdecd91854c","resolution":{"observed_at":"2026-08-07T05:12:26.853579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.04281","last_updated":"2018-12-12T07:42:08Z","snapshot_observed_at":"2026-08-07T03:41:05.212645Z","submitted_at":"2018-09-12T07:15:26Z","title":"Music Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.04281","snapshot_observed_at":"2026-08-07T05:12:24.636619Z","title":"Music transformer.arXiv preprint arXiv:1809.04281,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.636619Z"},"links":{"cited_paper":"/paper/1809.04281","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:7d0cf2e70012d0d4ba0a6a19592d6d0f433ccc32fd9836cac27262829bf390b5","observation_id":"ee0fecb6-e207-444f-b1c4-9e39593473b6","resolution":{"observed_at":"2026-08-07T05:12:24.636619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:27.071793Z","title":"The mtg-jamendo dataset for automatic music tagging","venue":null,"work_id":"4e16f480-97b2-4aeb-9463-a3f4ede71ff0","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.549802Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:e308497ada3a5786ccc1cd6072415cc3d73e25e00d5128577ffd92829d681b75","observation_id":"0a55a77b-6190-4eab-be90-4d7ff5b80664","resolution":{"observed_at":"2026-08-07T05:12:27.081904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.894232Z","title":"Multiplicity of periodic bouncing solutions for generalized impact hamiltonian systems","venue":null,"work_id":"7c03b585-b255-4b09-9bff-607f903b0bcb","year":2019},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.647739Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:1ebdc2f7469f2c31924ed04668cb458e7dbf359e2892201ea646ec2ca0ee1fcc","observation_id":"19943c2b-d312-4f37-9e10-a8caf964091b","resolution":{"observed_at":"2026-08-07T05:12:26.910768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-07T05:12:24.656553Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.656553Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:6f50b32ad3bb92278147b21d24c2fcfd6441652865a83a1ccacb4cc6b9db6f93","observation_id":"2e992f79-4caa-4c9e-aa50-0cc9b025c4c8","resolution":{"observed_at":"2026-08-07T05:12:24.656553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.974076Z","title":"Evolving four-part harmony using genetic algorithms","venue":null,"work_id":"af6d93c6-4ec5-4b54-9c14-8557292b408b","year":2011},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.609093Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:e3fbbaaa6596bd69600998ceafdc2a1a36b40aaa282d6a099666893977ba2c01","observation_id":"f6cbd517-15d6-4400-a060-15b086c1985c","resolution":{"observed_at":"2026-08-07T05:12:26.986299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.735760Z","title":"Diffusion based text-to-music generation with global and local text based conditioning","venue":null,"work_id":"b6fad184-2e7c-41a4-934e-c8520ef674ef","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.879929Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:46274e1cc6250286766e1499683e4c7b413540dbc89452ba3346c47964cb28df","observation_id":"4b52ea69-ea1e-4b7e-b709-0fc7df0892dd","resolution":{"observed_at":"2026-08-07T05:12:26.749384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:27.025920Z","title":"Musicldm: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies","venue":null,"work_id":"2fa7d3f0-5265-48d7-bf4f-f650b6b2ed83","year":2024},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.564295Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:46a8f6879e843755f84b77729750819180f62ef8c683caf3bc90672e79f9ec11","observation_id":"a4bb7886-d64a-4652-8fd2-e5d75db69fcb","resolution":{"observed_at":"2026-08-07T05:12:27.034096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09214","last_updated":"2024-09-19T07:14:20Z","snapshot_observed_at":"2026-07-06T19:15:17.200627Z","submitted_at":"2024-09-13T22:06:18Z","title":"Seed-Music: A Unified Framework for High Quality and Controlled Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09214","snapshot_observed_at":"2026-08-07T05:12:24.508703Z","title":"Seed-music: A unified framework for high quality and controlled music generation.arXiv preprint arXiv:2409.09214,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.508703Z"},"links":{"cited_paper":"/paper/2409.09214","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:9ef4fc515214313889aaa1a45e1fdf0159e2b65a7da632de0d49515972154a51","observation_id":"ef892dfd-b6a2-4aa0-a236-cc5531a08de7","resolution":{"observed_at":"2026-08-07T05:12:24.508703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-07T11:38:07.397956Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-07T05:12:24.524083Z","title":"Efficient training of language models to fill in the middle.arXiv preprint arXiv:2207.14255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.524083Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:b65cfd1b03cfade952c23e0c1edda0d5286996fc02fc0caeefff3d2979045a5f","observation_id":"dbc930a7-8b00-45c3-a39e-40141b837bda","resolution":{"observed_at":"2026-08-07T05:12:24.524083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:12:24.845888Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.845888Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:2150e57ce433658610f239d803fc7720c4596744932df237b402b7db253d239a","observation_id":"f45e2c57-cbdf-40fa-af9d-578c1bb6b4b8","resolution":{"observed_at":"2026-08-07T05:12:24.845888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T18:29:47.576692Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.08570."}