{"as_of":"2026-08-09T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a377a95d0aa37ff0173b28060ece30ea482f075cf405b3db4a9270b0e67dd8a3","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:54:23.104469Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05222/citation-record","integrity":"/paper/2608.05222/integrity","json":"/paper/2608.05222/citation-record.json","paper":"/paper/2608.05222"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-08T17:54:22.857355Z","title":"Bar-Tal, O.; Chefer, H.; Tov, O.; Herrmann, C.; Paiss, R.; Zada, S.; Ephrat, A.; Hur, J.; Li, Y .; Michaeli, T.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.857355Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:21c124cda36e665b887b7f29e567d40e55883e3d72bfd7b0608f4d8d447c1b9c","observation_id":"a6515c44-4ef2-4503-b7bd-b62dc5b0f1e6","resolution":{"observed_at":"2026-08-08T17:54:22.857355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T17:54:22.867787Z","title":"Chen, K.; Wu, Y .; Liu, H.; Nezhurina, M.; Berg-Kirkpatrick, T.; and Dubnov, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.867787Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:6d9fc3606a89d548c1c2202aa340913ae287e65a927c33d3ac16254ca7ecb8f7","observation_id":"4f43d365-518a-40f4-84b4-30d389fc9897","resolution":{"observed_at":"2026-08-08T17:54:22.867787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:54:23.535194Z","title":"InICASSP 2024-2024 IEEE Interna- tional Conference on Acoustics, Speech and Signal Process- ing (ICASSP), 1206–1210","venue":null,"work_id":"3fae719b-d788-4ce8-ba51-9a52da374e13","year":2024},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.873016Z"},"links":{"citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:2d9406e821de0b3d9a84c743920a9f0d77e957f8970362491e5d8cfbf7a237ad","observation_id":"273693a8-f2cf-469e-9228-d62a582ed790","resolution":{"observed_at":"2026-08-08T17:54:23.539916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:54:23.519684Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 1–5","venue":null,"work_id":"7c1e0de9-2523-4df7-a733-563cdb3c981b","year":2023},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.887371Z"},"links":{"citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:de060e05aa7f4d8a93bfae99458ec20ebd79f5afb8e26cca3dbd42a0d20f92ba","observation_id":"e1d1ea82-7ed2-438b-92db-8fe2228288cb","resolution":{"observed_at":"2026-08-08T17:54:23.524635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-07T16:14:25.577993Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-08T17:54:22.891858Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 1–5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.891858Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:dd61c1fd6f8d29dd3cc2622015e8ed045abe31a508ede36ff37c9026d0b62bf4","observation_id":"ae39f69c-a169-4759-b809-9e29a31f997f","resolution":{"observed_at":"2026-08-08T17:54:22.891858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-08T17:54:22.896826Z","title":"Ho, J.; Jain, A.; and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.896826Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:4f2625f0e60ebf8d84ce751ea8602f9969a01ad85b8fbed992611692f93bae07","observation_id":"105e8c7f-b948-40ec-9d5a-68954b12baaa","resolution":{"observed_at":"2026-08-08T17:54:22.896826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-08T17:54:22.901792Z","title":"Huang, Q.; Jansen, A.; Lee, J.; Ganti, R.; Li, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.901792Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:bf1aca604ccd1d1f4b357a8387f260f62a5a1107e452fe4dabf6943eaf713023","observation_id":"cc7317ee-6fd8-49ca-b85c-d9dc23da835f","resolution":{"observed_at":"2026-08-08T17:54:22.901792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-08T17:54:22.907977Z","title":"Hung, H.-T.; Ching, J.; Doh, S.; Kim, N.; Nam, J.; and Yang, Y .-H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.907977Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:54c41d21abdfc749ef2215b430fd6e4269c0bc83a4b3f3a0bbe068cfe3234ee3","observation_id":"4f81140f-afe0-49b6-8345-0031d08cab2b","resolution":{"observed_at":"2026-08-08T17:54:22.907977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07532","last_updated":"2024-01-15T08:41:01Z","snapshot_observed_at":"2026-08-09T05:43:24.920401Z","submitted_at":"2024-01-15T08:41:01Z","title":"Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation","version":1},"cited_work":{"arxiv_id":"2401.07532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07532","snapshot_observed_at":"2026-08-08T17:54:23.311411Z","title":"Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation","venue":"cs.SD","work_id":"c5183e0d-89db-455a-87e7-a6c64d285c88","year":2024},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.922897Z"},"links":{"cited_paper":"/paper/2401.07532","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:34783825e3162726d736ab4bf0e8ddc7ef5225347cb1bf4140e88b14d00d2085","observation_id":"05672a3b-b744-4038-b8c4-c0a1684da041","resolution":{"observed_at":"2026-08-08T17:54:23.318894Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05448","last_updated":"2022-09-16T08:05:37Z","snapshot_observed_at":"2026-07-06T13:08:52.902869Z","submitted_at":"2022-05-10T13:08:49Z","title":"Symphony Generation with Permutation Invariant Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05448","snapshot_observed_at":"2026-08-08T17:54:22.927741Z","title":"Lu, P.; Xu, X.; Kang, C.; Yu, B.; Xing, C.; Tan, X.; and Bian, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.927741Z"},"links":{"cited_paper":"/paper/2205.05448","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:c6120818dee612038dcc382dbfa76d1370e23b142890f3ee8e8d0908674218a9","observation_id":"c39156a9-052c-4d01-a835-1c5b26ce463e","resolution":{"observed_at":"2026-08-08T17:54:22.927741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00110","last_updated":"2023-05-31T18:34:16Z","snapshot_observed_at":"2026-08-03T13:36:05.186462Z","submitted_at":"2023-05-31T18:34:16Z","title":"MuseCoco: Generating Symbolic Music from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00110","snapshot_observed_at":"2026-08-08T17:54:22.950607Z","title":"arXiv preprint arXiv:2306.00110","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.950607Z"},"links":{"cited_paper":"/paper/2306.00110","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:31b32b3e2cda2a367d3e871f69cd5b499414142204394363323269fa9c45e981","observation_id":"af262a4d-1262-4886-a43d-acd0802b97e5","resolution":{"observed_at":"2026-08-08T17:54:22.950607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-06T19:39:54.540216Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-08T17:54:22.979881Z","title":"Min, L.; Jiang, J.; Xia, G.; and Zhao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.979881Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:9a04cd0c5aaa7f387b4432e8631d1b33f8a843b5094836c9e6eab4b607fd2f7a","observation_id":"8fc956f7-7bdc-42f8-9c5b-bb93f9cf7fbc","resolution":{"observed_at":"2026-08-08T17:54:22.979881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10304","last_updated":"2023-07-19T06:36:31Z","snapshot_observed_at":"2026-07-06T15:56:03.875184Z","submitted_at":"2023-07-19T06:36:31Z","title":"Polyffusion: A Diffusion Model for Polyphonic Score Generation with Internal and External Controls","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10304","snapshot_observed_at":"2026-08-08T17:54:23.032198Z","title":"Mittal, G.; Engel, J.; Hawthorne, C.; and Simon, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.032198Z"},"links":{"cited_paper":"/paper/2307.10304","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:5fd330b2b4f1815b95aeb728f99b062f4efc07a955724b2737bf59014c4f49cd","observation_id":"50bc3d6e-8142-479c-bc00-ec77c11e1c30","resolution":{"observed_at":"2026-08-08T17:54:23.032198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16091","last_updated":"2021-11-25T19:58:39Z","snapshot_observed_at":"2026-08-04T23:36:11.662435Z","submitted_at":"2021-03-30T05:48:05Z","title":"Symbolic Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16091","snapshot_observed_at":"2026-08-08T17:54:23.055772Z","title":"M¨uller-Franzes, G.; Niehues, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.055772Z"},"links":{"cited_paper":"/paper/2103.16091","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:d224a2a7d0a8d5c019067baedc79b7a6cc98b9b17a1121609281e79764617860","observation_id":"7ae14d82-eb1b-4d0b-bd1e-92bb6d562f48","resolution":{"observed_at":"2026-08-08T17:54:23.055772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T17:54:23.080284Z","title":"Raffel, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.080284Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:141325ad4cb5d3a476fb2771859a13a0438dd98e9a5fb9d2c56d11802ee90aad","observation_id":"3177bb59-396d-4118-8ae3-b8ca441ec781","resolution":{"observed_at":"2026-08-08T17:54:23.080284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11757","last_updated":"2023-10-23T20:47:30Z","snapshot_observed_at":"2026-07-06T14:45:19.481734Z","submitted_at":"2023-01-27T14:52:53Z","title":"Mo\\^usai: Text-to-Music Generation with Long-Context Latent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11757","snapshot_observed_at":"2026-08-08T17:54:23.085526Z","title":"Van Den Oord, A.; Vinyals, O.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.085526Z"},"links":{"cited_paper":"/paper/2301.11757","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:8b7755223dc3cc9cfd62b4ef2f291605efbd7f19d52f85b66ef1035489d91f7c","observation_id":"81e39820-6994-451f-99b8-a8c7a942db3b","resolution":{"observed_at":"2026-08-08T17:54:23.085526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09901","last_updated":"2024-05-16T08:48:23Z","snapshot_observed_at":"2026-08-07T17:52:07.751429Z","submitted_at":"2024-05-16T08:48:23Z","title":"Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09901","snapshot_observed_at":"2026-08-08T17:54:23.094990Z","title":"Wu, S.; and Sun, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.094990Z"},"links":{"cited_paper":"/paper/2405.09901","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:ed3ebde9ee4a3f0871a40b70262152aadc01e0682e8054685f0ca113d0456ac8","observation_id":"44d78cd7-78f1-4711-9823-c20a555e641b","resolution":{"observed_at":"2026-08-08T17:54:23.094990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11216","last_updated":"2023-01-04T01:06:19Z","snapshot_observed_at":"2026-07-06T14:20:58.769163Z","submitted_at":"2022-11-21T07:19:17Z","title":"Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11216","snapshot_observed_at":"2026-08-08T17:54:23.099837Z","title":"Zeghidour, N.; Luebs, A.; Omran, A.; Skoglund, J.; and Tagliasacchi, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.099837Z"},"links":{"cited_paper":"/paper/2211.11216","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:a48c71b66b9259b5695ca1105665be01afbf0d21be5550d6fa18a5e56069e87e","observation_id":"3571aefe-3462-4d1a-8a65-1b5a2c7edae0","resolution":{"observed_at":"2026-08-08T17:54:23.099837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-07-06T17:13:17.263599Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-08T17:54:23.104469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.104469Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:14decd8ca321db0e3d3d853f95745295b0de310b01295a4358eda0499515d021","observation_id":"663438e4-e295-4e3d-851e-943b5c9e488a","resolution":{"observed_at":"2026-08-08T17:54:23.104469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T17:54:22.918152Z","title":"Lin, Z.; Chen, J.; Tang, B.; Sha, B.; Yang, J.; Ju, Y .; Fan, F.; Kang, S.; Wu, Z.; and Meng, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.918152Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:88750ef2ab7b0c9df21ae07c4a97465962e37b47e7e8b82f3a4a037d97fe3ccf","observation_id":"92bf661a-9c73-41c0-ab1e-0979609781d1","resolution":{"observed_at":"2026-08-08T17:54:22.918152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T17:54:22.882276Z","title":"Dong, H.-W.; Chen, K.; Dubnov, S.; McAuley, J.; and Berg-Kirkpatrick, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.882276Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:cc7cf4eebeef06b7e1d69fbd536a8395353d3fed099465c754f561cf8b32c61a","observation_id":"70069825-e6b9-4023-bce2-8e464c80c663","resolution":{"observed_at":"2026-08-08T17:54:22.882276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07142","last_updated":"2020-08-17T08:08:14Z","snapshot_observed_at":"2026-08-06T03:13:15.423488Z","submitted_at":"2020-08-17T08:08:14Z","title":"POP909: A Pop-song Dataset for Music Arrangement Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07142","snapshot_observed_at":"2026-08-08T17:54:23.090051Z","title":"Wang, Z.; Min, L.; and Xia, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.090051Z"},"links":{"cited_paper":"/paper/2008.07142","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:7bdf404c27ddc2de8c5609ae0845ad7be786c38aa7ebb27dba1fbf23bc71ed49","observation_id":"e8e6da20-9c3e-400e-8201-e5f354deb0db","resolution":{"observed_at":"2026-08-08T17:54:23.090051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01374","last_updated":"2021-08-03T08:59:26Z","snapshot_observed_at":"2026-07-06T11:35:04.274714Z","submitted_at":"2021-08-03T08:59:26Z","title":"EMOPIA: A Multi-Modal Pop Piano Dataset For Emotion Recognition and Emotion-based Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01374","snapshot_observed_at":"2026-08-08T17:54:22.913422Z","title":"arXiv preprint arXiv:2108.01374","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.913422Z"},"links":{"cited_paper":"/paper/2108.01374","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:de20b3432526b9a62ef855a2c75fef2174042f6423d689561a4930a81994c75a","observation_id":"6fec1bb8-bd79-4231-b913-453677663ad7","resolution":{"observed_at":"2026-08-08T17:54:22.913422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-08T17:54:22.877436Z","title":"Devlin, J.; Chang, M.-W.; Lee, K.; and Toutanova, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.877436Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:badbd25e8ceb0e87f4fe6ac54be668a4b35daa2b68daa3adb58f4789d778b2f0","observation_id":"90a167dd-addb-4891-94d6-4db58d9af18d","resolution":{"observed_at":"2026-08-08T17:54:22.877436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T17:54:22.839229Z","title":"Agostinelli, A.; Denk, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.839229Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:d0b78e80ae4fdf81b4d59a2cca4fa2525a7e6d2d490b9ddb85e57a89d9c1e2f0","observation_id":"43418b24-ca96-4809-ab7f-55dae6a259ec","resolution":{"observed_at":"2026-08-08T17:54:22.839229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-08T17:54:22.862705Z","title":"Blattmann, A.; Dockhorn, T.; Kulal, S.; Mendelevitch, D.; Kilian, M.; Lorenz, D.; Levi, Y .; English, Z.; V oleti, V .; Letts, A.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.862705Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:e7697406a0b5f967ffc3a684003732486ef62650f75c6ceae821f8b8cafdd296","observation_id":"16343409-1236-4d50-895e-c0f0a44e432c","resolution":{"observed_at":"2026-08-08T17:54:22.862705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T08:10:31.873438Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2608.05222."}