{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:784c2721c71b22b7eb587f7a83a5f95a016227826383a8728e2b82457e4cda4e","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:16:19.338517Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:43.128810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:48:59.860115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-06T13:14:37.507871Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20880","last_updated":"2025-07-28T14:34:02Z","snapshot_observed_at":"2026-08-06T16:37:02.345788Z","submitted_at":"2025-07-28T14:34:02Z","title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T13:14:37.507871Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2507.20880"},"observation_digest":"sha256:1c274a68659c2a8e1c0b6143fe0d69e61142676f8f3124a74e3aafefb857f3a5","observation_id":"607794e3-305a-4413-8fa2-5d90040a27f4","resolution":{"observed_at":"2026-08-06T13:14:37.507871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-06T06:04:29.880406Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.880406Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:c96d56280323bf8d947840f1e9ce42d1dfad2829bf42bebbb8dd34b7dd03437d","observation_id":"c7bb091b-edf2-421f-808d-1cf2109f21c1","resolution":{"observed_at":"2026-08-06T06:04:29.880406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-05T23:43:03.692143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:03.692143Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:1c05065fa915aff10019fb46192faa3ac59df48424f98b5c6ad41e8eab723687","observation_id":"0a61d2d4-36d4-439c-83c2-634dc4032319","resolution":{"observed_at":"2026-08-05T23:43:03.692143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-05T00:05:47.596423Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.596423Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:bdffdd44aa91322696cad54a5260dc5a11810710f5567ca01c1cd84c7bb8f15c","observation_id":"5110b3af-f508-44e5-b08f-763b95cffc20","resolution":{"observed_at":"2026-08-05T00:05:47.596423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:3c817c732976be45d9198bc9e6adc064927a9189293562e503313b7deaa2b315","observation_id":"af8bd234-643b-4344-aedd-ca8b67093cd6","resolution":{"observed_at":"2026-05-17T01:03:15.219965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2510.02797","last_updated":"2026-04-08T17:04:46Z","snapshot_observed_at":"2026-07-06T22:31:35.666707Z","submitted_at":"2025-10-03T08:10:19Z","title":"SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T10:45:09.089710Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2510.02797"},"observation_digest":"sha256:a9d6d969ad45c16a60ad647dc1c7c0e70209f5b143f20b71c1df4035e4881464","observation_id":"b6b2c2c2-c7a3-481f-8e9c-b03a6dd75d6a","resolution":{"observed_at":"2026-05-18T10:46:16.858659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-03T16:25:55.887395Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.887395Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:5eb48598e529515653eec451b4f22f4edf75e4f7c2be2c5e21b3f88cbee24efc","observation_id":"7ae5821c-dec4-4de1-bb54-c93df909c2ee","resolution":{"observed_at":"2026-08-03T16:25:55.887395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2602.11910","last_updated":"2026-05-18T20:48:30Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T13:07:14Z","title":"TADA! Tuning Audio Diffusion Models through Activation Steering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T13:40:47.112814Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2602.11910"},"observation_digest":"sha256:3dfd97bcd6f2ad9f231629f4f0b11aec64812ff923c3f2c36d3339782f154706","observation_id":"9968680e-dce0-4bf3-84ac-c4ce297dd30f","resolution":{"observed_at":"2026-05-21T13:44:11.551922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2602.22029","last_updated":"2026-05-05T13:00:43Z","snapshot_observed_at":"2026-08-03T04:31:55.954534Z","submitted_at":"2026-02-24T06:43:27Z","title":"MIDI-Informed Singing Accompaniment Generation in a Compositional Song Pipeline","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T20:17:45.920234Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2602.22029"},"observation_digest":"sha256:c68b1d4738d5ed8208e42f7cd3f2dffe6d8fa606df8491dfc899691a4381b837","observation_id":"7c6cabd7-a8aa-43c8-be3d-6880c211ae87","resolution":{"observed_at":"2026-05-15T20:20:17.918821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T17:35:47.688979Z","title":"ACE-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.688979Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:085e152eb64dd8b12f152151a8a858f4d74ac7ce99449f283388e3689c04a853","observation_id":"310031d3-f4a0-4f8d-9b1a-2c3d248d3cb6","resolution":{"observed_at":"2026-08-02T17:35:47.688979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2604.11052","last_updated":"2026-07-23T10:38:22Z","snapshot_observed_at":"2026-08-07T15:30:54.909219Z","submitted_at":"2026-04-13T06:29:34Z","title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:08:58.648967Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2604.11052"},"observation_digest":"sha256:2104d9b892c5cf748d01868b0296de581022f3ac2ee8488ae41a1fce4fedc8cb","observation_id":"ecbcf569-4432-4a67-8b22-40bd3d323ec8","resolution":{"observed_at":"2026-05-11T09:16:01.532365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T16:27:21.119692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11052","last_updated":"2026-07-23T10:38:22Z","snapshot_observed_at":"2026-08-07T15:30:54.909219Z","submitted_at":"2026-04-13T06:29:34Z","title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T16:27:21.119692Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2604.11052"},"observation_digest":"sha256:db8001ad6d378d7a047991b562b2c747e4664a5586188ebfa1740afa7ccd67ad","observation_id":"13a0087d-9539-4c4a-8519-843e847b4df9","resolution":{"observed_at":"2026-08-02T16:27:21.119692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2604.25937","last_updated":"2026-04-16T04:26:34Z","snapshot_observed_at":"2026-08-04T04:34:28.014298Z","submitted_at":"2026-04-16T04:26:34Z","title":"SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T10:14:41.499130Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2604.25937"},"observation_digest":"sha256:22b68cd0999032a6c6d40fe8382fc228b7d730aff9bbb66fe90a2eacef9819fd","observation_id":"d0263534-865a-4bae-b7db-23f713ff310f","resolution":{"observed_at":"2026-05-10T10:24:22.334741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.01809","last_updated":"2026-05-03T10:25:47Z","snapshot_observed_at":"2026-08-06T14:33:30.037257Z","submitted_at":"2026-05-03T10:25:47Z","title":"TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T16:11:16.551910Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.01809"},"observation_digest":"sha256:d7e2837702f15cf2cbeef00b7963e6515e739f5a521e04a0bd1564772d78166b","observation_id":"86ef11ed-3261-4695-a0b5-79949d4777c1","resolution":{"observed_at":"2026-05-11T16:36:06.108044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.03395","last_updated":"2026-06-05T18:04:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T06:11:51Z","title":"APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T13:27:41.439049Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.03395"},"observation_digest":"sha256:2339fcebd194b7a6fb130277dd2be585199463207d6825b95d7d27641f316a7f","observation_id":"be05e593-f1f9-4e55-abdc-b9638dcd151c","resolution":{"observed_at":"2026-05-12T10:56:29.750313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.03395","last_updated":"2026-06-05T18:04:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T06:11:51Z","title":"APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T00:35:42.697038Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.03395"},"observation_digest":"sha256:55638f6210f776fa0061b389e2fe975473142b5a82d92de796fcc8ee44e92b2f","observation_id":"36991cea-e9fa-440d-b263-15473293870c","resolution":{"observed_at":"2026-07-01T00:45:12.341833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-12T16:57:23.214654Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.12479","last_updated":"2026-07-06T08:55:19Z","snapshot_observed_at":"2026-07-12T16:57:22.059952Z","submitted_at":"2026-05-12T17:56:29Z","title":"Cutting rules in strong field QED with application to trident pair production","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T16:57:23.214654Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.12479"},"observation_digest":"sha256:e8a9baabe6dcf76743e2a2f9885ecad5c413460bb7c65e9f5e56adae5b71992f","observation_id":"8cef5aeb-d6b0-4e75-aee4-3ee51dfd1d14","resolution":{"observed_at":"2026-07-12T16:57:23.214654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.12480","last_updated":"2026-05-12T17:56:59Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:56:59Z","title":"OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T06:16:20.612291Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.12480"},"observation_digest":"sha256:b9b7c82e15ac028fe64a0b6b76da42f878ed37b54cb36f3892b97b494fb383b5","observation_id":"12dd018e-0aad-4d75-9e9d-1619b69a25eb","resolution":{"observed_at":"2026-05-13T06:17:22.920096Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.17414","last_updated":"2026-05-17T12:22:17Z","snapshot_observed_at":"2026-08-06T15:14:48.165289Z","submitted_at":"2026-05-17T12:22:17Z","title":"S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T22:50:08.321514Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.17414"},"observation_digest":"sha256:d64c5e62307e55925b6db72d92ca480c28d8836b3f13e99d0a6b054de9b8bc72","observation_id":"788b2689-12cb-414e-8b9a-0b20e04cbf89","resolution":{"observed_at":"2026-05-19T22:52:50.459830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.21433","last_updated":"2026-05-20T17:23:58Z","snapshot_observed_at":"2026-08-02T08:06:48.596429Z","submitted_at":"2026-05-20T17:23:58Z","title":"Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T02:43:16.101544Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.21433"},"observation_digest":"sha256:f3596ec95e12bc6403311ca266d35e81c29ac2686fe7398a864c6af33110bd93","observation_id":"ebc97580-98ed-49a8-a723-6ca14b67c2c3","resolution":{"observed_at":"2026-05-21T02:43:54.924541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.30965","last_updated":"2026-05-29T07:58:54Z","snapshot_observed_at":"2026-08-02T19:54:21.945716Z","submitted_at":"2026-05-29T07:58:54Z","title":"ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T21:12:19.893944Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.30965"},"observation_digest":"sha256:3b11d4e79ffe05ff199f5f58328abda04beff842402e8705edb96d67f49193e2","observation_id":"9d0fd53c-60e0-46d6-8c91-6b165351c0aa","resolution":{"observed_at":"2026-07-01T20:26:12.662750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2606.07015","last_updated":"2026-06-05T07:59:17Z","snapshot_observed_at":"2026-08-07T10:25:26.085858Z","submitted_at":"2026-06-05T07:59:17Z","title":"Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:14:08.243894Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2606.07015"},"observation_digest":"sha256:afe22237fd5c6110b126430158821066aa6af7c67f6a32624d5395b79f93ccee","observation_id":"d47d9dbf-9398-49a1-b09c-e73fb9ac7a28","resolution":{"observed_at":"2026-07-02T19:57:19.597322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2606.18052","last_updated":"2026-06-16T15:29:25Z","snapshot_observed_at":"2026-07-06T23:53:36.096914Z","submitted_at":"2026-06-16T15:29:25Z","title":"An Empirical Analysis of AI Slop in Music Streaming","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T00:08:36.279506Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2606.18052"},"observation_digest":"sha256:a220b084c0d3ff19c7f32e9504f543cc9744f4224862c3cf980448bc90f93478","observation_id":"e3b93717-bbc5-4583-8be1-24859dd65462","resolution":{"observed_at":"2026-07-03T21:48:59.861457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2606.30642","last_updated":"2026-06-29T17:59:20Z","snapshot_observed_at":"2026-08-05T16:49:28.118053Z","submitted_at":"2026-06-29T17:59:20Z","title":"LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T04:21:38.825926Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2606.30642"},"observation_digest":"sha256:de4a549ba3161fb8bb40b8f69c555f028a2b7195482cca7849b838085cc57065","observation_id":"ddcc77e6-6770-4132-9653-1005ed10afa5","resolution":{"observed_at":"2026-07-01T15:15:47.551038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-14T06:56:53.384109Z","title":"Ace-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11117","last_updated":"2026-07-13T05:48:08Z","snapshot_observed_at":"2026-08-04T03:50:24.298863Z","submitted_at":"2026-07-13T05:48:08Z","title":"MusicMark: A Robust Generative Watermarking Framework for Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T06:56:53.384109Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11117"},"observation_digest":"sha256:035065eee80395ee6a8d0a88d336303a244e78c857314ade846cfc0bfe103225","observation_id":"1db8f3b9-87af-4035-ab09-b0e72081ee04","resolution":{"observed_at":"2026-07-14T06:56:53.384109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-14T06:45:43.330341Z","title":"Ace-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T06:45:43.330341Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:aad67ea9edff9fda3aa56b2d7e7a015e5f5258d46da190c229e7e3007e7857bd","observation_id":"f2752145-d739-4f3b-abbc-59bf5cc42406","resolution":{"observed_at":"2026-07-14T06:45:43.330341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T07:05:04.510458Z","title":"Ace-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:05:04.510458Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:d4a7b3f3b85fe9ed569d64b057d5939e4aaf58a4576c8b0362de3cea5b9c296a","observation_id":"91482bf6-aca7-4c5f-9ea9-c288237debd6","resolution":{"observed_at":"2026-08-02T07:05:04.510458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-14T03:47:22.936776Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-07T07:32:51.039386Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T03:47:22.936776Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:7fdbc84b449e94984b1626c170dac5de62c7594df673843adc6a983617b12018","observation_id":"27e079cd-46e0-4357-a4b9-92661222b514","resolution":{"observed_at":"2026-07-14T03:47:22.936776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T06:52:26.903347Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-07T07:32:51.039386Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:52:26.903347Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:8d5a26babab779d4b0de7c93796c039f51eebfb29cc2bca7db4588ac306115a0","observation_id":"fe00cef8-e6c0-4493-ab55-6566a33784d9","resolution":{"observed_at":"2026-08-02T06:52:26.903347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T03:25:50.281276Z","title":"Ace- step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13903","last_updated":"2026-07-15T14:44:50Z","snapshot_observed_at":"2026-08-08T20:01:31.101744Z","submitted_at":"2026-07-15T14:44:50Z","title":"Genre Bias or Aesthetic Perception? Identifying and Mitigating Shortcut Learning in Music Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:25:50.281276Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.13903"},"observation_digest":"sha256:fba0b089a5238a71d70a6b0cb42dfdaa78e7d8b550c2b7c7b09c09851763c602","observation_id":"db7d261c-a992-4881-837a-d860a877bf17","resolution":{"observed_at":"2026-08-02T03:25:50.281276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-01T12:01:57.134742Z","title":"arXiv preprint arXiv:2506.00045 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19688","last_updated":"2026-07-22T02:35:45Z","snapshot_observed_at":"2026-08-05T09:49:44.948359Z","submitted_at":"2026-07-22T02:35:45Z","title":"A Diagnostic Evaluation Framework for AI-Generated Cover Songs Using Music-Theoretic and Acoustic Features","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T12:01:57.134742Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.19688"},"observation_digest":"sha256:44ad110d2b59314b5c59206cd3a49281a9794a862ebcbb0fca806a17eb5d20fe","observation_id":"d949e0fb-134b-4f84-8d6c-0bedcbd70441","resolution":{"observed_at":"2026-08-01T12:01:57.134742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-01T10:24:19.082295Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20253","last_updated":"2026-07-29T04:40:54Z","snapshot_observed_at":"2026-08-08T12:11:38.978134Z","submitted_at":"2026-07-22T15:11:46Z","title":"Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:19.082295Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.20253"},"observation_digest":"sha256:7bc5506f449abb1033600573b859e0531c86df937c3a0099c5af2fbe5ecb975c","observation_id":"c2a48299-6730-44a6-baaf-3ad500282caf","resolution":{"observed_at":"2026-08-01T10:24:19.082295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-30T23:40:07.801267Z","title":"Ace- step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26698","last_updated":"2026-07-29T09:45:13Z","snapshot_observed_at":"2026-08-06T06:36:00.327490Z","submitted_at":"2026-07-29T09:45:13Z","title":"MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T23:40:07.801267Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.26698"},"observation_digest":"sha256:b0998111092461336ceb68c7dfd1729c83f7a117990cd26739b1246a444cc453","observation_id":"17568aa2-93fd-49dc-b420-c0f47a369205","resolution":{"observed_at":"2026-07-30T23:40:07.801267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-03T01:28:28.022775Z","title":"2506.00045 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28896","last_updated":"2026-07-30T23:28:11Z","snapshot_observed_at":"2026-08-08T00:26:01.747407Z","submitted_at":"2026-07-30T23:28:11Z","title":"TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T01:28:28.022775Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.28896"},"observation_digest":"sha256:739fbdcecdc4ba687c384252d39ce9b67a033528741d522670e366620642ed4a","observation_id":"37152fb8-a22d-4c0f-b544-e5e048dca679","resolution":{"observed_at":"2026-08-03T01:28:28.022775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-04T16:29:20.556905Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:20.556905Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:054a8904cdb28f35bb6a23a2cc4e672549ce045b3adb78838adf57898a8fd8ad","observation_id":"4942d2d7-e8a2-4feb-bb5a-321663b226e2","resolution":{"observed_at":"2026-08-04T16:29:20.556905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-07T00:14:43.128810Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.128810Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:ee88cc201bc11d974bea81d5d3f7dc2b7145160eb06ce6cfc633bddbc968b4f5","observation_id":"0518d6f5-8d75-48c3-b78a-d633529e7370","resolution":{"observed_at":"2026-08-07T00:14:43.128810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00045/citation-record","integrity":"/paper/2506.00045/integrity","json":"/paper/2506.00045/citation-record.json","paper":"/paper/2506.00045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:25.558155Z","title":"Yue: Scaling open foundation models for long-form music generation, 2025","venue":null,"work_id":"9c4319b0-45ba-4cc4-bea1-b997283dc706","year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:12.788886Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:cbcae6f7dfa1e31fb3bcd7c93944f5d3cdc134b8d3424b3743c6fb9f2c50f8c0","observation_id":"a3000579-c655-4ccd-8eeb-6ad66dab2aef","resolution":{"observed_at":"2026-08-07T13:16:25.668650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:25.320076Z","title":"Songgen: A single stage auto-regressive transformer for text-to-song generation, 2025","venue":null,"work_id":"16fb156f-5d74-4e6b-acd9-35bba5f75939","year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:12.857886Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:499ccdacf2b24bacaac10eecf4672185199b756eaf8e958648a19610365c69bb","observation_id":"4255b198-fae2-4325-a752-c7ad77d29d30","resolution":{"observed_at":"2026-08-07T13:16:25.446330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01183","last_updated":"2025-03-03T05:15:34Z","snapshot_observed_at":"2026-08-08T12:11:23.489892Z","submitted_at":"2025-03-03T05:15:34Z","title":"DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01183","snapshot_observed_at":"2026-08-07T13:16:12.977552Z","title":"DiffRhythm: Blazingly fast and embarrassingly simple end-to-end full-length song generation with latent diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:12.977552Z"},"links":{"cited_paper":"/paper/2503.01183","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:352f7894d3e222387a7c171f80060fdd817b02f50ef734e8417f86b5182a71d4","observation_id":"d98a8a89-41db-4cec-936a-a6fd0dab535f","resolution":{"observed_at":"2026-08-07T13:16:12.977552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.077727Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.077727Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:25d179949b28183f4b82bfd7d64b7a4dd197bd1a6f6a5cdfc2603ec24b467a90","observation_id":"b6a86041-e35e-4705-83e3-54706ec5eb98","resolution":{"observed_at":"2026-08-07T13:16:13.077727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T13:16:13.142079Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.142079Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:686f4d6187c1d03c17f43beec97dadd77a9f5da72395db567a57bac61f91dbea","observation_id":"433aee22-c312-42d5-86a4-7cf845f2b03f","resolution":{"observed_at":"2026-08-07T13:16:13.142079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:25.085414Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training, 2023","venue":null,"work_id":"0a3ba59e-23e9-4de8-9e18-a3f811a4ec72","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.234494Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:dba579dbc84ee9b3889bb7e8fd8b7e539c5a2e7b898e9f65302b57ee98e8ae72","observation_id":"2589ed82-51ac-4461-8b3c-f03ef7a4ae49","resolution":{"observed_at":"2026-08-07T13:16:25.180698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.885005Z","title":"mhubert-147: A compact multilingual hubert model","venue":null,"work_id":"59bd1706-89f6-497a-bec7-8ca451f7dfaa","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.348470Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:8e8d0bffdb3fb3edad5f66b170c71675f5906b968b8050d2c9f0bcfa1d2b835b","observation_id":"3c5ea20a-81e4-40f1-a753-405ba1c4e262","resolution":{"observed_at":"2026-08-07T13:16:24.971652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.472359Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.472359Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:05163d769b78c5a0ea24728e045a37b7fd23abdf9152fbd7299daf90572e2824","observation_id":"cf59c7bb-f0ad-4a2a-9c97-9ebdb1aecd2e","resolution":{"observed_at":"2026-08-07T13:16:13.472359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.580729Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.580729Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:9f81abafdc1e6db97ab25cf5478ddd24e8ff0a173aa89fe3bb7951461c204835","observation_id":"3aa12378-f07a-4b68-b16b-689f0133f0bd","resolution":{"observed_at":"2026-08-07T13:16:13.580729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.698954Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.698954Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:517a9c0bdaf4d24a038cc6acb79978bbf65023113461f3c150ef9a1dba9c6bfe","observation_id":"a665c522-449b-4a78-9fe9-ab3b64547272","resolution":{"observed_at":"2026-08-07T13:16:13.698954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:16:13.846965Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.846965Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:27f0e0c9a28d7e8f417822b8f5a020eb8278c81041adea6f6b2922e229e649e4","observation_id":"2528ee31-d1c1-4366-b2e2-c0c7be8d4db0","resolution":{"observed_at":"2026-08-07T13:16:13.846965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:16:13.964802Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.964802Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:591d31b469a85206f8fc1ca6b4c3d251c991838d528dcfd4ddd89f97a559c35b","observation_id":"5dbff2c0-301d-4a87-acd6-9b7f09410249","resolution":{"observed_at":"2026-08-07T13:16:13.964802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.113728Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.113728Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:7476beb2845139d59d0b5bcbcdd2bf7be484f40a6e834e88a101349a619110fb","observation_id":"d73db496-44ac-42ad-88d2-2a32b812dc3d","resolution":{"observed_at":"2026-08-07T13:16:14.113728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.668353Z","title":"Improving Image Generation with Better Captions","venue":null,"work_id":"1548bd0b-b74f-45bc-a9ac-20982b46989e","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.253432Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:cb44f8d9f99d208823b2fd3c3cd7362f0d6f1c8ef6c641e3a53c68f6e16e53bd","observation_id":"54a29bf8-ac64-44fc-87d2-774e64440123","resolution":{"observed_at":"2026-08-07T13:16:24.769749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.370744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.370744Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:eec7275897f7a2ad7345cc20f4103a7b00f4a0cbdd704c7d7c5efc3be69ea6e6","observation_id":"3db75307-76be-43f4-be64-410f63a112bc","resolution":{"observed_at":"2026-08-07T13:16:14.370744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.414140Z","title":"Imagen 3","venue":null,"work_id":"5a3275d4-66c3-4347-95c8-c4559cedc746","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.498247Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:3e07be1260e3d8e99f63e3376c83b876b432cbbfc1a68536d0770d6ff5984b9d","observation_id":"032a81a8-48ef-4875-acc7-b16e737b0078","resolution":{"observed_at":"2026-08-07T13:16:24.542576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.193037Z","title":"Video generation models as world simulators","venue":null,"work_id":"442d0149-3e3d-4b74-9e11-9acc739c49d8","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.590362Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:6cd47cbe679d9e1e7b342ab0095dfde1a8b8c6dc5a2ca47c48914f22ba3cfecf","observation_id":"b3d4face-d1e9-4fe9-8575-ff0f68040a27","resolution":{"observed_at":"2026-08-07T13:16:24.306066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.038054Z","title":"Kling AI Video Generation Large Model","venue":null,"work_id":"f9f8cb6a-f012-475f-a939-7ee0f9da7c00","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.758686Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a31ac949b2b252657281ea1d380faf382fb061b6da1f65f4ffe3df2e881c945b","observation_id":"36bfe483-0532-4eb5-a634-1a25ad3b1c5c","resolution":{"observed_at":"2026-08-07T13:16:24.129381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:16:14.901360Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.901360Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:985205ca9602c7b22c7c9809444eb38cd255f8fd8231066bbeec904ab6f652c3","observation_id":"0eeb16a1-3e25-4afd-939d-d8ab09c85dcc","resolution":{"observed_at":"2026-08-07T13:16:14.901360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-07T13:16:15.015975Z","title":"Jukebox: A generative model for music","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.015975Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:94ecf30825b0f0d8d8826e6d21bbddddf97fd5fe75c7a99912f0efd77eddc1d3","observation_id":"c1ab91cc-a288-4e78-94fd-1b9f9c61077f","resolution":{"observed_at":"2026-08-07T13:16:15.015975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.871392Z","title":"Simple and controllable music generation, 2024","venue":null,"work_id":"33c353de-3986-4cbf-b11b-388a8cd485c8","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.135052Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:9d99f2b3aa1cb823066b4c21d25dce41ff45986bdd6cdd37f9ac1a42d8541e32","observation_id":"fb8fcf73-5fa6-4dad-94bf-0430639983ac","resolution":{"observed_at":"2026-08-07T13:16:23.969399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.277712Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.277712Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a484b55bf53445bf36c4f5745c7e183995c7d142864c35696230664f2a0dada7","observation_id":"cefd8126-934c-499e-86dd-8758f887d83b","resolution":{"observed_at":"2026-08-07T13:16:15.277712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.649925Z","title":"Plumbley","venue":null,"work_id":"3397599e-4fbe-4c44-acbf-2610f0c2055a","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.444744Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:c31ebff998ff01740f969be369bc6bf39b04b4061e486ccf1cc5e63661760703","observation_id":"2c80b67f-2374-4816-a3e5-48bee299dd49","resolution":{"observed_at":"2026-08-07T13:16:23.735523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.398435Z","title":"Suno: Ai music generation platform","venue":null,"work_id":"e603fe1d-f7b8-4641-a079-e5ede8df282b","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.551102Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:2665f5b0eeae33dfca0582582ba2b200cc2f9c9f25ae1880b526bfa426643b7c","observation_id":"be19aa28-23b5-4c92-b8ac-b9afdf88f0ea","resolution":{"observed_at":"2026-08-07T13:16:23.529406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.132991Z","title":"Udio: Ai music creation platform","venue":null,"work_id":"dd2fb81d-e32d-4333-914e-ab1257b34bd9","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.666192Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:e1a48374837f71d2f52bef23d43ed5d549b8f74b353a3afbc3e45680eafe1f4d","observation_id":"77fd87bf-e74c-457d-b26c-12c7b13daf85","resolution":{"observed_at":"2026-08-07T13:16:23.260573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.937599Z","title":"Riffusion: Stable diffusion for real-time music generation","venue":null,"work_id":"b567628c-ab4e-46aa-81aa-ec0720808dad","year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.731915Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:d7411029bf87c9d1441e9705dc5c337fc474edd339c9b49472d2855087917f76","observation_id":"da6d2e8c-483f-4fd1-86da-7988f2c1a9f4","resolution":{"observed_at":"2026-08-07T13:16:23.004960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.788346Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.788346Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1567c0fb5e839df65b6624ca308824be3e964ccf3e6d7757f007747c105d71c0","observation_id":"502e9e4b-5afd-432d-8ca9-7055c521d108","resolution":{"observed_at":"2026-08-07T13:16:15.788346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.670984Z","title":"Fast text-to-audio generation with adversarial post-training, 2025","venue":null,"work_id":"132b0b4a-dd2c-49b8-b4ab-6a371e2c88f2","year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.845585Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:98a391a1ca712140e67435d4bb35a5ebca976da835b2b86818e48244349c680b","observation_id":"41b8446b-b645-45db-b479-d1ca6c03f281","resolution":{"observed_at":"2026-08-07T13:16:22.787291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T13:16:15.893630Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.893630Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:239fed2e356b5ece6439b67b82d4f6070644cf910d44c92c47114d483fc27145","observation_id":"5b8c6a90-b403-45be-91b9-c5ad4371ff17","resolution":{"observed_at":"2026-08-07T13:16:15.893630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.545032Z","title":"Efficientvit: Multi-scale linear attention for high-resolution dense prediction, 2024","venue":null,"work_id":"cdfa30d2-3534-42d3-8fec-e126f4248dcf","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.986885Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:d6f12531932814db28e4433eea4f4e7b336db4a1ab5fad0413c47c3faca5dd43","observation_id":"67bd7ed7-129c-4f63-a0c9-86e7737876e3","resolution":{"observed_at":"2026-08-07T13:16:22.589340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.081109Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.081109Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:7fca79bceac594334b27271bc75bf63ac423968fd0e197e7601605ceb1dc6699","observation_id":"6d5f9850-9028-4703-a449-c41822ad9d5a","resolution":{"observed_at":"2026-08-07T13:16:16.081109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.172758Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.172758Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:52ce72ad0ce8671d630eb1b08ab958508e2a28295d804a5512029e59d4d926f3","observation_id":"63d68aac-c2fc-4035-8987-286191a8ca6c","resolution":{"observed_at":"2026-08-07T13:16:16.172758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.374590Z","title":"Statistical parametric speech synthesis, 2007","venue":null,"work_id":"f1b6480b-b959-4193-84e0-93c80d87053e","year":2007},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.265993Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:f7ef8e4dbd2a4a3d03d3556832f09be8bdf61a954cb866135606eb1382c46451","observation_id":"b9368db9-aa8b-432d-9efc-e8f9e1fadb3a","resolution":{"observed_at":"2026-08-07T13:16:22.444048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T13:16:16.366580Z","title":"Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.366580Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:898f4a2437aa780d11af2671420683c50cfc9b0ab299eaece64c461249b4cfd1","observation_id":"587953c3-962d-4b96-8ae5-507bfbef7791","resolution":{"observed_at":"2026-08-07T13:16:16.366580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.460073Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.460073Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:60f8d1f41ec1e1b4d080b76e7d1cffe4d77915e69cd2d7d86273cf45e8faa80f","observation_id":"f2543d06-48ff-44c9-b707-fe77133774a3","resolution":{"observed_at":"2026-08-07T13:16:16.460073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.195849Z","title":"Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":"82ad1b35-deea-48a8-9f85-3eabbda6466d","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.534619Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:cab291c32745d1fc4b4b0d6f87386d71cef7428fabfbfeae18dc275a360f54e3","observation_id":"6dd4fbcc-2fb6-41c2-ae42-37249840015a","resolution":{"observed_at":"2026-08-07T13:16:22.263871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.906549Z","title":"High fidelity neural audio compression, 2022","venue":null,"work_id":"f2aa15a4-b00a-475a-a89a-7c5ed04e746a","year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.619063Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:74334d496cf796e556545ad5941dd73ea0d85b9025b6e707de09c8ffe9a8d6c5","observation_id":"6e5baced-7c4b-4e37-96f8-8f2d22c21b12","resolution":{"observed_at":"2026-08-07T13:16:22.059052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.692789Z","title":"Large- scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"5f4718db-5171-4746-a34a-4ae8368af29f","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.749152Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1d710fd3c4dba9d1544403dff58d1315c236b21bbc0558d68585efca242133be","observation_id":"b38abdfa-eddb-436a-96b3-1811361198a5","resolution":{"observed_at":"2026-08-07T13:16:21.790631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.842940Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.842940Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:f79bc273885b58a06e3245d7bf9fa1bc2ee8889d8945d43aca99e52f1a975939","observation_id":"a5bbe826-79cd-46da-9e6c-766a694cd5b4","resolution":{"observed_at":"2026-08-07T13:16:16.842940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.936678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.936678Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:efb7127fa4cf1023ab2b9a5582151e732466deb47c35b67b4455944e8eda1023","observation_id":"0a48cfb5-87c1-4360-94a0-4a48302fc962","resolution":{"observed_at":"2026-08-07T13:16:16.936678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.004006Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.004006Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:c786b482079914bd65df123f6d89efacaa94edfea8ba0602763fcb4f85da6af6","observation_id":"55040861-a98a-43d6-87d5-39e4c0d1eed6","resolution":{"observed_at":"2026-08-07T13:16:17.004006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.092132Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.092132Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:319ae5a82d455787f88f727a5bb81b49b62fabab58c2edac5d09c867761cb3f4","observation_id":"40dc43ad-6a7c-4351-b11e-9b8bd383284b","resolution":{"observed_at":"2026-08-07T13:16:17.092132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.167427Z","title":"U-net: Convolutional networks for biomedical image segmentation, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.167427Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:c0522ed1407d3bb88444374c2849bc6f4bb363cf3ead35bb299748874c805117","observation_id":"f2465be3-9e95-4ce1-8488-3cc5f589b692","resolution":{"observed_at":"2026-08-07T13:16:17.167427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.253728Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.253728Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:23dea959a01e539029306acbb3e4aba4be973be74e9b926ccc91574ed6cbecc7","observation_id":"6b2dcfad-8129-4fce-96a4-18d49de674f5","resolution":{"observed_at":"2026-08-07T13:16:17.253728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T13:16:17.352668Z","title":"Qwen2.5-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.352668Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:6412a8d883543f7a7bb9359a50557bc36c32423af5390cafbe889e2a13413386","observation_id":"62638e80-0a3d-4f37-8f4c-bc087b8beeee","resolution":{"observed_at":"2026-08-07T13:16:17.352668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.424130Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.424130Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:545fc3b4f247afd8456a639e1b1be84cf68c2f92097cd376d6dfb962afd9fab0","observation_id":"a724f43c-4e91-4834-95d8-45eda269d2b9","resolution":{"observed_at":"2026-08-07T13:16:17.424130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.483154Z","title":"ekzhu/datasketch: v1.6.5, May 2024","venue":null,"work_id":"c915e46a-72c4-4782-b574-7ebe9e6c5a3c","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.512771Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a65b358062c56231977f640614176cc21e1340c4026dcb0425100fb105bb9c76","observation_id":"bfc12106-f8f9-4142-96a3-2b41058488de","resolution":{"observed_at":"2026-08-07T13:16:21.578319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.292109Z","title":"Byt5 model for massively multilingual grapheme-to-phoneme conversion","venue":null,"work_id":"008a4d55-0a2f-4bb7-9c5a-644b417fa9b6","year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.590060Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:d2c973b0139bdfe6d6eedac973139181002e1652c510824a9b1120af50c32d72","observation_id":"35c29adf-ab98-49a5-b5b2-aa40a98aee3c","resolution":{"observed_at":"2026-08-07T13:16:21.373421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.051758Z","title":"All-in-one metrical and functional structure analysis with neighborhood attentions on demixed audio","venue":null,"work_id":"0d861838-54d7-4df2-be71-a51efef6acbe","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.671225Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:3abfc1c6bcf868683e2724bf5c6dee54e75ca9e55b383fcda6dbd08f5f61a348","observation_id":"b98c5d1f-f36e-4a92-99c6-a50be36cd851","resolution":{"observed_at":"2026-08-07T13:16:21.189976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.868433Z","title":"Beat this! accurate beat tracking without DBN postpro- cessing","venue":null,"work_id":"1d175490-3b64-4294-8de8-adb6c8e8ff9c","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.799489Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:adcb37f57b2fdd45bf6a66b1497bc4b90b419ce853e690d1221b8726e37564b8","observation_id":"68373a3d-a027-485c-9967-8950194a1811","resolution":{"observed_at":"2026-08-07T13:16:20.948160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.679109Z","title":"Essentia: An audio analysis library for music information retrieval","venue":null,"work_id":"5a825bde-511a-464c-8974-9d1d3ccc005e","year":2013},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.920550Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:03d6924f5bbfc1d8129714569f647ced9d5194c5b3550d3729ed5c006a370fcc","observation_id":"cbdea552-a5c0-4afe-81ec-8c671937469c","resolution":{"observed_at":"2026-08-07T13:16:20.776114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.517725Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model, 2024","venue":null,"work_id":"30a2e3ef-ec5e-4873-99d8-bf9df6553d08","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.015834Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:94d915f1de9942edf72770e8b4e01230406622a193deaa8c3501a45784dfa7a1","observation_id":"711bf726-379a-44c7-a7b0-2038a34f9ceb","resolution":{"observed_at":"2026-08-07T13:16:20.580518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.358649Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis, 2024","venue":null,"work_id":"2e0d77f5-639c-4169-8a6e-877d7f3932f4","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.106129Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:043428a38538e92c575e652f48a472f2b4024cd22db4a6f1643cd40a0c8bc286","observation_id":"876fc305-bd3e-4431-9b59-e4b551bf33c4","resolution":{"observed_at":"2026-08-07T13:16:20.426135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.231538Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.231538Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:0eb0b36123c230b108433a26023554687752ab5ed1a90cd6f3f3989346b19e4e","observation_id":"e626520f-3c7f-4b8d-88fa-fefb94a03737","resolution":{"observed_at":"2026-08-07T13:16:18.231538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.212658Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining, 2023","venue":null,"work_id":"a47136f8-68b7-4b02-b0b9-beff90794d9c","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.345992Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:6c4649e28e091961c33d4d18f25b03fd4abd946498279fac8120ed55adba9e7a","observation_id":"9879f042-94ca-47cf-899d-307e3e426a08","resolution":{"observed_at":"2026-08-07T13:16:20.277393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.066102Z","title":"Learning diverse features with part-level resolution for person re-identification, 2020","venue":null,"work_id":"decfc4bd-b1be-41e9-82fb-ffe504ef4c26","year":2020},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.495011Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:f4b693c613282949ec7300414b07d78d8a41e3517c5034b3d84df76fbbd017e1","observation_id":"3f70d972-b2da-4ae0-9ce9-9a8f7eae6228","resolution":{"observed_at":"2026-08-07T13:16:20.133842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.572288Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.572288Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:0069ec41df9e4265f25500cb3ad1058c9491af7be979653233bcee028ec82d1f","observation_id":"4ef08c98-252d-4b9d-8399-48c7620debb5","resolution":{"observed_at":"2026-08-07T13:16:18.572288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.870577Z","title":"Adapting frechet audio distance for generative music evaluation","venue":null,"work_id":"36719dc8-3b73-409c-ad5a-852a8ed273b8","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.701310Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:8599d6fd4e5ab447c375236ed5b629157a615f0db3dfadfce68b12c552b7914d","observation_id":"9e9a9e3c-20c2-44da-b4ca-9d0df6151958","resolution":{"observed_at":"2026-08-07T13:16:19.979871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.684944Z","title":"Stable Audio Metrics, 2024","venue":null,"work_id":"79cb31d0-0cdf-41e5-bf5a-4ed3f08c0dad","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.830656Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:2aa2c430a317f8abc866d6aafdf77ebcc718a68f6e82d91cfffcf5d5e93072d1","observation_id":"837ce3fc-4811-4b2a-81eb-be22b0b2d8ac","resolution":{"observed_at":"2026-08-07T13:16:19.788623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-02T14:58:36.177043Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-07T13:16:18.929184Z","title":"Muq: Self-supervised music representation learning with mel residual vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.929184Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1d4f8ff2855aa15c409c186d37150cd04dc94f532e3a1af4d5a42de867dd0029","observation_id":"a56da72c-0086-41a0-85d5-db3e88f850a4","resolution":{"observed_at":"2026-08-07T13:16:18.929184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.515208Z","title":"stable-ts: Stabilizing Timestamps for Whisper, 2024","venue":null,"work_id":"691b2f0d-f95f-42de-bb0c-ec1d3240a9c5","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.996979Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:0a95d7b9944a49607a83b11523851d038d871ec66417e37fa273f8baa619c589","observation_id":"f76fba90-df7f-43ae-af5a-a196407df3fe","resolution":{"observed_at":"2026-08-07T13:16:19.581782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10793","last_updated":"2025-05-16T02:06:25Z","snapshot_observed_at":"2026-08-07T15:44:52.238308Z","submitted_at":"2025-05-16T02:06:25Z","title":"SongEval: A Benchmark Dataset for Song Aesthetics Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10793","snapshot_observed_at":"2026-08-07T13:16:19.098611Z","title":"Songeval: A benchmark dataset for song aesthetics evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:19.098611Z"},"links":{"cited_paper":"/paper/2505.10793","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:cefe3fe2728518e6eac1423eb3b08596cd5f28e8c321448e6405e662c09013e1","observation_id":"73391fcb-d9e8-4f78-a451-9e57ef435084","resolution":{"observed_at":"2026-08-07T13:16:19.098611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.207061Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:19.207061Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:8dd229599860b8f86c2a018f809363d30f16c9ebe0c7a2a292301cf593db6063","observation_id":"b5ccf2bb-3846-43b3-b876-238fa7d2be45","resolution":{"observed_at":"2026-08-07T13:16:19.207061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08629","last_updated":"2025-07-22T12:07:56Z","snapshot_observed_at":"2026-08-07T00:06:35.032642Z","submitted_at":"2024-12-11T18:50:29Z","title":"FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08629","snapshot_observed_at":"2026-08-07T13:16:19.338517Z","title":"Flowedit: Inversion-free text-based editing using pre-trained flow models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:19.338517Z"},"links":{"cited_paper":"/paper/2412.08629","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:cc52afc8352ec93b20adfaee087f630b036ff5f3869388670ac1b99bd12bdc94","observation_id":"1a7b8550-da2e-4817-86e1-545e4bad6098","resolution":{"observed_at":"2026-08-07T13:16:19.338517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 36 inbound Pith citation observations for arXiv:2506.00045."}