{"as_of":"2026-08-11T22:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fe0d206a3ac72e1fe14c62b45a400432334f00d388ebca1330b35f6ffa67ee9","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:59:13.413269Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.14680/citation-record","integrity":"/paper/2501.14680/integrity","json":"/paper/2501.14680/citation-record.json","paper":"/paper/2501.14680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.226462Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.226462Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:34c94e4d794363e4281f11e9786bfb6d495868490253a37313fc3a307994104a","observation_id":"566a6805-e497-41c4-86bf-0f81baf37c77","resolution":{"observed_at":"2026-08-10T14:59:13.226462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.231462Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.231462Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:1f27818c404d2f7bed0e123409c6a5fbd48c494ec20f1c8821cb6de466a6c990","observation_id":"ee1aee23-d93d-4c61-b40e-210b61353d5a","resolution":{"observed_at":"2026-08-10T14:59:13.231462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.945006Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"ec4a4173-547f-4b64-b5c3-6a6d2ffd2074","year":2022},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.237567Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:b3ff64face9b2d8f70a2bc849a3b805f7887bd3126d74f8b83973789f251eadf","observation_id":"966344f7-3780-459f-b958-da3755165e1f","resolution":{"observed_at":"2026-08-10T14:59:13.949050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.932547Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"77564854-b2b4-48b2-a6eb-f9dde495bd2a","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.243347Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:bc53a08f9c2150220544ab4f7e88f4e33cb6749f917fe9fbb3e0b66dea8d2006","observation_id":"ffb23d7d-3ea3-4714-b2d0-77e5973346b2","resolution":{"observed_at":"2026-08-10T14:59:13.937191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.919444Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"54d013d2-443b-4b08-95da-90270e82a7c3","year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.247862Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:47dedd5742ccd3480a84918b04db4aa603e0a4244fe03009848c8075a518414f","observation_id":"1ea920f5-f649-4d73-bd31-7294ce13535f","resolution":{"observed_at":"2026-08-10T14:59:13.924064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-10T07:59:31.427201Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-10T14:59:13.252059Z","title":"Fast timing- conditioned latent audio diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.252059Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:fd3dff0bd4c219f920a60591fab44c0742fb840084b5bd242ef0a3be363e24f0","observation_id":"f61aed68-8741-4be0-bd98-592b7aa181bc","resolution":{"observed_at":"2026-08-10T14:59:13.252059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.907115Z","title":"Grad- TTS: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":"ec70a632-1cb6-4a4f-93ca-5147f7a7083a","year":2021},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.257841Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:91fb2ecf6a2d69ae253c7134bcda7d2b1183bee3bfc8bba36c36b6484c5ee159","observation_id":"47cf95b6-e3a7-4277-abf1-539d7ff7656c","resolution":{"observed_at":"2026-08-10T14:59:13.910987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.894022Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"75c137f0-c16f-4ae3-ac08-4d840862cdd7","year":2021},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.261630Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:d6bf4216a239900b9abdde216ecf2ed5afd8dfddcb801737049d6f0a3b64ba48","observation_id":"283bd3a9-de8c-4763-b624-c8fe25a07278","resolution":{"observed_at":"2026-08-10T14:59:13.898448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.881564Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"b0a7aab4-b20a-4ed0-87d4-408a62c4542f","year":2019},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.265355Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:413885d08bea44133b427be162387208f2e6a2def6122eac876acf4f15808dcf","observation_id":"5e8729c8-8429-4fc4-99da-92bfcde07589","resolution":{"observed_at":"2026-08-10T14:59:13.885498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.868606Z","title":"MuLan: A joint embedding of music audio and natural language,","venue":null,"work_id":"4f2bc85c-314a-4e9f-a08c-d629382b9f09","year":2022},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.268900Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:0b755eaa2d9eb36673014e4ad330a5eb254a946ddd9218e344517050ddfd712d","observation_id":"3160c0eb-c05e-459a-b0fa-8ec633876133","resolution":{"observed_at":"2026-08-10T14:59:13.873273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.856538Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"3723867c-ea7a-480c-b7b1-63b51e384b7c","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.272842Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:4b9e5d653ce65f10f05238d5d88ba94220513c58df0c7ea4728fe2e3a063116a","observation_id":"902b2cc3-17b9-4d6d-9cde-b8918855bf36","resolution":{"observed_at":"2026-08-10T14:59:13.860511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.276656Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.276656Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:beed8b15f50c96396df49e0615b036a66f78ad8ff3cc8da5f0a008196370db6c","observation_id":"0776d894-663a-481a-8e79-878116b01567","resolution":{"observed_at":"2026-08-10T14:59:13.276656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-10T14:59:13.280766Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.280766Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:139193aa7d84d47c12ffda38878522a3a7f5e160073c1c5e1284761dd2edc403","observation_id":"f5aad878-1222-40dc-8dce-9ece449697d7","resolution":{"observed_at":"2026-08-10T14:59:13.280766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.836956Z","title":"Audio-Text models do not yet leverage natural language,","venue":null,"work_id":"fc90fd27-9b33-4c7d-9c80-7ea23ca8e908","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.285632Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:03d0997264df2e0fdd6e5c0b348cd44a3960811f79041138490ee12a8baf8e23","observation_id":"929e3b7e-73e3-4564-82bb-5f0724e54828","resolution":{"observed_at":"2026-08-10T14:59:13.841488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.823614Z","title":"Simple and controllable music generation,","venue":null,"work_id":"871d6c1e-2ef0-4df7-baa5-498358d8c09a","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.290069Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:ad9d76acd923f31813dced589c9a500a2001ea263beaf517f491411341858ae7","observation_id":"f197e251-1377-44db-9ba4-6107f6aa9036","resolution":{"observed_at":"2026-08-10T14:59:13.828233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17806","last_updated":"2024-04-27T07:05:48Z","snapshot_observed_at":"2026-07-06T18:06:24.289614Z","submitted_at":"2024-04-27T07:05:48Z","title":"T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17806","snapshot_observed_at":"2026-08-10T14:59:13.293802Z","title":"T-CLAP: Temporal-enhanced contrastive language-audio pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.293802Z"},"links":{"cited_paper":"/paper/2404.17806","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:366aefa8dccfe57b7cd97edcdd49c063852a45002b9c248fe9872702b973f7f5","observation_id":"3fcc17df-b228-41c0-95d1-6a3e309169d7","resolution":{"observed_at":"2026-08-10T14:59:13.293802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-10T14:59:13.299055Z","title":"eDiff-I: Text-to-image diffusion models with an ensemble of expert denoisers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.299055Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:12dae841582a2caa1c873e36b4b433140a859eeaa45212a99763c22a9c218265","observation_id":"acd9d5b1-9e68-4c48-9885-16227857af87","resolution":{"observed_at":"2026-08-10T14:59:13.299055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-09T15:48:23.364963Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-10T14:59:13.303276Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.303276Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:de780cf57cde46e66e28a4625d495e60b6285a0097de6405f479f8275bbeaccd","observation_id":"7f63d4d4-9f04-49f0-a456-e3488eb8d161","resolution":{"observed_at":"2026-08-10T14:59:13.303276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.811056Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":"9bdc3c28-3680-49fb-a2ec-79602f808fc6","year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.308605Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:3396481482223d2bf81287852dc508a69142830514214f5157756996342e9cf4","observation_id":"35c20cb4-a0b8-49c4-906f-ee4c6615b9af","resolution":{"observed_at":"2026-08-10T14:59:13.815112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.799320Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"c227cc65-ba3e-4b44-b29e-e88127afc02f","year":2020},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.312383Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:c09cd79f7aa0716142e3ec3f9d8b051a18c223d415dc62f2fe181327bc68b739","observation_id":"cb11ae3a-d7c1-49ff-8c19-59fd83b599cf","resolution":{"observed_at":"2026-08-10T14:59:13.803876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.787742Z","title":"Sentence-T5: Scalable sentence encoders from pre-trained text-to-text models,","venue":null,"work_id":"b083240b-497c-4a09-9516-8a3ef985ac3d","year":2022},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.316545Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:85a33b0854a3156c5e7740adc17639f53ddba3ea4a7b480a5aa1458029283356","observation_id":"74a009b1-1e61-42d2-be28-81a8aa34ae0e","resolution":{"observed_at":"2026-08-10T14:59:13.791721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T14:59:13.321116Z","title":"RoBERTa: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.321116Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:16eab062262e440b36ce3219f593c1b701895a5860b1bb2e407d52c71269382b","observation_id":"b914bd54-6e1c-478d-b1ce-7810777e15b3","resolution":{"observed_at":"2026-08-10T14:59:13.321116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15316","last_updated":"2021-03-29T03:51:53Z","snapshot_observed_at":"2026-08-09T13:21:21.641559Z","submitted_at":"2021-03-29T03:51:53Z","title":"Whitening Sentence Representations for Better Semantics and Faster Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15316","snapshot_observed_at":"2026-08-10T14:59:13.325103Z","title":"Whitening sentence representations for better semantics and faster retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.325103Z"},"links":{"cited_paper":"/paper/2103.15316","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:8f5137c7c2d4563573d7da4a6a86daa0ca75fc65ce1e605f93825cb67b89edbf","observation_id":"0f89a955-997d-46cd-bcd9-db00163ef125","resolution":{"observed_at":"2026-08-10T14:59:13.325103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.776461Z","title":"On the sentence embeddings from pre-trained language models,","venue":null,"work_id":"8cc408a9-a0eb-403a-9bab-b777a10b9032","year":2020},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.329613Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:72187a678f478e4df79ffa1f9bc9587291e19e5d5158e5705873c1955bfdd4f8","observation_id":"2ae17606-0a6b-4b87-96a7-2d04485d714e","resolution":{"observed_at":"2026-08-10T14:59:13.780308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.764797Z","title":"SimCSE: Simple contrastive learning of sentence embeddings,","venue":null,"work_id":"67ef3fc6-58ff-4a7c-96fc-01bcf340ab31","year":2021},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.333615Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:c650fddb6b8ad228f2b7d2859b5b1c31909cc8e98e9640949f7195d62252ae61","observation_id":"a221d86c-6487-4f1a-832e-9caeea2f7ffa","resolution":{"observed_at":"2026-08-10T14:59:13.768717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.753343Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"992e26b7-1472-49a7-863f-4ff19a80cba7","year":2017},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.338536Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:6d377b9f8a854cd997e1b337512433255009f1020fe753edfdc2763bde1cf0e1","observation_id":"860d36a4-6d5d-4059-815f-5ddf185f3a97","resolution":{"observed_at":"2026-08-10T14:59:13.757072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.741864Z","title":"Self-attention encoding and pooling for speaker recognition,","venue":null,"work_id":"876b7867-c870-43dc-835b-65144cdb1b52","year":2020},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.342375Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:270dcc15c27bfd2627ff893f85168e44754507dfe9533a06b041a836f8146e22","observation_id":"758ceddd-7816-45e9-81a8-96cb144ecea3","resolution":{"observed_at":"2026-08-10T14:59:13.746245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-09T18:51:51.917654Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-10T14:59:13.346143Z","title":"Progressive distillation for fast sampling of diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.346143Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:b36f0b11d10cc230cbb7ddd6b21da0ef428e1d1cedb200adb553a575662a8973","observation_id":"3a3d6c11-7b22-4857-afc5-00bc06521ecc","resolution":{"observed_at":"2026-08-10T14:59:13.346143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.729414Z","title":"Variational diffusion models,","venue":null,"work_id":"acc81e2a-cd9f-4798-8f4a-eeed897f7b63","year":2021},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.350325Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:1c1897d6133bfc3ad46e7eba37e742ec10a573087c9a6b955c32e753d5f5a012","observation_id":"11db5f13-3cbd-4732-b402-6d7f233250eb","resolution":{"observed_at":"2026-08-10T14:59:13.733767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T14:59:13.354010Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.354010Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:b5b479d4f0d30c57095eb8b1ec3d32f4cafba8301f7d10eca999174d2250c7d7","observation_id":"9af5f36e-2048-4843-9127-d4deb2529023","resolution":{"observed_at":"2026-08-10T14:59:13.354010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.718012Z","title":"The MTG-Jamendo dataset for automatic music tagging,","venue":null,"work_id":"c2c81aea-4fee-4369-b914-f3223562ed21","year":2019},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.357952Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:bcad8497604d73c6426805ff7b25dddff9cb548cfc825d644b01e6d6e474832e","observation_id":"e3d21dee-0e18-4b06-a7ba-4f6e64ec2b5c","resolution":{"observed_at":"2026-08-10T14:59:13.721866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.705440Z","title":"FMA: A dataset for music analysis,","venue":null,"work_id":"7329adef-c42d-4d8c-8eaf-4331488d02af","year":2016},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.361577Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:217d88b7fa74c29c4fb7db42ac9eb587afb362ed95a67a2fe2fff5707394726c","observation_id":"5a6eb880-7b8b-4f2d-8ef6-148e5ad6c50c","resolution":{"observed_at":"2026-08-10T14:59:13.710277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.692040Z","title":null,"venue":null,"work_id":"72910e8c-ea4d-4117-94b1-8e994edfdf53","year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.365285Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:11970f55dad3874748481cb1374ec80bd1402d4046dd573c7cdbaf18428899a0","observation_id":"d3f9f4c4-3504-4c0a-93fa-6e0bed2dce2f","resolution":{"observed_at":"2026-08-10T14:59:13.696574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.680252Z","title":"Hybrid transformers for music source separation,","venue":null,"work_id":"427d1e3b-df16-48e2-9d8d-8bc0ccfc6cdf","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.368689Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:cd29a1b31126bcc5ca22320810f51a102b79680847db7de80c1c4de7896261b2","observation_id":"0e4b77eb-f779-4c16-bbab-3acac67ab291","resolution":{"observed_at":"2026-08-10T14:59:13.684095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.667859Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":"942ad971-8bb2-4463-971b-3b159d83d9c0","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.372334Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:eaccfc4471d0654b4ea3f1dcd2f835310a3ce6625c7907e0586c371c3dc32f9a","observation_id":"ae4fa1a8-10e2-45e4-818b-2323d5a6c4e8","resolution":{"observed_at":"2026-08-10T14:59:13.671617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.656535Z","title":"AudioLDM training, finetuning, inference and evaluation","venue":null,"work_id":"2e64ca54-c63b-4507-9436-10e5813b33c5","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.376244Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:e5eb5b60635530f4194f5179bddf2d9b07e0231301774bf37566c86ef267e2da","observation_id":"02fd6909-8ce7-4ff8-9d79-a7315916f4e4","resolution":{"observed_at":"2026-08-10T14:59:13.660452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.645315Z","title":"LAION-AI/CLAP","venue":null,"work_id":"59a16030-6a12-42da-95d5-63dbe27c76f1","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.379968Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:3b264d05a6e549d43093b6fd0bc633e8a185499a0203db63bcae1569b93b825a","observation_id":"0b17c31f-fd4c-4ddc-abc1-1d2f4979e6de","resolution":{"observed_at":"2026-08-10T14:59:13.648992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.383522Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.383522Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:38775ae3fc64cf734487dce90e4ce3d9907b12c25cb53ea0d27de34526b7f24d","observation_id":"2dc6ea61-dc3e-47dd-9904-901eb5c6d0d8","resolution":{"observed_at":"2026-08-10T14:59:13.383522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.387181Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.387181Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:c5a689a0e745d4141242907265c11fbb72e6c7cd88539b7c358519204e55860d","observation_id":"f46d9230-614a-4a67-887b-75909a96cc60","resolution":{"observed_at":"2026-08-10T14:59:13.387181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.618017Z","title":"MusicLDM: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies,","venue":null,"work_id":"e3f42e73-dd62-4a64-a969-6f4989a8daf6","year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.390565Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:437e9c73bd712ee91d190a503b17a84ded2e6245da536920a81a2060784aa295","observation_id":"255e0e09-02aa-4f52-b371-69376eddd4de","resolution":{"observed_at":"2026-08-10T14:59:13.622726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-10T14:59:13.394342Z","title":"Stable Audio Open,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.394342Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:f38617ba88f8c4bbf65f3b861ee8f15b6090fae420693718c226fa1a6b3a62a4","observation_id":"16834dba-2422-4e04-a209-04fab56c8001","resolution":{"observed_at":"2026-08-10T14:59:13.394342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.604867Z","title":"Fr ´echet audio distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":"a7dd27ee-4022-431f-b972-f3deceeefa7c","year":2019},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.398451Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:ad13d552031f711e5b558994220e0a64a1592115fdb224121bb7d297e71d84ff","observation_id":"b2deda01-6e87-4709-9ca8-374ec85eb6cc","resolution":{"observed_at":"2026-08-10T14:59:13.609315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.593443Z","title":"Audio generation evaluation","venue":null,"work_id":"55852d90-de5d-46f9-9d73-49ce67b56c32","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.402113Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:34fb2ac4aa7dfebaac33d8f6f6625ed6b6f776b2e33cada0e73eb7bba8916612","observation_id":"ce8ed845-9eb0-4e2a-a345-f59323737667","resolution":{"observed_at":"2026-08-10T14:59:13.597342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.580681Z","title":"CNN architectures for large-scale audio classification,","venue":null,"work_id":"ab1b1844-df8d-4248-b09b-acf8f08e55b3","year":2017},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.405811Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:b11e1a40c1095d290ac6aad843fa38760c481fba078acafef00fa1a8b616cf09","observation_id":"727c1c7e-0988-4d59-8e07-eedfc6b08e08","resolution":{"observed_at":"2026-08-10T14:59:13.584621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.568673Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"e51d205a-4f77-4162-afa0-60c9b94b5d15","year":2019},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.409490Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:344cab5aae3b11423caa7600f82e9b25cbbd7ee1e5a78760394a6fddd1b8730a","observation_id":"95c438e2-aca3-4bc5-aecc-dbf2e809f8c4","resolution":{"observed_at":"2026-08-10T14:59:13.572898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:59:13.554493Z","title":"CoLLAT: On adding fine-grained audio understanding to language models using token-level locked-language tuning,","venue":null,"work_id":"68c843dc-b791-41ee-b5cc-b9da2cd1fd42","year":2023},"citing_paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:59:13.413269Z"},"links":{"citing_paper":"/paper/2501.14680"},"observation_digest":"sha256:df28598f2d532490878b614c719c645267296d31a57dac6a58f0a6918fa78188","observation_id":"e4f311e3-c33e-4515-bc6c-705ae7dd259a","resolution":{"observed_at":"2026-08-10T14:59:13.560633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.14680","last_updated":"2025-01-27T10:41:29Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T20:31:57.651297Z","submitted_at":"2025-01-24T17:57:47Z","title":"Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2501.14680."}