{"as_of":"2026-08-23T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53615804d3c4a6754e373a325c19a00b2e9fdc8d9ecdd90e73345b9689af9d1d","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:04:34.985831Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:04:34.724104Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T22:00:21.482883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17886","snapshot_observed_at":"2026-08-15T19:04:34.724104Z","title":"I would like this retrieval result to be punchier","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.724104Z"},"links":{"cited_paper":"/paper/2506.17886","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:12dfff0c458a0285e676847083f6371012bba5094f311e8c1f9ae9b975ed939b","observation_id":"ed0920a8-c9d3-47c0-a97d-6fc1c8cfe3ae","resolution":{"observed_at":"2026-08-15T19:04:34.724104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.17886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gd-retriever: Controllable generative text-music retrieval with diffusion models","venue":null,"work_id":"56248316-3fc0-48dd-8765-7e9527a9dbb0","year":2025},"citing_paper":{"arxiv_id":"2602.15423","last_updated":"2026-04-21T07:53:41Z","snapshot_observed_at":"2026-08-11T14:02:44.577700Z","submitted_at":"2026-02-17T08:35:11Z","title":"GaiaFlow: Semantic-Guided Diffusion Tuning for Carbon-Frugal Search","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T21:58:04.706427Z"},"links":{"cited_paper":"/paper/2506.17886","citing_paper":"/paper/2602.15423"},"observation_digest":"sha256:221f83a865a999628bb228e461632de19ccbddae07adaad9fc3cd9ce5f5f2aff","observation_id":"9cf8b871-6fd0-4e2e-8c24-35d7165480c1","resolution":{"observed_at":"2026-05-15T22:00:21.488761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17886/citation-record","integrity":"/paper/2506.17886/integrity","json":"/paper/2506.17886/citation-record.json","paper":"/paper/2506.17886"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17886","snapshot_observed_at":"2026-08-15T19:04:34.724104Z","title":"I would like this retrieval result to be punchier","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.724104Z"},"links":{"cited_paper":"/paper/2506.17886","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:12dfff0c458a0285e676847083f6371012bba5094f311e8c1f9ae9b975ed939b","observation_id":"ed0920a8-c9d3-47c0-a97d-6fc1c8cfe3ae","resolution":{"observed_at":"2026-08-15T19:04:34.724104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.789119Z","title":null,"venue":null,"work_id":"fb8df540-8b9d-4791-afda-5efe13c12891","year":null},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.729308Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:f3838d6984babccd95a95f095c4dc85da3e4d2cfd097c8ff5d4e7e920355bf87","observation_id":"cedf3215-e059-48bf-9fd1-408b8bdae032","resolution":{"observed_at":"2026-08-15T19:04:35.793177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.777182Z","title":"Using a pretrained latent space op- timized for audio-audio retrieval, we train a generative dif- fusion model conditioned on text to generate audio latent embeddings in this space","venue":null,"work_id":"71e36dee-ff1d-4e78-a86b-b9404196e6d3","year":null},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.733508Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:787fc69dd05da302223b1471af5addd309f3d32c417b7b9e3b9b8e7d0f3fe422","observation_id":"5abc4c99-22ab-4541-9072-8478ddd18aa9","resolution":{"observed_at":"2026-08-15T19:04:35.781111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.766100Z","title":"a rock song","venue":null,"work_id":"17e3c376-5c47-4592-b0f7-85aa82806ee2","year":null},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.737920Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:4a443ea1eb234b2607e2e9e4c6fd6c524d211e6f5137176a5455dc0c49560d75","observation_id":"4d67e298-f182-4e44-bbe9-c90d04f5f515","resolution":{"observed_at":"2026-08-15T19:04:35.769795Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.743349Z","title":null,"venue":null,"work_id":"40dcf076-db24-4612-8d8b-1881db52afa4","year":null},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.747172Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:4c6ad74bc33202d7717acd1fbc4ef352c66fd4bddccc258c7ee60943f0efaaae","observation_id":"abba59fc-91eb-4551-9ad2-0daff3eacbec","resolution":{"observed_at":"2026-08-15T19:04:35.747063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.754777Z","title":"does not mean","venue":null,"work_id":"635823d7-12bc-4b19-b54e-685a660924e4","year":null},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.742870Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:f94dd94d095d8c09ce9d171fa34b061975224d8f385c2ea2d004f503c94a9f6a","observation_id":"6f8aa8cf-5252-435b-8bd6-a0bed5a93190","resolution":{"observed_at":"2026-08-15T19:04:35.758579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:34.751255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.751255Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:de2817b59dc44c9f056027eec2fc097dcacd37c0e1e4656c0a8fb77615dfd3d9","observation_id":"e6af7531-07be-4682-9b72-cab8a855f905","resolution":{"observed_at":"2026-08-15T19:04:34.751255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.724841Z","title":"Contrastive audio-language learning for music,","venue":null,"work_id":"d0149955-c3e8-4d7a-bc4d-89ce1b85abe4","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.755496Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:080b4f7a086e13b361a04b9d015357f05e13265ab0eb5eae6c2c7c87d6969175","observation_id":"783d38eb-a68b-43e7-b466-f877f07707da","resolution":{"observed_at":"2026-08-15T19:04:35.729164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.713192Z","title":"Mulan: A joint em- bedding of music audio and natural language,","venue":null,"work_id":"bbdb7568-0ef7-45eb-b3fd-32b4a6342c37","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.759497Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:fcdc3afaf2496b5b0ade20e741c2a780611513f0d1fbd945393ba977c0a20682","observation_id":"3be2fcb2-89a8-4eb7-8f96-117f30c219ed","resolution":{"observed_at":"2026-08-15T19:04:35.717231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.700820Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"76881e63-63f0-4d10-b3e3-28b44004869f","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.763241Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:aafa28b786b12381d8513eb975432a2dd5ea3989bbb55f83876f00d728f26af8","observation_id":"1750edf8-a126-4b4f-b69b-f7c43db5410c","resolution":{"observed_at":"2026-08-15T19:04:35.705112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.688575Z","title":"Collap: Contrastive long-form language-audio pretraining with musical temporal structure augmentation,","venue":null,"work_id":"8a9eaae6-e441-4ad9-811b-43076b1d64f8","year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.767786Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:8b18584c74dd32f06c994d0fd1c3495ea12641928b9089b65e4b905dab40549b","observation_id":"131abbe4-db9a-4324-bed0-9510b723969a","resolution":{"observed_at":"2026-08-15T19:04:35.692681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.676840Z","title":"Clap learning audio concepts from natural language supervi- sion,","venue":null,"work_id":"2fa55252-ad85-4b22-b6dd-593b36dbe8ba","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.772208Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:e7178d872b9e773e2a127c82b832824c094c69a5a8d33d097f638dd67dc6179e","observation_id":"d99bd70a-65c2-4448-8403-760e7fa479d1","resolution":{"observed_at":"2026-08-15T19:04:35.680699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:34.776734Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.776734Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:221daaaa0eae670aa7627f6e3e706286e2b9b565f12c344bba9c83d06f3b032d","observation_id":"b2bd12bd-c2b2-4138-87fb-2b0671e685b7","resolution":{"observed_at":"2026-08-15T19:04:34.776734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.658127Z","title":"AudioLDM: Text- to-audio generation with latent diffusion models,","venue":null,"work_id":"d925af62-192d-4854-929d-0845a5291b74","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.780501Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:a4cffae7a89664e58248f90be9284cf43c21f1d50fd5035c245624e8d84588a7","observation_id":"3cd4ff71-896a-4e43-af3b-b05b60d65d5c","resolution":{"observed_at":"2026-08-15T19:04:35.661843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.647230Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretrain- ing,","venue":null,"work_id":"35e31313-dca1-4f83-a482-0a632d89ef85","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.784453Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:bd4dd4881b94354a19665ba35508d1c7dfce34e8d379d29a236011fe514aa54e","observation_id":"33e189d6-8557-48ac-91b9-4c0d8bfbedb1","resolution":{"observed_at":"2026-08-15T19:04:35.651020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01546","last_updated":"2023-08-03T05:35:37Z","snapshot_observed_at":"2026-08-16T15:11:09.659487Z","submitted_at":"2023-08-03T05:35:37Z","title":"MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01546","snapshot_observed_at":"2026-08-15T19:04:34.788182Z","title":"Musicldm: En- hancing novelty in text-to-music generation using beat-synchronous mixup strategies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.788182Z"},"links":{"cited_paper":"/paper/2308.01546","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:857be9b05c901b312b56e6d278c5d2afdbf5f00ea9778cb3b973fbaaf7dc1f2b","observation_id":"ed749373-da6f-4a8c-9420-d5ebff72d5c0","resolution":{"observed_at":"2026-08-15T19:04:34.788182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.635596Z","title":"Music con- trolnet: Multiple time-varying controls for music gen- eration,","venue":null,"work_id":"f99a7ab3-bb63-43d3-8d0f-cb3f589d0410","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.792073Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:4563b10efd1b252543fb0a410a7a19e2e7703692c7821b86bfa96a7f02eed421","observation_id":"39e0218a-2ad5-4e8b-9e36-bee4ec1cd302","resolution":{"observed_at":"2026-08-15T19:04:35.640438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.624772Z","title":"Text-to- audio generation using instruction guided latent diffu- sion model,","venue":null,"work_id":"54c782df-91f1-42cc-8256-cb4adcba53a7","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.795807Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:09d4fa765c1424f5f4e562d0ba01bd911ea73f3ea46d1f52e91783b402e87c2d","observation_id":"caf6794e-518b-4bad-9b86-efb31fd5377d","resolution":{"observed_at":"2026-08-15T19:04:35.628563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.613078Z","title":"Diff-a-riff: Musical accompaniment co-creation via latent diffu- sion models,","venue":null,"work_id":"ecf26e74-36d5-42ba-a59f-a79b61cef723","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.799474Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:6001ec0361a5bec38402de1a16818f4dd35f7df0005d58a0174f0aa43826c1bd","observation_id":"c0857d57-fbfd-427a-a6b5-c940aeeef7db","resolution":{"observed_at":"2026-08-15T19:04:35.617241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.601087Z","title":"Ditto: diffusion inference-time t-optimization for mu- sic generation,","venue":null,"work_id":"79a696ce-9bc5-4cb5-bdd0-dcd13d36837c","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.803544Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:9ca5c6d97d8f1f2f59bf39256a141a2afb26e0dcd3b5d13a9e0cb254e5cf62f9","observation_id":"72324da7-483d-41ac-828a-c6367c1a5a2f","resolution":{"observed_at":"2026-08-15T19:04:35.605214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.588420Z","title":"Long-form mu- sic generation with latent diffusion,","venue":null,"work_id":"abe62d15-1270-4f9a-950b-bff0dcc789a7","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.807393Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:687dcf948ac2765e93b31de0f4166eb801275027909d88fdd48d88fd22656eef","observation_id":"81277619-1eed-4019-af56-a064c959082e","resolution":{"observed_at":"2026-08-15T19:04:35.593145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.576318Z","title":"Fast timing- conditioned latent audio diffusion,","venue":null,"work_id":"54a42905-1ddc-46ad-be33-448f59d0aba3","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.811170Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:470990fc2d40201d2ab32214c7a39a6a7bcf49abc8afeb2c4b5fe2879c3aa0f3","observation_id":"c0f21343-fca6-4ea1-a2e2-5c0728cbb755","resolution":{"observed_at":"2026-08-15T19:04:35.580645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-20T10:39:03.872570Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-15T19:04:34.814749Z","title":"An im- age is worth one word: Personalizing text-to-image generation using textual inversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.814749Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:381fdaf96cdde1a86c73d6f2776c82b6024eb17d7339d72c5488c9f3b8940672","observation_id":"a8752a35-85d6-4b5b-ada1-e9b2218d7938","resolution":{"observed_at":"2026-08-15T19:04:34.814749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.564514Z","title":"Null-text inversion for editing real images using guided diffusion models,","venue":null,"work_id":"67e37824-b88a-4c79-a469-0dfa1453a7da","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.818639Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:9fe37dfe6df2c1c236a883a6f88e6aa210fdb60e8b926c9c04118bc3a45c11d6","observation_id":"d492cbcd-5a8d-4ccb-848a-7001b9561939","resolution":{"observed_at":"2026-08-15T19:04:35.568602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.553539Z","title":"Dynamic prompt learning: Addressing cross-attention leakage for text- based image editing,","venue":null,"work_id":"029bb3cd-6f18-4516-ab09-0b6dc0037b1b","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.822340Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:8f1fa4e6f0e02050a3edd47bad4ce6e0574f6f019ea532af76abbc41246f0733","observation_id":"90181c40-35a6-485d-b6ff-d4d367efa5ac","resolution":{"observed_at":"2026-08-15T19:04:35.557569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17064","last_updated":"2025-03-14T11:33:08Z","snapshot_observed_at":"2026-08-16T14:06:33.779577Z","submitted_at":"2024-03-25T18:00:42Z","title":"Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17064","snapshot_observed_at":"2026-08-15T19:04:34.825771Z","title":"Con- tinuous, subject-specific attribute control in t2i mod- els by identifying semantic directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.825771Z"},"links":{"cited_paper":"/paper/2403.17064","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:f312df7870417a2c0a410cead0899fe034f59ffea912b0972fef2b43c20bfe1a","observation_id":"7c6b48a7-2097-4783-8212-ea42d6671e06","resolution":{"observed_at":"2026-08-15T19:04:34.825771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.543373Z","title":"Compositional in- version for stable diffusion models,","venue":null,"work_id":"d03c5be0-7ccb-4675-ac98-ae64bf0a2947","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.829422Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:a580fc6e54485744d84a2dbdc65ebb50d8ab07ebc6417e02f0fd419cea52b2f6","observation_id":"3a4e9d24-eeef-41c9-b370-034cc016bf9d","resolution":{"observed_at":"2026-08-15T19:04:35.547180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.533741Z","title":"Learn- ing transferable visual models from natural language supervision,","venue":null,"work_id":"a9908521-a091-43ea-885b-d69ab01a2c46","year":2021},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.833725Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:aa7d17ff2749b12195f1a5c02ae686d2677fbb7a2ac8d41b5b323ca7a37523c0","observation_id":"de5fa644-fc81-481c-bbb5-58c64c7c8bb8","resolution":{"observed_at":"2026-08-15T19:04:35.537188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.523550Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"81a6eea4-e3d1-4c24-9a44-e51adbb36326","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.837704Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:d61e41785ba10ad1828cbef7cb5ed5088683687ac1f058200fef906739c27f0f","observation_id":"aadb7bce-42e7-44c3-a84d-fe41170fecdc","resolution":{"observed_at":"2026-08-15T19:04:35.527054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.511691Z","title":"Improving fine- grained understanding in image-text pre-training,","venue":null,"work_id":"4648f322-0e2e-467e-b5bd-629b96777215","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.841097Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:168a200d32f2cea35e576495eb53e5ee073e704378cb3fd46953e8aa9f40292c","observation_id":"32ed8994-28c1-459d-84b9-b4e7bb584e19","resolution":{"observed_at":"2026-08-15T19:04:35.515271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.501161Z","title":"A simple framework for contrastive learning of visual represen- tations,","venue":null,"work_id":"6b7200a7-f00a-401f-a9bc-d834daed5c8b","year":2020},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.844695Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:3e8e994121d3777a22e8a031c980c4b3bbb0c0d7eb9b5e73cab64ebc22cb9e33","observation_id":"d3daaa15-e3e2-43eb-8e5c-f337cc98f713","resolution":{"observed_at":"2026-08-15T19:04:35.504818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.490963Z","title":"T-clap: Temporal- enhanced contrastive language-audio pretraining,","venue":null,"work_id":"91d980d7-be55-4851-babc-3f119c85f54a","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.848206Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:ff475dcef9b59a2c23f23cba3617b85c77789cdcae96f4ebea42293f0006410f","observation_id":"1fd7d533-778a-4161-8583-9c8dd7a8d009","resolution":{"observed_at":"2026-08-15T19:04:35.494856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.479845Z","title":"Augment, drop & swap: Improving diversity in llm captions for efficient music-text representation learning,","venue":null,"work_id":"933e1b57-a218-4c5c-b0ae-294be955578c","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.851695Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:d8bce6574b81906185514d10fc781c352158e1c994851d4afe812170cce81933","observation_id":"7e5b7515-5304-410e-949a-90a8706efc91","resolution":{"observed_at":"2026-08-15T19:04:35.483739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.468757Z","title":"Cacophony: An improved contrastive audio-text model,","venue":null,"work_id":"cd91a640-4b23-430a-ada0-2f7230e1f4f0","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.855496Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:69bd23cc57c21677d2ec8d819451986d50db893981c8e20955eb8c6aa227b6e7","observation_id":"342b023c-404f-4bc3-8ab8-f4b657832a22","resolution":{"observed_at":"2026-08-15T19:04:35.472403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.457542Z","title":"Spec- MaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Be- yond,","venue":null,"work_id":"77180412-0046-411f-bf90-53f0db0e4f69","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.859067Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:38ccbc84f011c384bff0e26a3069917a8fa32aa8f8fc04785bc641d541bfe427","observation_id":"7f134a9d-6340-4d63-a1cb-c7980412ad6d","resolution":{"observed_at":"2026-08-15T19:04:35.461489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.446969Z","title":"Drcap: Decoding clap la- tents with retrieval-augmented generation for zero-shot audio captioning,","venue":null,"work_id":"878fa157-c5fb-4f23-a21e-9333e7bb7714","year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.862709Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:f4ba5aca7de3389a8a6438052d3e2e82627cd4a2986ee1e25f4f1147567696ce","observation_id":"a4096369-5be7-4155-a002-0fdb216daf30","resolution":{"observed_at":"2026-08-15T19:04:35.450757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.436530Z","title":"Recap: Retrieval-augmented audio captioning,","venue":null,"work_id":"41bb5e78-3a5d-4fb8-8e98-84edcb61c08b","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.866590Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:620c11683472c99b5c1fbe0802f2f6935665855cefda5a42b5011908631920f6","observation_id":"80880caa-5424-45ab-bd9a-3f07acb7979b","resolution":{"observed_at":"2026-08-15T19:04:35.440153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.424938Z","title":"Taming trans- formers for high-resolution image synthesis,","venue":null,"work_id":"1436c6ee-276b-42fd-aa1f-0085a31636a8","year":2021},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.870069Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:84f036f9bd08fa3b67cf4fc32d3ed20874624560d1c3e404e8fd7264d16181b2","observation_id":"bb1880d1-975d-4e99-a0d1-a7e81a24ed96","resolution":{"observed_at":"2026-08-15T19:04:35.428626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.413135Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation,","venue":null,"work_id":"c09a598e-53c5-41ff-bc56-2a6c48c9b8bc","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.873584Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:8e0267a1954340a238d63a3519bd6d9349051c42155fc0f40a9beafcf4f87a9a","observation_id":"d3b946b7-b0b0-4de8-97d5-7b797254fe81","resolution":{"observed_at":"2026-08-15T19:04:35.417117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T19:04:34.877039Z","title":"Hierarchi- cal text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.877039Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:b52864b6ed59fb15b273468755a371101e851eefca86877c85424289ad622a59","observation_id":"e219f080-c386-452f-822a-42ac4141a8d4","resolution":{"observed_at":"2026-08-15T19:04:34.877039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.401754Z","title":"Diffgap: A lightweight diffusion module in contrastive space for bridging cross-model gap,","venue":null,"work_id":"211bf8f1-d938-4d1d-98de-d0233b45965f","year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.880838Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:2e906186f65fe383acb434713af9d18ae2ebecac44edd47de900af0d6c7e9234","observation_id":"9e9ace1a-d331-44eb-ac16-0a28a915baa0","resolution":{"observed_at":"2026-08-15T19:04:35.405759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.390112Z","title":"Classifier-free diffusion guid- ance,","venue":null,"work_id":"4fe15232-2180-4c4f-9a11-cd35f503f250","year":2021},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.884579Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:04a8b72332187ecde342d480631b2f8a59e304d477132448aa521c19966d543a","observation_id":"4f4e5aae-c4cb-42b8-a6b6-9372b5118a3b","resolution":{"observed_at":"2026-08-15T19:04:35.394149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.378974Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"a36b9390-c6a2-4b8a-a4d0-0ddc47039db0","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.888240Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:34794e9b0ce2d6b122b8046483ec6129d4adb0e5567c2df59a768101f6851d52","observation_id":"4c13215d-c5b0-477e-93b0-ffc46c719cc7","resolution":{"observed_at":"2026-08-15T19:04:35.382797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.367407Z","title":"High- resolution image synthesis with latent diffusion mod- els,","venue":null,"work_id":"a4270e48-80bd-493d-9b57-3ffdd8e531cf","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.891814Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:5c8f51b9f236bdf4e9d0f9c7a597f8236703869a529173ea232f79fa80bc9b51","observation_id":"de74626a-dec7-42f2-a063-90920caaaff0","resolution":{"observed_at":"2026-08-15T19:04:35.371444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.356845Z","title":"Moûsai: Text-to-music generation with long-context latent dif- fusion,","venue":null,"work_id":"3ad1f265-54a3-4c9e-9fa5-29d1107835dc","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.895451Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:8f5437b8dcc0765efa69ba3e37326d402c3fa604c737c456fef73a6cf86b148d","observation_id":"13dfd92f-3f0d-49b7-8b81-fcbcaf51db5e","resolution":{"observed_at":"2026-08-15T19:04:35.360620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.345991Z","title":"Prompt tuning inver- sion for text-driven image editing using diffusion mod- els,","venue":null,"work_id":"710d6fbe-95f7-4cf5-b96c-5b024af05ca7","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.898976Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:dcebe5fa5462e7ab430a7335d5b950fbd0847c7dd75ca383d617b29a45ec553e","observation_id":"6ab6ccb7-8f53-4f51-9dd4-6cbd33db5cfa","resolution":{"observed_at":"2026-08-15T19:04:35.349635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.334736Z","title":"Prompt- to-prompt image editing with cross-attention control,","venue":null,"work_id":"2ff4389d-1527-4212-80b1-7634c0042c60","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.902627Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:86a441bc7c62b7a5b6c75cdfffbac1966bfdbf876c4052b385445643c7a70f3a","observation_id":"7ebbc67f-4cba-4007-bc86-2bfb35b4a673","resolution":{"observed_at":"2026-08-15T19:04:35.338575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16535","last_updated":"2024-09-25T01:02:30Z","snapshot_observed_at":"2026-08-20T09:39:44.615364Z","submitted_at":"2024-09-25T01:02:30Z","title":"Prompt Sliders for Fine-Grained Control, Editing and Erasing of Concepts in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16535","snapshot_observed_at":"2026-08-15T19:04:34.906186Z","title":"Prompt sliders for fine-grained control, editing and erasing of concepts in diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.906186Z"},"links":{"cited_paper":"/paper/2409.16535","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:df9bcff8d307a255897bb2008f9fb99fc820f230e2ee43da6578135898ae0b28","observation_id":"674dd043-3c3e-4ee9-92af-b16bb6f579fa","resolution":{"observed_at":"2026-08-15T19:04:34.906186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.324089Z","title":"Re- paint: Inpainting using denoising diffusion probabilis- tic models,","venue":null,"work_id":"9ad87436-2532-407b-99cb-75950fb14bc5","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.910067Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:9842cfcfb44b7729be4a15ff1a7da6b41a8d9cb4265dd13450332d47b3352426","observation_id":"74d6d795-70bc-458c-9320-8860f6d19f41","resolution":{"observed_at":"2026-08-15T19:04:35.327988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16807","last_updated":"2024-12-10T14:52:10Z","snapshot_observed_at":"2026-08-16T15:29:22.895377Z","submitted_at":"2023-05-26T10:41:08Z","title":"Negative-prompt Inversion: Fast Image Inversion for Editing with Text-guided Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16807","snapshot_observed_at":"2026-08-15T19:04:34.913971Z","title":"Negative- prompt inversion: Fast image inversion for editing with text-guided diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.913971Z"},"links":{"cited_paper":"/paper/2305.16807","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:ed1508a238f4b28c2462b232e1e6d2bee337eb68034325e2b05d265393d60342","observation_id":"2b7212e1-ef88-4155-9043-2fd46b586eee","resolution":{"observed_at":"2026-08-15T19:04:34.913971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.312585Z","title":"Musicmagus: zero-shot text-to-music editing via diffusion models,","venue":null,"work_id":"1182f6ab-7e5c-43d6-9e58-9f5e250bd0bf","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.917782Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:aa0df68d8d548b136f59d2c779c6aec8f1ec6975aff042cf9803eaccec52fa76","observation_id":"aaac58ee-a01f-48ab-840d-bdcec4884768","resolution":{"observed_at":"2026-08-15T19:04:35.316632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.300919Z","title":"Arrange, inpaint, and refine: steerable long-term music audio generation and editing via content-based controls,","venue":null,"work_id":"25e1dc15-d646-401d-aec2-27ca0df9cfab","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.921357Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:56bf65e91a9080841efcb22603a608633e912231e45bb9d14ee467810b88b964","observation_id":"a23a3d75-0cc1-4a3f-8c6c-32480d72e054","resolution":{"observed_at":"2026-08-15T19:04:35.304947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.290450Z","title":"Disentangled multidimensional metric learning for music similarity,","venue":null,"work_id":"6ece9a50-499b-431a-a628-d03ea68d2df6","year":2020},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.925213Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:5e5c2f3c80eb90b465aac818c2e694633fed83d3d5b51b8da91843f4aaabaf24","observation_id":"c53b2878-8b42-493c-8a84-f74613426e0a","resolution":{"observed_at":"2026-08-15T19:04:35.294205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.279804Z","title":"Leave-one- equivariant: Alleviating invariance-related information loss in contrastive music representations,","venue":null,"work_id":"a8597505-b5a5-449f-98e5-68dc68ff2557","year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.928844Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:c4a7524db407e45d2b9b45dcec8ee5d7adcc0de2c41cea78c919cafd46276489","observation_id":"91a51648-2e33-4665-b51d-7dd9cb534d52","resolution":{"observed_at":"2026-08-15T19:04:35.284123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.267112Z","title":"Similar but faster: manipulation of tempo in music audio em- beddings for tempo prediction and search,","venue":null,"work_id":"513a3e2d-78f1-4f05-8169-575d0f7039a4","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.932222Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:286c77e81a6b11106b6a5a2c39cf833bcd24d61d94d7bf96a5f8d2affb91476f","observation_id":"c3cc4f80-4940-406e-b5db-a3cd8a0e2897","resolution":{"observed_at":"2026-08-15T19:04:35.271040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.256046Z","title":"Diff4steer: Steer- able diffusion prior for generative music retrieval with semantic guidance,","venue":null,"work_id":"8ee4b1d0-a1b9-44c2-96f9-8df3b85a2701","year":2025},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.935579Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:c05be181c1d72ffc1b5a63031e0297f4c0241393999b308698093eb4175fb0de","observation_id":"4ac1ed93-24f9-452e-b399-270efc1b6833","resolution":{"observed_at":"2026-08-15T19:04:35.260053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.244646Z","title":"Supervised and unsupervised learning of audio rep- resentations for music understanding,","venue":null,"work_id":"3b260af1-3840-4242-b4e9-ce7b7377d8c4","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.939280Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:ef46989662132aa70320ce02c82fb7b1629c50f654e9b5b19f41c45d71542194","observation_id":"88722465-4711-44b8-bae8-07200c7dae5d","resolution":{"observed_at":"2026-08-15T19:04:35.248595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.233828Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classifica- tion and detection,","venue":null,"work_id":"94d814c1-6f8f-4799-9072-b3eaf0c6b324","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.942695Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:e786f98d1086d3ce7a7b592d29f9ee7bc5b9680dfe809490e5d3fa30001b3284","observation_id":"3a46cb77-5f7a-4a53-b608-64c95446bd3e","resolution":{"observed_at":"2026-08-15T19:04:35.237503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.222240Z","title":"Scal- ing instruction-finetuned language models,","venue":null,"work_id":"67f42add-2cfe-4d1e-ab4c-ae7cb822a345","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.946057Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:16212d43932a36ee86c06d8493154fae3a6e53806a17bd8b86c65104dd4505fa","observation_id":"e09fd019-bde5-458f-a7c4-63588f14747b","resolution":{"observed_at":"2026-08-15T19:04:35.226497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T19:04:34.949482Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.949482Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:d29049bd4f1d83a4d3d30ffac251c0cd66774afdab891b5ed82f87e759b228dc","observation_id":"f3678114-786e-421f-9ec3-562e73a85f44","resolution":{"observed_at":"2026-08-15T19:04:34.949482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.209504Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":"05073844-79d7-435e-bdc8-1ce06ce1e560","year":2024},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.953225Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:49ee70cf3cec5fe379266f6cd425d4a0d6a6f80cabd147e5b72e43398d2983cd","observation_id":"bf07307b-39f4-4a4a-8397-b566ad248545","resolution":{"observed_at":"2026-08-15T19:04:35.213436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.196464Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"97e4410c-74f0-4e2d-b748-75457070341a","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.956709Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:db178827e57e4491722d9e1eddf8cd915b2170a0a9e44f2c2d6a2249e7a2688c","observation_id":"e3389da3-07c2-4683-90da-1719eff5af75","resolution":{"observed_at":"2026-08-15T19:04:35.201067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.183731Z","title":"The song describer dataset: a corpus of audio captions for music-and- language evaluation,","venue":null,"work_id":"e5ad3bb6-e634-44aa-aa33-c6981700b08d","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.960138Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:353ab85cbd6ec2462ae39fa41b924a6e56aeeaddbe7c8343b0b0b42ba7d80004","observation_id":"f61cfd5e-2cdf-469e-a0d7-1e7dad83e1d6","resolution":{"observed_at":"2026-08-15T19:04:35.188234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-20T13:40:28.954978Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-15T19:04:34.963627Z","title":"Mu- sicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.963627Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:cae517e1feb2b9b09389ce461a5935a152a37e8ddfddd613e0376d491f4add88","observation_id":"801c08b4-f68e-482b-9241-0c7439a2cb24","resolution":{"observed_at":"2026-08-15T19:04:34.963627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.171734Z","title":"Coco-dr: Combating distribution shifts in zero-shot dense retrieval with con- trastive and distributionally robust learning,","venue":null,"work_id":"2843f4b6-8e74-4f35-b785-fd6ba4d708f9","year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.967500Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:45be32dcbdf4512a890831cad6f91c8250da08dbea80e67ad91538203a34355a","observation_id":"7dc546fc-56b0-4e71-bfa1-29ad2eca2864","resolution":{"observed_at":"2026-08-15T19:04:35.175628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.160542Z","title":"Selecting which dense retriever to use for zero-shot search,","venue":null,"work_id":"b1c5ad19-f97f-473c-aeb2-5a15758f13ae","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.971348Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:d7e8e3a29ee0d9b40cbca8c3f2505d8e1a358b6896ee7fd9f8d6aca3f64bbd86","observation_id":"6751f474-cff9-488c-9565-b66aa8fc1ffb","resolution":{"observed_at":"2026-08-15T19:04:35.164355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.148455Z","title":"Test-time distribution nor- malization for contrastively learned visual-language models,","venue":null,"work_id":"40f1b37f-e682-431f-b7f2-107fccfa1e06","year":2023},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.974721Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:5a5687f2191bd821ee16ea7d1905f591a3ff3c08a3db8760cfe9ce0d9ccae6ce","observation_id":"f1556d10-558e-4fcf-825b-abe4ad3dbff8","resolution":{"observed_at":"2026-08-15T19:04:35.152236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.136991Z","title":"Correlation alignment for unsupervised domain adaptation,","venue":null,"work_id":"315e3da1-a8ba-4d04-9e69-8f0b5f4ad0eb","year":2017},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.978210Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:9d01d1a341f8df352fa32252e5150276f25503deaadba1986846c7ef00f0deda","observation_id":"8bdff5ed-6bff-4522-bad7-fc8d5382834b","resolution":{"observed_at":"2026-08-15T19:04:35.140764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02410","last_updated":"2023-07-02T22:58:51Z","snapshot_observed_at":"2026-08-16T16:26:39.313657Z","submitted_at":"2022-10-05T17:32:16Z","title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02410","snapshot_observed_at":"2026-08-15T19:04:34.981881Z","title":"The vendi score: A di- versity evaluation metric for machine learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.981881Z"},"links":{"cited_paper":"/paper/2210.02410","citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:076b69b09c80d2655d200a6fb0301b61e8c3cb2dee20ae3a554e50bcb001802d","observation_id":"4c1bd7a4-d53e-4932-87e2-21397a6aec2c","resolution":{"observed_at":"2026-08-15T19:04:34.981881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:04:35.122696Z","title":"The mtg- jamendo dataset for automatic music tagging,","venue":null,"work_id":"2e67d687-280a-46fe-afb8-b9155eac374f","year":2019},"citing_paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T19:04:34.985831Z"},"links":{"citing_paper":"/paper/2506.17886"},"observation_digest":"sha256:8a160aebdc1fe0b13abef9c03099c0b0c9091eba723fda9c9618ae3f3911bbbf","observation_id":"56c9ca0a-23c0-4229-a8a3-cc2b3b3c4897","resolution":{"observed_at":"2026-08-15T19:04:35.128817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17886","last_updated":"2025-06-24T14:25:12Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T17:13:24.143360Z","submitted_at":"2025-06-22T03:30:27Z","title":"GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2506.17886."}