{"as_of":"2026-08-22T20:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8644e39ecb1cbc115c98be6330e226f221936731224452407343a46198081f97","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:05:24.550981Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:05:24.211908Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T19:05:24.861716Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"cited_work":{"arxiv_id":"2506.17815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17815","snapshot_observed_at":"2026-08-15T19:05:24.861716Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","venue":"cs.SD","work_id":"87bf336a-67e5-4f40-af2b-193dce1055ad","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.211908Z"},"links":{"cited_paper":"/paper/2506.17815","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:eb30f0d4a39f5fa32f41b1a96b7047fbc14516d1cbd2423ec7d0704e09cea3de","observation_id":"f7bb58df-5525-4316-a783-368fb19742db","resolution":{"observed_at":"2026-08-15T19:05:24.865750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17815/citation-record","integrity":"/paper/2506.17815/integrity","json":"/paper/2506.17815/citation-record.json","paper":"/paper/2506.17815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.427831Z","title":"SLAP: Siamese Language-Audio Pretraining without negative samples for Music Understanding","venue":null,"work_id":"3d9315e4-acd0-447d-8958-217e8b5c60fd","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.196688Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:5961c41bb86f70c94402c74ec8a7fba17b9680cdb09358d05b75544ee906f13a","observation_id":"945757d7-709f-4ca5-b503-788b01396021","resolution":{"observed_at":"2026-08-15T19:05:25.431204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.418498Z","title":null,"venue":null,"work_id":"8bb215cb-c22b-4bbd-9bf5-e69530ac1054","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.201207Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:7f5a4b77438fa187341a3135c14025f2ef376e0869762f47dd048af2490acf6f","observation_id":"aa2f6545-a71d-4258-a1f0-5baa9419fb60","resolution":{"observed_at":"2026-08-15T19:05:25.421612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.408860Z","title":null,"venue":null,"work_id":"61ecaaa0-35ea-4102-87df-addf55ca12fa","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.204732Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:995a8afa24c530f1e11d15f0eeee6352570b26b715b3622b91ba8bbca63b1471","observation_id":"be0f5391-5e66-4fab-aefd-d19ba2d0c3f7","resolution":{"observed_at":"2026-08-15T19:05:25.412006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.398600Z","title":null,"venue":null,"work_id":"ca30ff1e-9ec8-4e44-8964-219bd1eb7938","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.208515Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:dcd412768fb2cf019e59ebc05ad947e7e3ad7d01fea0ae33e996e395dda8e863","observation_id":"58de1b19-7975-4724-b952-a98bf556c73f","resolution":{"observed_at":"2026-08-15T19:05:25.402224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"cited_work":{"arxiv_id":"2506.17815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17815","snapshot_observed_at":"2026-08-15T19:05:24.861716Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","venue":"cs.SD","work_id":"87bf336a-67e5-4f40-af2b-193dce1055ad","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.211908Z"},"links":{"cited_paper":"/paper/2506.17815","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:eb30f0d4a39f5fa32f41b1a96b7047fbc14516d1cbd2423ec7d0704e09cea3de","observation_id":"f7bb58df-5525-4316-a783-368fb19742db","resolution":{"observed_at":"2026-08-15T19:05:24.865750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.388536Z","title":null,"venue":null,"work_id":"ea078ccc-fc5f-4145-ba1c-1fdcb5103eb6","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.215913Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:4697c7edaf8a405615a102a68b5ef86bb8a9e54882f8b284dcb61d1dc53b185f","observation_id":"9744a747-551e-47a5-b147-e0f2095c5661","resolution":{"observed_at":"2026-08-15T19:05:25.391813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.377939Z","title":"A blaring metal track with stompy kicks and distorted chuggy guitar","venue":null,"work_id":"b6e5e5e1-25b9-46b4-af5a-709041c4e081","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.219886Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:c5fa7f99d8da93476fd94301c5d155e7ed8fc57662d9587e162e570c6c7bbf7f","observation_id":"91ca2359-368c-4540-83f8-22e7ad6a372d","resolution":{"observed_at":"2026-08-15T19:05:25.381645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.367215Z","title":"We train SLAP on an internal private dataset of 260,000 pairs of full-length production-quality music tracks and professionally annotated captions (PrivateCaps [16])","venue":null,"work_id":"15c1951f-7a79-434f-a44f-075d57fc7f1b","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.223759Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:85798a243a8b36b535e66460993890a90c1c7169946a39e68e638b3f91870679","observation_id":"afabab7d-3803-4981-86a4-33abc1d99628","resolution":{"observed_at":"2026-08-15T19:05:25.370907Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.356523Z","title":"{}”, “{} music","venue":null,"work_id":"9ff3ce1b-e5a8-4ec3-83cd-90bf96ca198f","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.227475Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:eccd78965439f60d70514e5409f331a4665f1f966454ef31b8926b9397857fd4","observation_id":"c7b920fd-2159-4528-99d7-b2dd06023bfe","resolution":{"observed_at":"2026-08-15T19:05:25.360384Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.345617Z","title":"SLAP out- performs contrastive models on tasks including text-music retrieval, downstream probing, and zero-shot music un- derstanding","venue":null,"work_id":"f29d0018-8e9c-4942-beca-3d598ebcd286","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.231401Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:a740da7e0cc62cd132aba8b046e810406296ddca6396c6ec7b501ddceb447730","observation_id":"f5616719-b1f2-438e-81ec-35640d08c600","resolution":{"observed_at":"2026-08-15T19:05:25.349552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.235099Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.235099Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:cb1753788567f664458aa293f2832c5fd7b2eab85506c7f2507997824ba94e21","observation_id":"631c1df4-7a69-480e-beb3-f62240b755c0","resolution":{"observed_at":"2026-08-15T19:05:24.235099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.328143Z","title":"Learn- ing transferable visual models from natural language supervision,","venue":null,"work_id":"04947a42-7837-40f9-946c-f4bc6e2e62ac","year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.238742Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:537980e71c07f2a9e2f9776aa65c9f3b08dcfc4ebbc5528e279638687a717dc7","observation_id":"9ccd665f-024d-473b-850e-032f8e69229c","resolution":{"observed_at":"2026-08-15T19:05:25.331702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.317714Z","title":"Clap learning audio concepts from natural language supervi- sion,","venue":null,"work_id":"37163805-7e6f-4fd6-933d-f7bb5eac1dac","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.242477Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:1461e916e86e10043890bb78b19de87f6a3638ce347258279c478247fa43bc57","observation_id":"89da1510-9bae-444b-adef-8960d29bc426","resolution":{"observed_at":"2026-08-15T19:05:25.321236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.306957Z","title":"Collap: Contrastive long-form language-audio pretraining with musical temporal structure augmentation,","venue":null,"work_id":"84b823a8-0b78-418d-bdc8-93b53d79275d","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.245965Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:35348c4b1c8a82f91a8386cb04bb7b0b4782bbc077cf0305027ceb220abe416e","observation_id":"df08d519-5a8c-42bc-8102-31bbfe6aaba2","resolution":{"observed_at":"2026-08-15T19:05:25.310759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.296479Z","title":"Aligned contrastive learning for text-to-music retrieval,","venue":null,"work_id":"34d8e1ef-f978-4157-a96d-596bbbb05837","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.249648Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:cacefbcd5945e9549dabedf766bd248909097f26a6d540a1763513904a2968a7","observation_id":"15106905-80fb-48d3-92f3-a055809b817a","resolution":{"observed_at":"2026-08-15T19:05:25.300145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.285325Z","title":"T-clap: Temporal- enhanced contrastive language-audio pretraining,","venue":null,"work_id":"f981859c-0a99-41c4-afe5-073a5b088352","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.253342Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:e489edcaa590868652e954694e8be2e07db71f158ea90ab642080566f6b4935b","observation_id":"4374bfe1-e3dd-42a5-b1d0-ccf7c7d7bea6","resolution":{"observed_at":"2026-08-15T19:05:25.289096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.275237Z","title":"Augment, drop & swap: Improving diversity in llm captions for efficient music-text representation learning,","venue":null,"work_id":"b01901ba-cb8a-49e5-9d6b-842c87f12e84","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.257131Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:3886a0679ea8e1fec1ec093a53daf83228085cf7253ab4da36b9e4ea6bdd8ce5","observation_id":"07d97a30-41b9-431c-ad79-5f35c95334ac","resolution":{"observed_at":"2026-08-15T19:05:25.278979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-08-16T13:48:26.883064Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-15T19:05:24.260513Z","title":"Its Not a Modality Gap: Characterizing and Addressing the Contrastive Gap,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.260513Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:a627bd7dbc41d83b7da200109ea3fe8a648c6bec012db93f7301cd83faff564c","observation_id":"97a464e5-988b-4a00-8767-b313357e443e","resolution":{"observed_at":"2026-08-15T19:05:24.260513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.265433Z","title":"Mind the gap: Understanding the modality gap in multi-modal con- trastive representation learning,","venue":null,"work_id":"5bf30aed-d368-4787-956e-54ebfc7e75fc","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.264269Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:766199d4f43e05607376f1cf394faeb083ea051a24ba1fa32ba0281c5a3f1fc8","observation_id":"e9495c76-aa8b-4b13-812f-6e449c6f50f7","resolution":{"observed_at":"2026-08-15T19:05:25.268934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.255155Z","title":"Combined scaling for zero-shot transfer learning,","venue":null,"work_id":"d8d7e5d8-ad0e-4dad-a04b-a87dd3f87df2","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.267955Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:a9967378087c8933934cb10577471d3035eee3f27da7f67e54e1ac6f9883ad32","observation_id":"ddc9f865-b153-47df-95c5-900ab4587148","resolution":{"observed_at":"2026-08-15T19:05:25.258892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.244683Z","title":"Bootstrap your own latent-a new approach to self-supervised learn- ing,","venue":null,"work_id":"1f9b81d7-ab88-4718-be91-1d24408711b2","year":2020},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.271272Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:76ea9de9186510b5b7e05674f8337859df8b9c047d246d28b084ccd5271e3169","observation_id":"0c029e01-3fd9-4173-8dd9-ece654f14937","resolution":{"observed_at":"2026-08-15T19:05:25.248293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.233873Z","title":"Byol for au- dio: Self-supervised learning for general-purpose au- dio representation,","venue":null,"work_id":"19c06a21-adb7-4e0e-9c20-965c69fd67df","year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.274618Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:0bded8984aa1103f165570b036c3bf8d5111501c34fbcbcbd5bf5ca555784ed4","observation_id":"a18bf2c1-f291-4d79-b334-ca4e7d6a5c09","resolution":{"observed_at":"2026-08-15T19:05:25.237525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.223801Z","title":"A simple framework for contrastive learning of visual represen- tations,","venue":null,"work_id":"07d18d86-ee83-4d1e-bbdf-7e1059b04b85","year":2020},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.277965Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:d05694b0f7f4f0a55e9325cd70a571d96aebaa1bbd82df1e6be997787a189ff8","observation_id":"d61d5dd1-1a3c-4cb9-9b38-08ae5fe39dcc","resolution":{"observed_at":"2026-08-15T19:05:25.227417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.213330Z","title":"Contrastive learning of musical representations,","venue":null,"work_id":"26da5a0b-8152-4b3e-9aaa-10b1fce3e90f","year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.281374Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:25fecc6971bd00caf5cabe9ba4036aeb7b35899d62acf04f32475bca4e112af5","observation_id":"0cf88e36-9dbf-480f-9ff6-c39149484708","resolution":{"observed_at":"2026-08-15T19:05:25.216904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11178","last_updated":"2021-12-07T04:01:25Z","snapshot_observed_at":"2026-08-21T08:40:29.616256Z","submitted_at":"2021-04-22T17:07:41Z","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11178","snapshot_observed_at":"2026-08-15T19:05:24.284761Z","title":"V ATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.284761Z"},"links":{"cited_paper":"/paper/2104.11178","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:f1ed85877d48a727d9659615befbe1527de2ca27ce7d8017473c761d0b0ba60b","observation_id":"6826ed26-a5ff-489b-b229-30370edcb540","resolution":{"observed_at":"2026-08-15T19:05:24.284761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08168","last_updated":"2017-08-01T12:04:50Z","snapshot_observed_at":"2026-08-19T13:49:02.214636Z","submitted_at":"2017-05-23T10:37:54Z","title":"Look, Listen and Learn","version":2},"cited_work":{"arxiv_id":"1705.08168","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.08168","snapshot_observed_at":"2026-08-15T19:05:24.821597Z","title":"Look, Listen and Learn","venue":"cs.CV","work_id":"d4654312-c28e-497e-bec4-cef79ae5e767","year":2017},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.288371Z"},"links":{"cited_paper":"/paper/1705.08168","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:bf2372a31f9d9808b0db2f946084c79cd94b19b5545fa2b259056f05ecef389d","observation_id":"625a80eb-1f82-48d2-af54-b99714e76f00","resolution":{"observed_at":"2026-08-15T19:05:24.825876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.202575Z","title":"Contrastive audio-language learning for music,","venue":null,"work_id":"c42b15fb-bd0c-4941-98ee-54f9276bf9c3","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.292101Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:4b3abf46a891c33187a42a6147a42e7379d8ca6227ea66c783e81f8d71f9633e","observation_id":"380390a5-1668-4e61-b3f6-575d85ed12e8","resolution":{"observed_at":"2026-08-15T19:05:25.206326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.191711Z","title":"Mulan: A joint em- bedding of music audio and natural language,","venue":null,"work_id":"d8d49eba-a6e0-4f96-aa52-a8f996ae904e","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.296065Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:7189bd94b1ff57a57025250ce67a90e09bad3e912d8646f9d6f0562709d564d9","observation_id":"fa512335-9c60-49af-a599-8568ed8baf10","resolution":{"observed_at":"2026-08-15T19:05:25.195528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.181637Z","title":"Cacophony: An improved contrastive audio-text model,","venue":null,"work_id":"26dfbe47-ab51-4e02-a08b-f432db312c95","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.299437Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:06ba82be289eb5f1c663e1bb1168a49fc9ce7aa57b2066cfa828b39ad92013c3","observation_id":"6225267b-8f9e-4fe1-9f72-6b41394be120","resolution":{"observed_at":"2026-08-15T19:05:25.185141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.171789Z","title":"Audioclip: Ex- tending clip to image, text and audio,","venue":null,"work_id":"69b783cd-eed5-4aa1-adaa-bfd21018a7c7","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.302611Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:73ce38880b059f78498d4125f8bd75c0c31cfa88ee199e844b8b9bd1becf3d4a","observation_id":"e6a34537-ed9d-4269-ae02-aa94b4261791","resolution":{"observed_at":"2026-08-15T19:05:25.175300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.161729Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"62813f18-475b-4f23-b973-7bdcb20896fe","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.306012Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:4e13c01752c56b3e66bb2abc4eda482faba339034ecffea4873fd5bbfddaaabf","observation_id":"e1874300-58e1-453f-b2b9-49a303d9e593","resolution":{"observed_at":"2026-08-15T19:05:25.164987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11959","last_updated":"2025-02-12T13:25:10Z","snapshot_observed_at":"2026-08-21T18:01:34.449247Z","submitted_at":"2024-12-16T16:41:51Z","title":"Gramian Multimodal Representation Learning and Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11959","snapshot_observed_at":"2026-08-15T19:05:24.309376Z","title":"Gramian Multimodal Representation Learn- ing and Alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.309376Z"},"links":{"cited_paper":"/paper/2412.11959","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:921e885e6464f014983cf28a20bd2ee3622df49af92086a072968fea7bcab683","observation_id":"87c41252-fa3b-46f8-b91f-ec1ec878895b","resolution":{"observed_at":"2026-08-15T19:05:24.309376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T19:05:24.312829Z","title":"Hierarchi- cal text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.312829Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:b6f9d446a7dcc50ab881109bf661ea9cf6e6c3597a29fcc2d9e8a42b2fd86407","observation_id":"138d1298-3f3a-4fe5-9822-e27a6f0a05e7","resolution":{"observed_at":"2026-08-15T19:05:24.312829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.150811Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"763a0fdb-f0ab-4173-a080-bf98dc2f9ed2","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.316256Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:47fceaff02d74c4bacba0deaea984dc501120d7baa3d9acc2395fb716afac08c","observation_id":"4c22b2a8-4bc1-4dba-96fe-da2d5c35d0ab","resolution":{"observed_at":"2026-08-15T19:05:25.154280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-16T14:22:01.900523Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-15T19:05:24.319505Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.319505Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:e9d45bdb7394d258dca8a79435400142422cf657de628da0d69772387e11c1be","observation_id":"b388096b-0255-4771-9f4c-dd02bafebac8","resolution":{"observed_at":"2026-08-15T19:05:24.319505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.139886Z","title":"Reclap: Improving zero shot audio classification by describ- ing sounds,","venue":null,"work_id":"e367d50a-3f56-4822-9448-b2ddc8272729","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.421463Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:643eb37976c04549cc9c510b012778fbbaf6f8b7916a96be1a52aac6052a9b47","observation_id":"16537c1b-d7fe-400a-b61c-465c069346fc","resolution":{"observed_at":"2026-08-15T19:05:25.143420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.129488Z","title":"Drcap: Decoding clap la- tents with retrieval-augmented generation for zero-shot audio captioning,","venue":null,"work_id":"3a74e72e-8a3c-42e7-9bf5-d2cf5351eac2","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.425203Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:c109598c0eb3991b1f0ca553293ebccfcf97c2848abe7ff63b1808a65322c3a6","observation_id":"7c4ee1d7-d1c7-44e4-b32b-15379c0562f3","resolution":{"observed_at":"2026-08-15T19:05:25.132958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.119356Z","title":"Recap: Retrieval-augmented audio captioning,","venue":null,"work_id":"0ca4fa37-90da-4c3e-8d57-e0878f1751b0","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.428547Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:8e650ec2c436bad8e7a0778e25509b8f4d20d1782602af6ded7c1201d735bd33","observation_id":"eb449c45-2402-4a55-a59d-0f9c2f44720a","resolution":{"observed_at":"2026-08-15T19:05:25.122683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.109331Z","title":"Fast timing- conditioned latent audio diffusion,","venue":null,"work_id":"a1047e7d-b1aa-4491-9050-4bfb7fb293ea","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.432313Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:f6baec76cfa539d6df661b12a789813527cabff725bb11944eb1509612317743","observation_id":"010c2f34-a4ad-41e4-8701-939b67aeebe1","resolution":{"observed_at":"2026-08-15T19:05:25.113015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.099392Z","title":"Long-form mu- sic generation with latent diffusion,","venue":null,"work_id":"a6209d9d-873d-4b61-9914-d85e4782f16b","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.435618Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:66aa65def1329b397acd8ff4da12de3be4d5ed296c758d3f34b98d8f648ff5de","observation_id":"75347fad-e324-4f3d-993d-ebbaa0b9a3d1","resolution":{"observed_at":"2026-08-15T19:05:25.102835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.089389Z","title":"Diff-a-riff: Musical accompaniment co-creation via latent diffu- sion models,","venue":null,"work_id":"9a986602-c8e4-4563-9884-584fde2aa3f3","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.439126Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:d22bb41b5a552fa9fc7a19c71edec2ec7ccb687f9f28a2264ffc23507c2549d6","observation_id":"a8f40e6d-2d35-4ddf-8d00-9defa906477b","resolution":{"observed_at":"2026-08-15T19:05:25.093007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.079362Z","title":"AudioLDM: Text-to- audio generation with latent diffusion models,","venue":null,"work_id":"f96a09b8-d216-4dc6-b4bd-965d840d08dc","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.442809Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:b107385cbeeaf277893660702dbdd2911ea0bb420be304337f6696c4b430208b","observation_id":"aa88b59e-227c-4205-85dc-45b104eb117e","resolution":{"observed_at":"2026-08-15T19:05:25.082850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-20T13:40:28.954978Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-15T19:05:24.446062Z","title":"Mu- sicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.446062Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:0c6aef3975f3db23e7533dd437bbbf9e7bc90e3a8a400155e47b68d78e67aa89","observation_id":"78ad5ae0-3bc5-4205-8067-3413369db525","resolution":{"observed_at":"2026-08-15T19:05:24.446062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-15T19:05:24.449881Z","title":"Sigmoid Loss for Language Image Pre-Training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.449881Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:f0edda565370bf8586c2553ffaf4b47205dad271686e5e667e5aa4727d6232b2","observation_id":"4664656b-87b3-4ace-9538-c84d79341393","resolution":{"observed_at":"2026-08-15T19:05:24.449881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07277","last_updated":"2022-10-13T18:10:01Z","snapshot_observed_at":"2026-08-16T16:24:22.305463Z","submitted_at":"2022-10-13T18:10:01Z","title":"The Hidden Uniform Cluster Prior in Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07277","snapshot_observed_at":"2026-08-15T19:05:24.453582Z","title":"The Hidden Uniform Cluster Prior in Self-Supervised Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.453582Z"},"links":{"cited_paper":"/paper/2210.07277","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:2047118c354bd84c1c5fd10c9b47d516808728bc819b9ad035c580b6afe1409a","observation_id":"b252c074-0b58-46eb-90aa-f515f7c84626","resolution":{"observed_at":"2026-08-15T19:05:24.453582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.068879Z","title":"Understand- ing the Modality Gap in CLIP,","venue":null,"work_id":"8fba4374-1c94-4364-b14f-04df709a2dc0","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.457481Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:0d1ba28d0c6b5bdc86814495303f8380ff848b2bc6cbcf4b9aa5cccde01d2706","observation_id":"77c38c8a-af32-41a4-a645-1762d26f27d6","resolution":{"observed_at":"2026-08-15T19:05:25.072739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.058793Z","title":"Exploring simple siamese repre- sentation learning,","venue":null,"work_id":"834b6700-b800-4611-bcb3-9ba3a599c6df","year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.460863Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:600afb3e7f4e4cc61c0a0561d52e101d73dc8f9fa800a820893e944e0ea8662a","observation_id":"cdfd19ea-2375-4fe8-a822-2311b576cb34","resolution":{"observed_at":"2026-08-15T19:05:25.062331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.048452Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predic- tive Architecture,","venue":null,"work_id":"76139a2d-2cec-4e7d-8e3f-ccd877d794e4","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.464284Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:95a728dfd233e250f10a4567b58ae0f91dcfa627edc78aed7a16516f74d5e28d","observation_id":"5ea40e81-1b05-4726-bba1-475d6c8374d9","resolution":{"observed_at":"2026-08-15T19:05:25.052075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06810","last_updated":"2021-10-08T02:41:50Z","snapshot_observed_at":"2026-08-16T18:45:51.622041Z","submitted_at":"2021-02-12T22:57:28Z","title":"Understanding self-supervised Learning Dynamics without Contrastive Pairs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06810","snapshot_observed_at":"2026-08-15T19:05:24.468014Z","title":"Understanding Self- Supervised Learning Dynamics without Contrastive Pairs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.468014Z"},"links":{"cited_paper":"/paper/2102.06810","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:c6a61e69d41322f539f6ef0a6f7a8a1675690ee1bd0b376c7c5c597441e89f4a","observation_id":"5e47592c-ceed-4a5a-bc6a-2691f300d9e9","resolution":{"observed_at":"2026-08-15T19:05:24.468014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T19:05:24.471760Z","title":"DINOv2: Learning Robust Visual Features without Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.471760Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:28b732498f1f465e9e59a8d228807ac67af22c4b9fd8c0606f36ab96a067e1b3","observation_id":"25373c4b-0f58-44cf-a6f8-02cbdff7392a","resolution":{"observed_at":"2026-08-15T19:05:24.471760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.038331Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":"2332a95e-6560-45a1-96d3-7a8880686f2d","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.475376Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:1a19610fac7e1a2b2686c04de30d233c32de5d7b253a597d4879900d7dcaa436","observation_id":"281b6adb-5128-4ffd-b925-6983e8fd76cd","resolution":{"observed_at":"2026-08-15T19:05:25.041997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-10126","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.578231Z","title":"ATST: Audio Representa- tion Learning with Teacher-Student Transformer,","venue":null,"work_id":"94904987-f6f6-4787-a788-66ebce35aecf","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.479341Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:5d0bbeb6f32292964dda042164915b8b396ebe3509fcc261f510e659c870189c","observation_id":"13929d01-3aec-4eb9-bf95-1f0cd71ecc35","resolution":{"observed_at":"2026-08-15T19:05:24.583861Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.027367Z","title":"Masked Modeling Duo: Learning Representations by Encour- aging Both Networks to Model the Input,","venue":null,"work_id":"90f35b46-d8d3-44e0-8996-c47fc57158fc","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.482915Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:c45281f0331ce6fc05408567b469b0ae763c54866f530010bc1517091b4155c2","observation_id":"4c5fcfb1-286f-46e9-b62a-946cf7dacdd8","resolution":{"observed_at":"2026-08-15T19:05:25.031411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.015963Z","title":"Masked latent prediction and classification for self-supervised audio representation learning,","venue":null,"work_id":"719bc84b-86fb-40d9-922e-2adb15d33e12","year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.486602Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:8c4df27c2bea2f4c35cb1e7a45bf2d4e8ee46efad1cf0d6fd1ee7382640e00e5","observation_id":"946ec3e9-912e-472f-b2fb-45c1033238ef","resolution":{"observed_at":"2026-08-15T19:05:25.020250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:25.004637Z","title":"The song describer dataset: a corpus of audio captions for music-and- language evaluation,","venue":null,"work_id":"d2b056ed-fe40-43ec-bf9e-51e1ef268935","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.490109Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:7da6fab53711c821b55c0590c992ed22a8c3effe4fdbd54ada102cc96c10a819","observation_id":"db21b2ac-c6c9-4217-b219-16f089a894ca","resolution":{"observed_at":"2026-08-15T19:05:25.008673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.493800Z","title":"Musical genre classification of audio signals,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.493800Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:cce24755c26f0f8a10f74e8700399da0643639706e64260f6e2ac49f7101e102","observation_id":"bb626762-365e-4cee-bb7b-250fd95ebdbe","resolution":{"observed_at":"2026-08-15T19:05:24.493800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.993085Z","title":"Evaluation of Algorithms Using Games: The Case of Music Tagging,","venue":null,"work_id":"e2398f50-231d-4ef7-82f1-6247163202e0","year":2009},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.497806Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:993a679e4f170d3fc8f455d1ff120ccee6f054133ec0ab0041ca8a9f8cbdcd2d","observation_id":"734ae11d-8940-409a-829e-942bf798e60d","resolution":{"observed_at":"2026-08-15T19:05:24.996794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.982867Z","title":"Openmic- 2018: An open data-set for multiple instrument recog- nition","venue":null,"work_id":"d9f537a2-3a68-4895-9b0e-3ad6ccf6d915","year":2018},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.501689Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:1444226a6436686e70d53e3a44090bf9a60a4013d7613a712b78c5cd73e4fca6","observation_id":"21779266-27ef-444d-b195-564795cad794","resolution":{"observed_at":"2026-08-15T19:05:24.986528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.972945Z","title":"Au- dio set: An ontology and human-labeled dataset for au- dio events,","venue":null,"work_id":"7e29f1e7-1200-4893-8222-b4144aa32ad2","year":2017},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.505425Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:21a6df54148b2d3a79e9b9d9e1be2d19f8e004cbae10fa28b9e4a0c9cbf9f3c3","observation_id":"5a8d1bfb-64a2-483c-88ca-6afd3997d80b","resolution":{"observed_at":"2026-08-15T19:05:24.976548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.963177Z","title":"Large-scale con- trastive language-audio pretraining with feature fu- sion and keyword-to-caption augmentation,","venue":null,"work_id":"61fb8b86-4aa9-424b-85cb-48efa87965c6","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.509144Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:bbecad641f836971265b290cefe48c55ae835adcdfbbd4b21f4bba4aa34ed965","observation_id":"6dfeda40-79a7-494c-9694-38b51eee4358","resolution":{"observed_at":"2026-08-15T19:05:24.966603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.953065Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classifica- tion and detection,","venue":null,"work_id":"cfd5bb41-7517-45c0-bc8b-2382557576d9","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.512532Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:66afafb0d1f3f014ed4e265a5aca786bb97dd9990572e8f7d4f89a3d5bdb0bb8","observation_id":"96f531be-00da-4d83-9902-c66d243b1e7d","resolution":{"observed_at":"2026-08-15T19:05:24.956689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T19:05:24.515729Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.515729Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:af0b6cb4b274f6265fcc4cb282786000abc3c881d335c74fc4708c34541d5083","observation_id":"d30969b4-bc60-4a9c-aac8-adaaff1a3403","resolution":{"observed_at":"2026-08-15T19:05:24.515729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.940520Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"d706c222-381c-4dbe-bce3-7233251f8751","year":2019},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.519228Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:63014ad94e3361069ffecdfe209a5a9f2b99d693bffe2b42b8e8b16b2532369e","observation_id":"8e1127da-c30f-40a1-b275-7cea13d8890c","resolution":{"observed_at":"2026-08-15T19:05:24.944957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01141","last_updated":"2022-08-01T21:10:38Z","snapshot_observed_at":"2026-08-22T17:40:33.096174Z","submitted_at":"2022-08-01T21:10:38Z","title":"SampleMatch: Drum Sample Retrieval by Musical Context","version":1},"cited_work":{"arxiv_id":"2208.01141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.01141","snapshot_observed_at":"2026-08-15T19:05:24.623041Z","title":"SampleMatch: Drum Sample Retrieval by Musical Context","venue":"cs.SD","work_id":"0b6d6fb4-b856-4b28-8d9d-c2e8d2ec02c7","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.522813Z"},"links":{"cited_paper":"/paper/2208.01141","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:6fbaf58b91a850ac14305b8b0f4ab3f35c164fac46685ccb50849879e44abbe6","observation_id":"9e64b67c-6dea-40c0-b0c1-56c26a9e8c97","resolution":{"observed_at":"2026-08-15T19:05:24.627520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.928726Z","title":"Ef- ficient training of audio transformers with patchout,","venue":null,"work_id":"9f106972-1425-4690-acbf-bee364fb1da8","year":2022},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.526185Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:d5d566985b3f9eb23ffaae0def0c3eb7eb6c91e594ae21b94de785778563c1e4","observation_id":"ebfbe100-1941-40cf-af50-81acce11737f","resolution":{"observed_at":"2026-08-15T19:05:24.932660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.916388Z","title":"Codified au- dio language modeling learns useful representations for music information retrieval,","venue":null,"work_id":"3380089b-03ee-49cf-a07d-b6c9d748e923","year":2021},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.529632Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:c8718e4156b4280c445eb23730eac7e789328d1221115df2dbc34e1f72c175e5","observation_id":"152b4d69-45a9-4465-99c3-c2914abb1c21","resolution":{"observed_at":"2026-08-15T19:05:24.920316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.904317Z","title":"Beats: audio pre- training with acoustic tokenizers,","venue":null,"work_id":"08c969c0-e187-4f3b-b3c3-70085eb898c7","year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.533197Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:3717e0f158d37deff67fff1d564b8a847cc87d8758eee1736cd1e598c9a064cd","observation_id":"e3fd9e40-625b-4cff-81c8-f805c4b88283","resolution":{"observed_at":"2026-08-15T19:05:24.908283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.894064Z","title":"Improving mu- sical accompaniment co-creation via diffusion trans- formers,","venue":null,"work_id":"d4d2b5fb-4639-44a4-920f-ec9729ecf095","year":2024},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.536755Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:3b46f25eed42f07a738fa9e5cb0f0fb1d23d84eb3bf2e692219b065ce80663a9","observation_id":"8dd8a42b-a280-4777-8b9c-6a106a4dc75e","resolution":{"observed_at":"2026-08-15T19:05:24.897654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.883000Z","title":"On the Language Encoder of Contrastive Cross-modal Models,","venue":null,"work_id":"e1530667-2909-4cd5-ac5f-e2e76df5a504","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.540240Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:cee9cbd0038d248a7ab4a5cce6c2e354b413d030561090602605f6f38c9f5460","observation_id":"ae633985-3e54-47d2-aaaa-ddaf82aaf8f8","resolution":{"observed_at":"2026-08-15T19:05:24.886541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-20T02:46:37.707168Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-15T19:05:24.546999Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.546999Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:1562a0e39c9d9692bced43ef313e4010a3d494264711b6599df7291937b0f560","observation_id":"9daf461b-eab3-46d9-8e7c-7a68f1a3d7a1","resolution":{"observed_at":"2026-08-15T19:05:24.546999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12262","last_updated":"2023-04-09T15:59:26Z","snapshot_observed_at":"2026-08-16T16:36:50.524531Z","submitted_at":"2022-08-25T17:59:58Z","title":"MaskCLIP: Masked Self-Distillation Advances Contrastive Language-Image Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12262","snapshot_observed_at":"2026-08-15T19:05:24.550981Z","title":"MaskCLIP: Masked Self- Distillation Advances Contrastive Language-Image Pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.550981Z"},"links":{"cited_paper":"/paper/2208.12262","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:4db507bc329ac0ada2d5478aff3dbbaf72c5515ebdbacd1ba1a4882468d79509","observation_id":"53dbd537-398e-4096-9456-24be9624bae7","resolution":{"observed_at":"2026-08-15T19:05:24.550981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:05:24.872420Z","title":"Available: http://arxiv.org/abs/2310","venue":null,"work_id":"5b129b42-0d9b-493d-a851-2343605a26ac","year":null},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.543409Z"},"links":{"citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:0260e36110f45687b470f28bc3e254d48c6bf1a514a46e9a2e67095c4eed5dc7","observation_id":"dcb24102-8f43-4882-b82f-cc24cc63e492","resolution":{"observed_at":"2026-08-15T19:05:24.876052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-21T08:40:21.248729Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":47},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2506.17815."}