{"as_of":"2026-08-20T22:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc276ec440c038b9e5303ec10266b6ad6888489b13565fa99897d04004492b9a","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:21:45.248236Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05831/citation-record","integrity":"/paper/2412.05831/integrity","json":"/paper/2412.05831/citation-record.json","paper":"/paper/2412.05831"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.691880Z","title":"Cbvmr: Content-based video-music retrieval using soft intra-modal structure constraint,","venue":null,"work_id":"6dde574e-885a-4215-b2d5-065caefe6ba6","year":2018},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.120483Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:4ab77ed7bf9d9e52e795566b28d65137f3bad9df9703a8481550ed60fa68fd3c","observation_id":"bb449eaf-2301-4268-9367-95989e861735","resolution":{"observed_at":"2026-08-11T20:21:45.697174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.675166Z","title":"Cross-modal music-video recommendation: A study of design choices,","venue":null,"work_id":"25c0e2f6-ffc8-43ab-9e71-6f91dbe21666","year":2021},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.126828Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:0eec06a74d178a5ffc674f39b5a40f9d8448a31cc3c74cfa7239fe520b70426c","observation_id":"f5f4363e-4e16-439a-801a-a63c9e3840f3","resolution":{"observed_at":"2026-08-11T20:21:45.680434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.658309Z","title":"Is there a","venue":null,"work_id":"959a3026-f760-4e5f-8537-ddf0175f7637","year":2021},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.132315Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:0a3fe8d353f9198bd57fbe3f13f75c7474e1dc4601e43753db615313a0f6bae0","observation_id":"c6af6665-5c07-4a42-82ee-5b0b736a97d4","resolution":{"observed_at":"2026-08-11T20:21:45.663486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.640655Z","title":"It’s time for artistic correspondence in music and video,","venue":null,"work_id":"f043f706-bfd9-4668-95d6-0918a2ecb0b5","year":2022},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.141179Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:551efd2ede096c72dc365283e8b7197f421c8b576cbe616dfb400be931767b25","observation_id":"27449000-beef-427e-9282-e4b6e83e1ee6","resolution":{"observed_at":"2026-08-11T20:21:45.645865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.146762Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.146762Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:1e4a0642a1f44a935f8fc8bf77d257ab6a877f352e454fb642462f3add76cbcb","observation_id":"38a289ed-55e0-4c7a-adfc-7045d6dcdabc","resolution":{"observed_at":"2026-08-11T20:21:45.146762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.611040Z","title":"Language-guided music recommendation for video via prompt analogies,","venue":null,"work_id":"5852c962-b4c5-4570-ab78-3fcab63f1fa6","year":2023},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.152079Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:c6b49690fdf421744bb2ec584ce919a84698c08695490a29837f1829157fc7de","observation_id":"87c840bb-2d31-4861-a70e-572cd4012f7f","resolution":{"observed_at":"2026-08-11T20:21:45.616596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.593817Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":"c258387a-e0e9-468d-bdf0-c884d8ac1ec4","year":2022},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.157783Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:d1e8c160a2fdd0efcbe34d84155bc4ded19272858f726dedf4892f00ed75e97e","observation_id":"9cd9c6ce-5e02-4100-a3df-2f65224f4608","resolution":{"observed_at":"2026-08-11T20:21:45.599208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.576516Z","title":"Contrastive audio- language learning for music,","venue":null,"work_id":"16fcc80d-a107-454b-a455-7cd7f67beaf1","year":2022},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.162532Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:08c10d271c5539e4892f9fe86a21e1e3428da2f76a847304abf505974ead85ac","observation_id":"839b6c45-13b0-48c1-aa9c-b6ca7a82b65d","resolution":{"observed_at":"2026-08-11T20:21:45.582209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.559194Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"7094ede7-eb10-4ffa-8e99-2ea0632b6c0b","year":2023},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.167403Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:32ed82032db1b8821af7b9e7e44ae60737f973fc6cc0ab8ff8cf4ee00cf3a660","observation_id":"46f0e205-ad4a-4668-a746-d986377aff5c","resolution":{"observed_at":"2026-08-11T20:21:45.564464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.543459Z","title":"Textless speech-to-music retrieval using emotion similarity,","venue":null,"work_id":"1a09e0da-0aab-4eb8-a030-6a08d803759f","year":2023},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.172472Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:8e67f9582592f0a091471d332a522474d91e7b442b5bf6ea9f023abe961047ca","observation_id":"ce8764b0-7571-4890-b2c9-5126d060ba8b","resolution":{"observed_at":"2026-08-11T20:21:45.548239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.526814Z","title":"Emotion-aligned contrastive learning between images and music,","venue":null,"work_id":"0b7ab303-fc30-44ca-9cba-47b4725498dc","year":2024},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.177502Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:c777bc3b115e36d22cd8d1d096578cd3706a10882d59f74c0694499136da3d5a","observation_id":"246ff8b7-8352-43c2-a5d1-7b7e745d4d3e","resolution":{"observed_at":"2026-08-11T20:21:45.532940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.510376Z","title":"Bridging high-quality audio and video via language for sound effects retrieval from visual queries,","venue":null,"work_id":"bd4c9b74-1763-4702-899d-dc4e5e4f439e","year":2023},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.182409Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:a8e91752e43dfb50cb96a6dac36e0a3851fd218141ec6575895a2fab5722b35e","observation_id":"aa6e237d-28f0-4c98-b99e-ea898419faf1","resolution":{"observed_at":"2026-08-11T20:21:45.515253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.493715Z","title":"Query by video: Cross-modal music retrieval,","venue":null,"work_id":"ac6c786c-7d1d-493a-9fe9-ed615649bef8","year":2019},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.187500Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:21ab48abc910723ea65a3a6e61192bf087eb8c88b683b4f1b17e870ba1e95978","observation_id":"87f43bf2-7912-433e-92ed-3b47121c36dd","resolution":{"observed_at":"2026-08-11T20:21:45.499166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.475095Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":"4dfc6eba-e392-41cc-a913-73e434f84765","year":2024},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.192570Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:42a9073ba81e50abd424fc2f3ba5e8299c613b8dfff674904e23cbdf12e6479c","observation_id":"8a1d4109-64f7-419f-a3c5-fae3900c02f8","resolution":{"observed_at":"2026-08-11T20:21:45.481239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.456435Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"dee5c47e-55db-487e-b066-52743feca5f4","year":2021},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.197738Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:915a1159a0255ff25e7c41bfbf91e80ffee8687e14a812a6abbb9bfbb40f73cb","observation_id":"5315cc00-07e9-4ec6-bf7b-31b9f8fee674","resolution":{"observed_at":"2026-08-11T20:21:45.461955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T20:21:45.202873Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.202873Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:07823845aa78073a8810d779bcf10a3c0d69e409970723307dbebd0c08dc2dee","observation_id":"9a90eb1a-149d-486b-b3c9-d111a5cbc16b","resolution":{"observed_at":"2026-08-11T20:21:45.202873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.438836Z","title":"Supervised contrastive learn- ing,","venue":null,"work_id":"88be65f0-46e0-4fef-bd37-bf60905bbf31","year":2020},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.209163Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:92375739ae7921c3643bffedcef58d06fcc347d0694f6315d94fe6d0e53c9290","observation_id":"4c4248c1-2fea-4f18-a459-441c48197366","resolution":{"observed_at":"2026-08-11T20:21:45.444341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.419408Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"c4ae2a0d-a854-466d-b5a1-58ddc09a9b53","year":2017},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.214156Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:0d709216dccda4b98bbb98211252a5ae244d761c86082bdcc231d3d9191fe464","observation_id":"dc021c04-d0be-413c-92b5-28d481b10248","resolution":{"observed_at":"2026-08-11T20:21:45.425481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-14T21:37:52.670253Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-11T20:21:45.219469Z","title":"Youtube-8m: A large-scale video classi- fication benchmark,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.219469Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:faf07a9ce2001b6fb956aeb7ea385c1aece219ebef4c49cbb75257e0210898d7","observation_id":"e1bb36fb-4eb3-4685-8bea-62196cbe658e","resolution":{"observed_at":"2026-08-11T20:21:45.219469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.401373Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"43491377-7a45-4992-ba7c-55584a4b05e8","year":2019},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.225626Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:c66138969f0bdfe6857051c3def87787271939f2ecc75ed7fe4042ad9a7482d0","observation_id":"d33b1025-da5c-431d-bb30-330bd096f8ac","resolution":{"observed_at":"2026-08-11T20:21:45.406609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.384054Z","title":"Wav2clip: Learning robust audio representations from clip,","venue":null,"work_id":"70de9bb4-4204-4efb-8294-01acc20caac0","year":2022},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.230673Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:cabfe6c0a15a69b4a361faa9f9d96bd4d53a7274cbdf9d5027917b5a235c4085","observation_id":"cebd0518-2118-4e0b-907d-5f280b6fcbe6","resolution":{"observed_at":"2026-08-11T20:21:45.389454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.365814Z","title":"Audioclip: Extending clip to image, text and audio,","venue":null,"work_id":"f598d3cf-ff97-44d7-8c3b-5cc2e69c9a87","year":2022},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.236467Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:8a5a5c7cb35bd7d35d3fb16472ad17d2eb171c767f6104eb2f9a131ffe5e34ca","observation_id":"e8927204-5729-4347-aa63-2d6b62883056","resolution":{"observed_at":"2026-08-11T20:21:45.371868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.347776Z","title":"Emotion embedding spaces for matching music to stories,","venue":null,"work_id":"0923469a-c27f-4ef5-a755-b93f626a14b9","year":2021},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.243223Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:29808febd48eaf313d3160b9954d7885d360b7a81cfa191e73f3be02b7c6bbd3","observation_id":"056ff467-4796-400f-9baa-23b753fcbc4d","resolution":{"observed_at":"2026-08-11T20:21:45.353573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:21:45.328105Z","title":"Vggsound: A large- scale audio-visual dataset,","venue":null,"work_id":"48e0bd1e-6627-4ac1-ba36-92a29614d4b5","year":2020},"citing_paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:45.248236Z"},"links":{"citing_paper":"/paper/2412.05831"},"observation_digest":"sha256:ee6c3e557d2ad4f72a2517df7c102020882703ba9236a1412757ff3ce4f9f18d","observation_id":"27f1c0d7-b391-4ae3-8296-0644829dff74","resolution":{"observed_at":"2026-08-11T20:21:45.335525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05831","last_updated":"2024-12-23T02:52:36Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-20T19:48:04.231335Z","submitted_at":"2024-12-08T06:37:27Z","title":"Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2412.05831."}