{"as_of":"2026-08-07T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eee8f199b47c7173100cb06c96a7abca3ecfcf107fc1d2ea18f257c4bdeec4d9","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:49:47.983763Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:49:40.786176Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:49:50.392438Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"cited_work":{"arxiv_id":"2506.12573","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12573","snapshot_observed_at":"2026-08-07T00:49:50.392438Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","venue":"cs.SD","work_id":"5980dcb3-853d-4b77-92ec-216f333935f7","year":2025},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:40.786176Z"},"links":{"cited_paper":"/paper/2506.12573","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:d390917fea2aabdf690014473a223528cc020313cbc846110b20ee6863d898f7","observation_id":"5af4092a-926b-44ce-b64d-34ac5cdc75e5","resolution":{"observed_at":"2026-08-07T00:49:50.536973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12573/citation-record","integrity":"/paper/2506.12573/integrity","json":"/paper/2506.12573/citation-record.json","paper":"/paper/2506.12573"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"cited_work":{"arxiv_id":"2506.12573","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12573","snapshot_observed_at":"2026-08-07T00:49:50.392438Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","venue":"cs.SD","work_id":"5980dcb3-853d-4b77-92ec-216f333935f7","year":2025},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:40.786176Z"},"links":{"cited_paper":"/paper/2506.12573","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:d390917fea2aabdf690014473a223528cc020313cbc846110b20ee6863d898f7","observation_id":"5af4092a-926b-44ce-b64d-34ac5cdc75e5","resolution":{"observed_at":"2026-08-07T00:49:50.536973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:40.864936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:40.864936Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:ad0d29580a4b09a8276db3ea793acfc779f4d770a57132a3fd265a855c2ec274","observation_id":"ad5fa3ec-dacf-498f-bb97-38acd2d4cd7b","resolution":{"observed_at":"2026-08-07T00:49:40.864936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:40.950159Z","title":"We provide an overview of the comparison of video-music datasets in Table 1 and an illustration of our dataset con- struction methodology in Figure 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:40.950159Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:6c6378c4b9ad00ae4d990babf32c3ad9ca0c939cb19e345a116ab6bae0af72c9","observation_id":"5a892216-9ee5-4236-be83-f39bfade8dd6","resolution":{"observed_at":"2026-08-07T00:49:40.950159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:41.045157Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.045157Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:5f6edb1f6e1dd5d7e3b356e226bd026a0aabbe965543b0dba8cc4c7f1c8ddd4a","observation_id":"96cf67e9-1b5d-4273-8464-6b780233dcf4","resolution":{"observed_at":"2026-08-07T00:49:41.045157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0045.3133","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:50.108207Z","title":"S” and “M","venue":null,"work_id":"ae8eaac8-6d32-493a-905a-2a606a1d07ef","year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.120789Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:62c23823f31fe1691cd6085dab9f4c858220dab9fbdd5ebf00244c997bee2cce","observation_id":"2749241b-9bb3-4ded-8c1c-40b2dd661c27","resolution":{"observed_at":"2026-08-07T00:49:50.232025Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:41.198985Z","title":"Distributional FidelityOur evaluation on OES-Com re- veals that fine-tuning on OSSL enhances distributional fi- delity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.198985Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:3238056c5776a9db5b80a67e1641fb9ac755e4116d3ff51bdcb71f8f1d0719f8","observation_id":"2ccb242a-283f-46be-99c7-458adbebe840","resolution":{"observed_at":"2026-08-07T00:49:41.198985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:57.559269Z","title":"To show the effectiveness of our dataset, we adapted a text-to-music generation model with video conditions and fine-tuned it on our dataset","venue":null,"work_id":"36e4d3f1-e587-420c-8749-55410fb578f4","year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.272353Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:17218430e7cfc183d6045b6877736db69b793890fca26ded90ce320641631431","observation_id":"330770bb-000c-4f02-bfd3-07d4e36c92cf","resolution":{"observed_at":"2026-08-07T00:49:57.630279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:57.470363Z","title":null,"venue":null,"work_id":"0ae464e2-54ca-44d3-b287-9843a6197a44","year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.339642Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:34411b55dfbff2bd9342a7cc2f3e49813e1c09440fd88ef5839f22657eb14fad","observation_id":"aa0b77f5-740f-4a30-94a9-5bef220bc6b6","resolution":{"observed_at":"2026-08-07T00:49:57.502642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:57.395817Z","title":"Soundtrack design: The impact of music on visual attention and affective responses,","venue":null,"work_id":"35266767-7da2-4843-883a-c039e220b20a","year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.417326Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:52c994ac5c18102a6a76387151bf8f73f4eb6f6cd6b8a5c646266f2add0b163e","observation_id":"a2b075f8-ad4d-41ad-9f10-d69886d45ea0","resolution":{"observed_at":"2026-08-07T00:49:57.424060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:57.296200Z","title":"Multimodal deep models for predicting affective responses evoked by movies","venue":null,"work_id":"d20bf162-acac-4615-8f43-ede4304dee92","year":2019},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.494318Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:d81de82f76763a002dee53044715cfd751eab89c8a3dc07c76f4d15513779808","observation_id":"931c243d-a0be-450f-8fe9-b6abb48a5c18","resolution":{"observed_at":"2026-08-07T00:49:57.347541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13468","last_updated":"2021-11-26T12:31:41Z","snapshot_observed_at":"2026-07-06T12:12:25.898094Z","submitted_at":"2021-11-26T12:31:41Z","title":"Emotion Embedding Spaces for Matching Music to Stories","version":1},"cited_work":{"arxiv_id":"2111.13468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.13468","snapshot_observed_at":"2026-08-07T00:49:49.701206Z","title":"Emotion Embedding Spaces for Matching Music to Stories","venue":"cs.IR","work_id":"6b519b09-cda4-4521-9c6e-733a2a8860ba","year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.584055Z"},"links":{"cited_paper":"/paper/2111.13468","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:72ffa8d16f91f0f7142ded84494e70406690fec4a531b6a0e23c504c6575fa41","observation_id":"65756565-9c31-4f5b-acc1-9927be466874","resolution":{"observed_at":"2026-08-07T00:49:49.863527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:57.166863Z","title":"Attendaffectnet–emotion prediction of movie viewers using multimodal fusion with self-attention,","venue":null,"work_id":"8b961a17-0e66-4ea3-963d-aed77b51991f","year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.662550Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:f8bd7a90e49d139979fd628acd03b02daeefbd077e01e25fc526342851e28ca2","observation_id":"2d14e174-ec1a-42a6-8b9b-228347da9a6f","resolution":{"observed_at":"2026-08-07T00:49:57.192060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10453","last_updated":"2022-02-19T07:36:43Z","snapshot_observed_at":"2026-07-06T12:40:09.526739Z","submitted_at":"2022-02-19T07:36:43Z","title":"Predicting emotion from music videos: exploring the relative contribution of visual and auditory information to affective responses","version":1},"cited_work":{"arxiv_id":"2202.10453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.10453","snapshot_observed_at":"2026-08-07T00:49:49.380601Z","title":"Predicting emotion from music videos: exploring the relative contribution of visual and auditory information to affective responses","venue":"cs.CV","work_id":"f2730801-5db7-4e5a-8897-82639c71ded2","year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.739826Z"},"links":{"cited_paper":"/paper/2202.10453","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:58dbc289118ee02985ba99dda3f595a0833638c3f0d3464f16f8e705197496e2","observation_id":"24dc64c5-acca-4af7-92cb-6137c395ebaa","resolution":{"observed_at":"2026-08-07T00:49:49.551873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:57.089570Z","title":"Analysis of the roles of film soundtracks in films,","venue":null,"work_id":"eec6ea8a-8dbb-433d-8d5b-ace1d1abd95c","year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.820319Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:f8fcf71f9adc98b56957b71ab2df9756855f0cb12b8a5946f9be573d969fc02f","observation_id":"4b747be7-3c98-4c30-ba78-447e0aa5feb9","resolution":{"observed_at":"2026-08-07T00:49:57.116682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:56.794116Z","title":"Actions in context,","venue":null,"work_id":"049fee2f-5f56-4115-a60f-e14125ee4958","year":2009},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.884556Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:30d1b6ca789e3abae792d16f4a6b532e36d6859d19df03776ac1437b25f876d6","observation_id":"7f35f1ab-b34e-4616-b036-c2cfcc4bb411","resolution":{"observed_at":"2026-08-07T00:49:56.941092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:56.608068Z","title":"Movieqa: Understanding stories in movies through question-answering,","venue":null,"work_id":"d6724d68-e334-40fb-8182-44fa892ea26f","year":2016},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:41.963832Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:4d1bd22e31858df0a5a9976843a6ecafe61c7c0da218aad638187a8a4c5dde7a","observation_id":"57e6cdd2-bd3f-4ded-a1b7-431a494383cb","resolution":{"observed_at":"2026-08-07T00:49:56.692466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:56.419353Z","title":"Movienet: A holistic dataset for movie understand- ing,","venue":null,"work_id":"d6aa115a-d417-438c-8290-60a9ad1a71fe","year":2020},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.035597Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:8655994fda92e10eb90b4a9ebb37ac9a7ebcbaf88bb41f238e388f6c14b4de11","observation_id":"178f64c9-084c-4961-8dd7-9428a98bcc0f","resolution":{"observed_at":"2026-08-07T00:49:56.534391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:56.332371Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions,","venue":null,"work_id":"63931920-223f-4602-905f-624d425a0abd","year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.103527Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:231124a8befcb81917f7fa98df5b46ee14019c27faaa4b420dfa842604f5001e","observation_id":"8255ea0f-8c7d-4a2e-a083-578fb835f1e5","resolution":{"observed_at":"2026-08-07T00:49:56.367972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:56.212890Z","title":"A dataset for movie description,","venue":null,"work_id":"453a5113-b650-4881-a053-bff4f1d74087","year":2015},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.197524Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:7653b765c927a0d8b1d2db4b4aff0adb2589047fbb36875935272ae37681703d","observation_id":"9f955c11-efdf-4d39-8a82-67e5f90dbc62","resolution":{"observed_at":"2026-08-07T00:49:56.278451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:56.065268Z","title":"Moviegraphs: Towards understanding human-centric situations from videos,","venue":null,"work_id":"5461607a-92ca-479b-9582-f25ca1c7b945","year":2018},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.279348Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:de88cbaf4c4ad6c9eec4cb06dde18903c32a718887e944ea694e6dbc3b42f9eb","observation_id":"f61528fb-e050-4ddf-bbf7-9f2c67e5fc0b","resolution":{"observed_at":"2026-08-07T00:49:56.112885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.976662Z","title":"Hlvu: A new challenge to test deep understanding of movies the way humans do,","venue":null,"work_id":"fa66358f-3b1a-4cc0-acd0-61976646c187","year":2020},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.366444Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:bfcd8657d5c5c62213936b79a3e1aa22871139854b0a870327b70e5deabf62b0","observation_id":"9086561a-5ce8-448d-84b3-30760610658f","resolution":{"observed_at":"2026-08-07T00:49:56.021400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.806054Z","title":"Condensed movies: Story based retrieval with contex- tual embeddings,","venue":null,"work_id":"8df81ec3-081a-4f7e-9bab-9be5dd73d6b7","year":2020},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.445904Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:0ff908dc8336230901c1e975a04c7ba40527c13ecd86195991774b3db6e2187a","observation_id":"3237553e-2891-420a-abb0-136945d11bf6","resolution":{"observed_at":"2026-08-07T00:49:55.920877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05586","last_updated":"2024-11-10T02:20:47Z","snapshot_observed_at":"2026-08-06T09:11:18.171594Z","submitted_at":"2024-10-08T01:00:09Z","title":"TeaserGen: Generating Teasers for Long Documentaries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05586","snapshot_observed_at":"2026-08-07T00:49:42.511515Z","title":"Teasergen: Generating teasers for long documentaries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.511515Z"},"links":{"cited_paper":"/paper/2410.05586","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:c17b0d0ae4c54049501be57534ea34a3d069c8aab7ee121c27659cf52b50d942","observation_id":"4799cefd-2193-40fc-a7d3-0a70dd655e0d","resolution":{"observed_at":"2026-08-07T00:49:42.511515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.738050Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"6a7c5407-095e-413f-919e-cc7cec44da82","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.599104Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:26a4fd6ded3c7a0a14773a9f415d7b9932ff34dd3c95e139f1f4b601865616c9","observation_id":"a9178205-829d-4963-b251-0bb2ad2877d2","resolution":{"observed_at":"2026-08-07T00:49:55.764831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:42.675447Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.675447Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:096d00e697904e04d14c3a1f1a3a50d6ed7de9b3adefb95f67e20720f8c8ab99","observation_id":"f1a5fa92-d749-4ce4-9143-a20f91670f51","resolution":{"observed_at":"2026-08-07T00:49:42.675447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T00:49:42.750717Z","title":"Musiclm: Generat- ing music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.750717Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:e309c428f5f5fa144230c8f6f99c21dc0878e826471f0030864e5676b145091f","observation_id":"f47ca879-4b18-487b-9530-1e89f691e266","resolution":{"observed_at":"2026-08-07T00:49:42.750717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15060","last_updated":"2024-07-21T05:27:53Z","snapshot_observed_at":"2026-08-05T22:36:17.342102Z","submitted_at":"2024-07-21T05:27:53Z","title":"MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15060","snapshot_observed_at":"2026-08-07T00:49:42.827934Z","title":"Musicongen: Rhythm and chord control for transformer-based text-to-music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.827934Z"},"links":{"cited_paper":"/paper/2407.15060","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:438cd6cf2bc631e5bd5594f4b7d8ae5d42c4349c62599cd72b933c101bc4764e","observation_id":"744cb494-a203-4312-a521-fafac7c164da","resolution":{"observed_at":"2026-08-07T00:49:42.827934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04321","last_updated":"2025-05-07T15:59:51Z","snapshot_observed_at":"2026-08-06T11:22:41.689160Z","submitted_at":"2024-06-06T17:58:11Z","title":"VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04321","snapshot_observed_at":"2026-08-07T00:49:42.900461Z","title":"Vidmuse: A simple video-to- music generation framework with long-short-term mod- eling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.900461Z"},"links":{"cited_paper":"/paper/2406.04321","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:84d6f92e80560167e8a9cdbb89d05a6ebd8a403a170d7868a3f4d5fd49bf4473","observation_id":"1450699d-fda3-4db1-be6d-12e8ad47a34d","resolution":{"observed_at":"2026-08-07T00:49:42.900461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.561262Z","title":"V2meow: Meowing to the visual beat via video-to- music generation,","venue":null,"work_id":"2156d821-dee5-488d-8957-959460f90fc6","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:42.977529Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:749cbe1abce6ce0e3cf52b3187781d58fe60c2b32f6d25fe1d53200e67c466db","observation_id":"f33b4d9b-4689-465d-bb03-a5353cfe780b","resolution":{"observed_at":"2026-08-07T00:49:55.665078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09972","last_updated":"2025-01-17T06:30:11Z","snapshot_observed_at":"2026-07-06T20:22:19.281265Z","submitted_at":"2025-01-17T06:30:11Z","title":"GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions","version":1},"cited_work":{"arxiv_id":"2501.09972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09972","snapshot_observed_at":"2026-08-07T00:49:49.179124Z","title":"GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions","venue":"cs.SD","work_id":"671e4455-7645-4dd4-a59a-8ec160a1b337","year":2025},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.064927Z"},"links":{"cited_paper":"/paper/2501.09972","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:d7bc9fed96f3f481eae44b8da07f6ef574085cd80b36b8d90cbca0c70c2384bf","observation_id":"ab03e73b-0eb7-424e-86c1-3955da2955bd","resolution":{"observed_at":"2026-08-07T00:49:49.247373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.384662Z","title":"Riffusion-stable diffusion for real-time music generation,","venue":null,"work_id":"c320274f-ce13-4ef9-a3b1-8055355ca1d4","year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.156770Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:4e5ddc346a7484eb3960d8af35b622349cc6f94590b123125b565ae6597e20d0","observation_id":"7f8710a4-62bd-4f3e-ab57-14e14f6e0164","resolution":{"observed_at":"2026-08-07T00:49:55.456481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-07T00:49:43.230631Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.230631Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:b9fca492a11ba6044d5b47414b187cb9ca22c828aca556d7da1b3f959c83f5e4","observation_id":"92b97fe1-1c0a-456e-a812-f804e48e40f9","resolution":{"observed_at":"2026-08-07T00:49:43.230631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11757","last_updated":"2023-10-23T20:47:30Z","snapshot_observed_at":"2026-07-06T14:45:19.481734Z","submitted_at":"2023-01-27T14:52:53Z","title":"Mo\\^usai: Text-to-Music Generation with Long-Context Latent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11757","snapshot_observed_at":"2026-08-07T00:49:43.294050Z","title":"Mo\\ˆ usai: Text-to-music generation with long-context latent diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.294050Z"},"links":{"cited_paper":"/paper/2301.11757","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:69da05a9a0274882a1d0155db53c24e678e39708c9c69eac006d66bc6ffcf8ab","observation_id":"ff44a7fe-ccb8-437f-a06d-699d6dba7156","resolution":{"observed_at":"2026-08-07T00:49:43.294050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.205208Z","title":"Efficient neu- ral music generation,","venue":null,"work_id":"655f85f3-6726-435f-8181-0e64a588376a","year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.347990Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:82064000e3a522b4b80984e13e324086c493203d971cb791b72debee708d4e69","observation_id":"41e83f31-e1a9-4b62-9f2b-e0d367cf7fda","resolution":{"observed_at":"2026-08-07T00:49:55.286800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-06T19:39:54.540216Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-07T00:49:43.437966Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.437966Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:b7f038926fe9e870c1697b02424432dde7864d58325bcab7e7c8188a267c2d68","observation_id":"712b6267-1f37-4ea1-94e7-9cfb31d71bfd","resolution":{"observed_at":"2026-08-07T00:49:43.437966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02845","last_updated":"2024-10-23T12:12:44Z","snapshot_observed_at":"2026-08-04T03:30:22.099074Z","submitted_at":"2024-09-04T16:17:41Z","title":"Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model","version":3},"cited_work":{"arxiv_id":"2409.02845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02845","snapshot_observed_at":"2026-08-07T00:49:48.888044Z","title":"Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model","venue":"cs.SD","work_id":"d08b883d-a2a3-400a-a59c-1a4324dbc294","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.507489Z"},"links":{"cited_paper":"/paper/2409.02845","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:dcea6f62ffc6ff7054973214797d9b150449b08ab7d84c10d304f7848c466179","observation_id":"c168ce5b-df36-4fc9-a7bb-213c000ebc30","resolution":{"observed_at":"2026-08-07T00:49:48.971726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-07T00:49:43.573592Z","title":"Stable audio open,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.573592Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:e0b4cdeef4798aed5c63a0c165fe7c69172bd3bbfd2637f27168eaa9ca50295d","observation_id":"7e3009df-3e6b-43a6-a441-32a41699f533","resolution":{"observed_at":"2026-08-07T00:49:43.573592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07450","last_updated":"2024-09-11T17:56:48Z","snapshot_observed_at":"2026-07-06T19:13:55.363649Z","submitted_at":"2024-09-11T17:56:48Z","title":"VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07450","snapshot_observed_at":"2026-08-07T00:49:43.639290Z","title":"Vmas: Video-to-music generation via se- mantic alignment in web music videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.639290Z"},"links":{"cited_paper":"/paper/2409.07450","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:cc9cc2788021fd7d772b14c615cbc47195ec8ed9703194aa5fcd5ad88ab96c0d","observation_id":"d9d5c618-8e40-4ceb-a172-1711575d2e26","resolution":{"observed_at":"2026-08-07T00:49:43.639290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-07T00:49:43.716277Z","title":"Muvi: Video-to-music generation with semantic align- ment and rhythmic synchronization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.716277Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:24a269e6eb8458bb20a9d053e725519a7acb0f7f69599c1fd325cae5785cdeba","observation_id":"92882141-7d2d-423f-9e38-e178bfac7bf1","resolution":{"observed_at":"2026-08-07T00:49:43.716277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10970","last_updated":"2024-06-16T15:06:06Z","snapshot_observed_at":"2026-07-06T18:31:45.125236Z","submitted_at":"2024-06-16T15:06:06Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10970","snapshot_observed_at":"2026-08-07T00:49:43.791478Z","title":"Joint audio and symbolic conditioning for temporally controlled text-to-music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.791478Z"},"links":{"cited_paper":"/paper/2406.10970","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:52182ca56fac9b589dc9f5f322e34d7dcfc4dec7d1d2319c1595304f821ab94e","observation_id":"9b963403-04a1-475c-bfe0-7f4522db4f95","resolution":{"observed_at":"2026-08-07T00:49:43.791478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:55.053298Z","title":"Music controlnet: Multiple time-varying controls for music generation,","venue":null,"work_id":"fe17f7bf-037a-4e2c-a294-99ad187ad622","year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.880967Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:f2847205bcd674958b47f89a7806e4097a3c1facc29c98649796d4772d19d2e9","observation_id":"7611343f-ec97-4eca-803e-ef17b1d82238","resolution":{"observed_at":"2026-08-07T00:49:55.092002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:54.928199Z","title":"DITTO: Diffusion inference-time t- optimization for music generation,","venue":null,"work_id":"a1e68452-8210-416a-9f66-3aafc1aa84d3","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.945081Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:afe23dbcd1f978e62b4cc555bdaa126a3a8f4753e0d59a2476496659601707b8","observation_id":"2e6b4824-b7d1-43fb-a24f-ddec9c5092af","resolution":{"observed_at":"2026-08-07T00:49:54.987129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:54.802612Z","title":"DITTO-2: Distilled diffusion inference-time t-optimization for music generation,","venue":null,"work_id":"17f4041c-6337-4b35-bb95-7490196875a6","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.026351Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:bedc8d932def206ae04f16f38bbe0a59c3b9e60937eb42f45cfa39a8fe6d5a30","observation_id":"6d17aff5-b6c0-460a-bd6a-44a3e4baf800","resolution":{"observed_at":"2026-08-07T00:49:54.851023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-07T00:49:44.099128Z","title":"Mumu-llama: Multi-modal music understanding and generation via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.099128Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:9c36653749ef92f24c7bfd5a896e0883579bdf9bde20e1bcd599e9a496322563","observation_id":"29b928b4-861d-4832-8757-7750994f7a18","resolution":{"observed_at":"2026-08-07T00:49:44.099128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09428","last_updated":"2024-12-12T16:33:21Z","snapshot_observed_at":"2026-08-02T04:30:21.895249Z","submitted_at":"2024-12-12T16:33:21Z","title":"Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09428","snapshot_observed_at":"2026-08-07T00:49:44.175395Z","title":"Multimodal music generation with explicit bridges and retrieval aug- mentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.175395Z"},"links":{"cited_paper":"/paper/2412.09428","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:1bc1fa8ad0f91796c11d266dd8f9bcc1006f5d803ab49aa7ac2edaf46858e650","observation_id":"b0d5dc2d-5a3c-431a-b6cc-59798dfe8b86","resolution":{"observed_at":"2026-08-07T00:49:44.175395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:54.661058Z","title":"Foley music: Learning to generate music from videos,","venue":null,"work_id":"1362bed2-825b-48da-ac91-ce4d8d3716a3","year":2020},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.227354Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:0eaa0c370046631349e6a0d9158f9c908a4a13b0f3876ec2b3e3ce76635f5a55","observation_id":"6ff4f4fd-722b-4618-8a9d-efd043432fe7","resolution":{"observed_at":"2026-08-07T00:49:54.708344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:44.292165Z","title":"Video background music generation with controllable music transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.292165Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:86cf9e734b08a616100a4ce281e602dbe655442da78080ca0558b39042589011","observation_id":"333a7a68-750d-4f41-8e71-6270ce04784c","resolution":{"observed_at":"2026-08-07T00:49:44.292165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:54.199958Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"820c57cd-9a7e-457b-9667-259dcbfe047d","year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.438782Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:b5b5cfafdbf4b1c1e4d68bb61c8c83678696cd15262f61cdcb7d29934c93af35","observation_id":"34a5a28c-d19a-423c-8526-5ea63f78a210","resolution":{"observed_at":"2026-08-07T00:49:54.286387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:44.522171Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.522171Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:8d28d404c997576573adcb5e0dd18f7b4e28538cce35c0fe3f3a62b4617e17ab","observation_id":"e1f7b1d7-f835-4570-92d1-e247baee4a2a","resolution":{"observed_at":"2026-08-07T00:49:44.522171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00247","last_updated":"2021-01-26T12:54:33Z","snapshot_observed_at":"2026-07-06T09:16:48.444854Z","submitted_at":"2020-05-01T07:03:42Z","title":"AdapterFusion: Non-Destructive Task Composition for Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00247","snapshot_observed_at":"2026-08-07T00:49:44.596943Z","title":"Adapterfusion: Non-destructive task composition for transfer learning,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.596943Z"},"links":{"cited_paper":"/paper/2005.00247","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:9bd997afea8877f85ec96d6df2ee19e56d9696915724abbe0e73f219e511c459","observation_id":"7e28f1b3-58b5-4aa7-a2d5-331bf2c35972","resolution":{"observed_at":"2026-08-07T00:49:44.596943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.07779","last_updated":"2020-10-06T10:16:39Z","snapshot_observed_at":"2026-07-06T09:38:29.271727Z","submitted_at":"2020-07-15T15:56:05Z","title":"AdapterHub: A Framework for Adapting Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.07779","snapshot_observed_at":"2026-08-07T00:49:44.690125Z","title":"Adapterhub: A framework for adapting transformers,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.690125Z"},"links":{"cited_paper":"/paper/2007.07779","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:c8b7110983d8863bdc28ac81e4e1b3b57c89307450b44c9e6946783c70f5bf72","observation_id":"98494540-e731-4a61-96b1-884d338d1334","resolution":{"observed_at":"2026-08-07T00:49:44.690125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T00:49:44.750532Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.750532Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:ac862be7e52a51c7e24f2edb43ab86974eb3123e448bd879c326bec197ca032d","observation_id":"32c0adc6-f711-46ee-acfb-e46541056b6c","resolution":{"observed_at":"2026-08-07T00:49:44.750532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:53.943440Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models,","venue":null,"work_id":"2158e92c-35df-44c7-841d-00f8b136ce9f","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.833785Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:6db897a58ce24677dad35317d17d1a8bbf9f1fe34256f9cb21d4703c1a017f07","observation_id":"72702529-6ad2-48f3-9b62-3d1570f1714b","resolution":{"observed_at":"2026-08-07T00:49:54.107266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16564","last_updated":"2024-07-24T11:12:15Z","snapshot_observed_at":"2026-08-06T00:15:58.284834Z","submitted_at":"2024-07-23T15:16:18Z","title":"Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16564","snapshot_observed_at":"2026-08-07T00:49:44.938203Z","title":"Audio prompt adapter: Unleashing music editing abilities for text- to-music with lightweight finetuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.938203Z"},"links":{"cited_paper":"/paper/2407.16564","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:389edec1466eca4c6733c02be6b81519caa1ea8c1ecac9551b5ee5a48206d718","observation_id":"ce65a2d3-06f7-4f66-9924-d8574cc2a9e5","resolution":{"observed_at":"2026-08-07T00:49:44.938203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06761","last_updated":"2017-09-01T14:08:06Z","snapshot_observed_at":"2026-08-02T07:33:08.432322Z","submitted_at":"2017-04-22T07:40:16Z","title":"Content-Based Video-Music Retrieval Using Soft Intra-Modal Structure Constraint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06761","snapshot_observed_at":"2026-08-07T00:49:45.008013Z","title":"Content- based video-music retrieval using soft intra-modal structure constraint,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.008013Z"},"links":{"cited_paper":"/paper/1704.06761","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:ca39a39f6c673fb974fdf93450b143d8eb945115d187a1e70809d313f8440930","observation_id":"c0c004cf-0283-4c5d-9f20-94aaf665c911","resolution":{"observed_at":"2026-08-07T00:49:45.008013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:45.121557Z","title":"Creating a multitrack classical music performance dataset for multimodal music analysis: Challenges, insights, and applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.121557Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:647556aadd2635f7b0043607764efa936a76cff01aa1a1f8fad820c9dea996ed","observation_id":"62e97fff-57f7-4bc8-8b5a-1aa173c5c3ae","resolution":{"observed_at":"2026-08-07T00:49:45.121557Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00604","last_updated":"2022-07-19T17:17:14Z","snapshot_observed_at":"2026-08-07T05:15:16.015002Z","submitted_at":"2022-04-01T17:53:39Z","title":"Quantized GAN for Complex Music Generation from Dance Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00604","snapshot_observed_at":"2026-08-07T00:49:45.246773Z","title":"Quantized gan for complex music generation from dance videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.246773Z"},"links":{"cited_paper":"/paper/2204.00604","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:be23463f1f6c6a6f59ad1bd38bf3d4f851fe53f86d8567fd5ef16851e0144d0f","observation_id":"cb5d3735-9a17-41c5-9b44-bd2b4875388b","resolution":{"observed_at":"2026-08-07T00:49:45.246773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08779","last_updated":"2021-07-31T00:44:02Z","snapshot_observed_at":"2026-08-05T04:34:31.332053Z","submitted_at":"2021-01-21T18:59:22Z","title":"AI Choreographer: Music Conditioned 3D Dance Generation with AIST++","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08779","snapshot_observed_at":"2026-08-07T00:49:45.341616Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.341616Z"},"links":{"cited_paper":"/paper/2101.08779","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:2f906b1244aa11799d3a37a9b384a44216161c6bab8eb9e2557b009f2cad3562","observation_id":"50e3b075-93b3-4d87-b3f2-18ffe2df324f","resolution":{"observed_at":"2026-08-07T00:49:45.341616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:54.407646Z","title":"Video back- ground music generation: Dataset, method and evalu- ation,","venue":null,"work_id":"6cb9d8e6-0cc6-4d4f-babb-2250c68d6f35","year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.429434Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:d0b099f249327a6ebb484aa74b1c51ad0b6757bf478a6bac0f5cbff8d5c50007","observation_id":"e25abf34-5f26-4e9a-8f49-7743e2818e36","resolution":{"observed_at":"2026-08-07T00:49:54.547185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:53.607736Z","title":"Video2music: Suitable music generation from videos using an affective multimodal transformer model,","venue":null,"work_id":"4c1fecc9-7b54-4d8e-95b1-d98278fa1c0d","year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.523930Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:93b1512a47885df52228bc758d2b01dbeabef9f20a1d8326be924a57750c542a","observation_id":"e3261b1c-afce-44ca-b1f9-9cf8749ed34e","resolution":{"observed_at":"2026-08-07T00:49:53.721432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T00:49:46.834553Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.834553Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:ba7349dbb0d7237d1e29c735e397633fef83793fc4a89ff120759a3315ace46a","observation_id":"5c29d675-b417-483e-b7db-5049e09cea7e","resolution":{"observed_at":"2026-08-07T00:49:46.834553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:53.347867Z","title":"Diff- bgm: A diffusion model for video background music generation,","venue":null,"work_id":"3eb75461-69e6-49c6-a9a4-543518a0fb64","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.792613Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:e11d7c9ccfc595126ae5cf698dafd573a8e7bb9d1851c2d293aa9e0b20cff4e5","observation_id":"b536ca68-8cc5-4f46-b632-2d4f528d1b24","resolution":{"observed_at":"2026-08-07T00:49:53.453381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:53.071546Z","title":"The nes video-music database: A dataset of symbolic video game music paired with gameplay videos,","venue":null,"work_id":"7f3d182c-f78a-4730-9748-b41674737c48","year":null},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.876102Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:0ef34977e3fc8148499b8b8d3ea3a040d0776df639d56eaafe767c67e2164aa9","observation_id":"ed757164-55b8-47f6-a5e6-548e964111ed","resolution":{"observed_at":"2026-08-07T00:49:53.215919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9921.36500","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:48.387531Z","title":null,"venue":null,"work_id":"a1e56372-1a58-46f6-bbb2-dffb7b495923","year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.996145Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:7ea678711561b46aba24f7889f450e7a40cdbfa6043aeefd5f5021cf44f7ef7e","observation_id":"4a9c785d-d9ee-4467-81df-a3c8c7f3d811","resolution":{"observed_at":"2026-08-07T00:49:48.478189Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:52.831136Z","title":"Benchmarks and leaderboards for sound demixing tasks,","venue":null,"work_id":"0870581c-c756-4a68-9709-34e5f41bdffa","year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.099559Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:00915fec0fe28a50a33738af280389cfd2e1319a2b7e2187b533820e2d0ab6c8","observation_id":"e34b0e31-a537-43d3-a04c-e3180ff025b9","resolution":{"observed_at":"2026-08-07T00:49:52.959182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:52.430120Z","title":"pyaudioanalysis: An open-source python library for audio signal analysis,","venue":null,"work_id":"1ce31f51-e1ab-4fb1-ad5d-d2aa49bc769b","year":2015},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.248153Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:13cff208972e9bb3b694015cdd6b1fce4f388c95f36a51923cb5e0c8b91f5659","observation_id":"a7b7110e-f6db-48df-8c8f-0f298f8ce98e","resolution":{"observed_at":"2026-08-07T00:49:52.616912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:46.378501Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.378501Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:8506e3ddb73edd4803d2d92660aa317346679107fa9c263d2c88e1ae4f853bed","observation_id":"9dfd5c2b-5a9e-4eef-a362-a5f81764df87","resolution":{"observed_at":"2026-08-07T00:49:46.378501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:46.500264Z","title":"A circumplex model of affect","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.500264Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:04788a67f13dbccf5e915e9c3ebf343054fc965ab138b94f0290db810161998c","observation_id":"50cc1ea6-278d-4b79-96b4-68bbdbe10c97","resolution":{"observed_at":"2026-08-07T00:49:46.500264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01374","last_updated":"2021-08-03T08:59:26Z","snapshot_observed_at":"2026-07-06T11:35:04.274714Z","submitted_at":"2021-08-03T08:59:26Z","title":"EMOPIA: A Multi-Modal Pop Piano Dataset For Emotion Recognition and Emotion-based Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01374","snapshot_observed_at":"2026-08-07T00:49:46.604276Z","title":"Emopia: A multi-modal pop piano dataset for emotion recognition and emotion-based music gen- eration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.604276Z"},"links":{"cited_paper":"/paper/2108.01374","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:a38986b725a11ff6c115265bc6aad4970984425938dca0d2a519d9cb4b75956d","observation_id":"44613096-827c-4252-953e-7ace2a26ea60","resolution":{"observed_at":"2026-08-07T00:49:46.604276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T00:49:46.732431Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.732431Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:93babac21c55fd31485279668c6fc89aec40ea188a8b529f0585093b70aba027","observation_id":"7fc4e7aa-0042-4bf6-bfa3-f9f85ef5d283","resolution":{"observed_at":"2026-08-07T00:49:46.732431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:51.020486Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"49ccd141-85e2-49b3-a3cd-98f681920f56","year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.758112Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:857b7d11fc3a84057dd1f298ed6117073736cef7e2e5a4e68a070ef18f96ed76","observation_id":"00b7d1d0-bfaa-4804-b2eb-2456a7ab899f","resolution":{"observed_at":"2026-08-07T00:49:51.161900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T00:49:46.967955Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:46.967955Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:0d624836f1df3fc4f1e0447a0261a7bdb9cc638e084cca66e5a4473cfad4aeb1","observation_id":"4f9aa396-4221-48f1-89c8-704c1015dd39","resolution":{"observed_at":"2026-08-07T00:49:46.967955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:51.985402Z","title":"Language models are few-shot learners,","venue":null,"work_id":"90b93216-e314-42a5-bdde-f5e36eab9863","year":1901},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.082948Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:2ce9729645d7dcf7f03b78223178ece42f7bac98ec3302fb4a4c4fb14c9f28a4","observation_id":"0ebc6fab-03ae-4375-a19c-4f2db7f4fc0e","resolution":{"observed_at":"2026-08-07T00:49:52.186777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:51.635069Z","title":"Design guidelines for prompt engineering text-to-image generative models,","venue":null,"work_id":"e61e7357-9353-4784-9ecd-e6e036426203","year":2022},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.186083Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:cc4d8a6e5fec1eb08159f084c255044d9f7789bb2aa23066787673b9a879f804","observation_id":"69f6d0cd-4b1a-421a-8448-b2f4c0123638","resolution":{"observed_at":"2026-08-07T00:49:51.823139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-07T00:49:47.311232Z","title":"A prompt pattern catalog to enhance prompt engineering with chatgpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.311232Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:235538e345a789d5ce99eca42a4c27540d24ee3d4592e5dcde93cda65a8af9e2","observation_id":"6e8f562d-5af2-4bc7-a4b9-8d521f795dd6","resolution":{"observed_at":"2026-08-07T00:49:47.311232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-07T00:49:47.415707Z","title":"Lp-musiccaps: Llm-based pseudo music captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.415707Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:bfe86b8e6f3c382556d336b98e24d11088ad89c7f434cc1fd44dc41072145b1a","observation_id":"18e95974-ec41-4849-a687-64572867160f","resolution":{"observed_at":"2026-08-07T00:49:47.415707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T00:49:47.484231Z","title":"Decoupled weight decay regu- larization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.484231Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:dbabc57a42bacf23a828fe70a2c68db4e1c00f10a8957ab9d0a4c6562496c6b4","observation_id":"81eda005-80ec-47dd-8f4c-298358cfd8da","resolution":{"observed_at":"2026-08-07T00:49:47.484231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T00:49:47.550534Z","title":"Sgdr: Stochastic gra- dient descent with warm restarts,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.550534Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:99d938a75a77d1db109a4227d43bd091c1af8abc39674cd8ca491e63a4fe637a","observation_id":"5a4deb80-728e-4503-99cc-5da2dccca4ba","resolution":{"observed_at":"2026-08-07T00:49:47.550534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:51.314516Z","title":"Presto! distilling steps and layers for accelerating music generation","venue":null,"work_id":"fee6d5cb-dd36-4cb7-a919-e3847c4c4dbe","year":2025},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.631070Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:c062d1417a5fc07402e50b0a46b6ef0e84ebc8d2413ff46ffba8016cc9de36d1","observation_id":"50ab875a-1595-4b31-bd65-6e8a2f65f51d","resolution":{"observed_at":"2026-08-07T00:49:51.477011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08384","last_updated":"2024-10-30T14:33:27Z","snapshot_observed_at":"2026-07-06T18:29:44.841845Z","submitted_at":"2024-06-12T16:34:26Z","title":"Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08384","snapshot_observed_at":"2026-08-07T00:49:47.697740Z","title":"Diff-a-riff: Musical accompaniment co- creation via latent diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.697740Z"},"links":{"cited_paper":"/paper/2406.08384","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:9e4ed6a0876d9ffc61cb2b3f02cbb82c3bfca82ec63eb66d7ef369acf1e91772","observation_id":"17565a16-a129-4653-ad4d-251f7255020c","resolution":{"observed_at":"2026-08-07T00:49:47.697740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-07T00:49:47.832625Z","title":"Fr \\’echet audio distance: A metric for evaluat- ing music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.832625Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:5ff18e0c3c6dc53ec6e84506cc390ef5b9b5055e66573b81b67da802de9cf71e","observation_id":"7bc0f0b4-575b-4092-9629-2b5e5b319de3","resolution":{"observed_at":"2026-08-07T00:49:47.832625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:50.684799Z","title":"Reliable fidelity and diversity metrics for generative models,","venue":null,"work_id":"7bb7c678-579e-439c-9380-0979f767bdcf","year":2020},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.896765Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:7aaea3b175ddff9157b168dc4959e259aa69a2b1f727f35a553782a30ee1c48b","observation_id":"5851456f-0269-48f1-ae3c-d32dc18108bb","resolution":{"observed_at":"2026-08-07T00:49:50.882373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-07T00:49:47.983763Z","title":"Efficient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.983763Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:6b14ca84e0cf46e59709eabc6cfe7457620d044b986a641f732aa30ac5f607fb","observation_id":"cc2e518c-34dc-4078-9479-835127505348","resolution":{"observed_at":"2026-08-07T00:49:47.983763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:45.673911Z","title":"Available: http://dx.doi.org/10.1016/j","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:45.673911Z"},"links":{"citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:f02cc30fb00aedfc2246bc272e8bd5e2cfe1017cbcfd1d794488fa9860567908","observation_id":"91732895-4c5d-4970-93e6-4f4a5c4fe0e1","resolution":{"observed_at":"2026-08-07T00:49:45.673911Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T00:43:22.099305Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":41,"verified_exact":6,"verified_fuzzy":34},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 1 inbound Pith citation observation for arXiv:2506.12573."}