{"as_of":"2026-08-18T10:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b261518d434bdd5e81b6e78a3b3e0b21e0d17663c63f196d63786d9cbf714b6","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:36:42.599014Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:36:42.391185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:36:42.953731Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"cited_work":{"arxiv_id":"2608.11576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.11576","snapshot_observed_at":"2026-08-16T00:36:42.953731Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","venue":"cs.SD","work_id":"841762d3-0291-452b-8887-1ec82263691a","year":2026},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.391185Z"},"links":{"cited_paper":"/paper/2608.11576","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:785427c40ff0d74f5f09e29652eed84786ca0d100fedde1adeaa71a6b89cb2e2","observation_id":"9994dfab-e618-4b92-91d6-f403c9decf4b","resolution":{"observed_at":"2026-08-16T00:36:42.957902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.11576/citation-record","integrity":"/paper/2608.11576/integrity","json":"/paper/2608.11576/citation-record.json","paper":"/paper/2608.11576"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"cited_work":{"arxiv_id":"2608.11576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.11576","snapshot_observed_at":"2026-08-16T00:36:42.953731Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","venue":"cs.SD","work_id":"841762d3-0291-452b-8887-1ec82263691a","year":2026},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.391185Z"},"links":{"cited_paper":"/paper/2608.11576","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:785427c40ff0d74f5f09e29652eed84786ca0d100fedde1adeaa71a6b89cb2e2","observation_id":"9994dfab-e618-4b92-91d6-f403c9decf4b","resolution":{"observed_at":"2026-08-16T00:36:42.957902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.326692Z","title":"Early work in modern video-to-music generation systems uses large-scale web music-video corpora and autoregressive modeling over semantic acoustic tokens to generate music [8]","venue":null,"work_id":"888715cf-8290-4e71-8125-cf6a63757d8e","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.395669Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:e6e0a6c56d7fd284d2bcb0ac9805c9f9973c6e83a09a2272a27d69f0a4bdfab5","observation_id":"49f7049e-e796-46e3-9af6-b670310f557f","resolution":{"observed_at":"2026-08-16T00:36:43.330732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.315287Z","title":"trance music","venue":null,"work_id":"3c464880-34b8-47a7-9de5-fff590e78103","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.399453Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:1a8ac734d46c4e9df0321d6156f8d82af464f7ab917a9ab51bc5feab1b4ba392","observation_id":"d1f0f9bd-1d9e-4177-aebe-5ce875711696","resolution":{"observed_at":"2026-08-16T00:36:43.319454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.305130Z","title":null,"venue":null,"work_id":"69c16dd0-56fe-4bc5-bbca-0a3476d73721","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.403577Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:541dc0ccc9a3b9f8f68dcba6391f861ae7eb4f10e9802e5ec65fc32cfdf0347d","observation_id":"f0743c4e-cba8-4a45-915f-35bb08426abd","resolution":{"observed_at":"2026-08-16T00:36:43.308324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.294771Z","title":"First, we bench- mark video-to-music generation tasks by comparing existing video-to-music generation models trained and evaluated on identical data, using OSSL-v2","venue":null,"work_id":"8a852d8f-a7c8-4327-809f-7f20aad16dd1","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.408016Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:7f4247d45a35a3a83ad5690868cc9882787d53fae4ac80496a37e86ffcee16a8","observation_id":"1369da0c-923d-4a28-b521-da386bbf7aa4","resolution":{"observed_at":"2026-08-16T00:36:43.298362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.283076Z","title":"+Dialogue","venue":null,"work_id":"2f89657a-ec57-4599-b7ef-6bc4c7ed34ce","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.412530Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:002e624242f9358e4db75a2dfad67aa3ee26c5d8c436c8cbb25fda6bece2a41a","observation_id":"442247b2-c215-4420-b9d4-a54b69ada218","resolution":{"observed_at":"2026-08-16T00:36:43.287922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.271570Z","title":"Be- cause the dataset is free from link rot and does not require separate web scraping, our dataset is suitable as a durable benchmark for the field","venue":null,"work_id":"fcd1139c-d4be-42d1-abb0-09e42703ea1b","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.416447Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:2f69702cf7b4ab9b96c1cc587ed237aea13e847037c626884a706d7b22345f17","observation_id":"4d97db7e-2296-4f1a-a2c9-6fff5d6fbc44","resolution":{"observed_at":"2026-08-16T00:36:43.275395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.260131Z","title":"Teaser Generation for Long Documentaries and Educational Videos","venue":null,"work_id":"0922fa9e-f50a-4078-914d-c4b9d0c3cfb0","year":null},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.420783Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:60b08874573f6f6704da8670aa4eafecdbd0dab550f9aed201c707817ce6cf75","observation_id":"df5e0c5b-906b-47e3-959a-cc4b271b19e6","resolution":{"observed_at":"2026-08-16T00:36:43.264105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.248305Z","title":"Attendaffectnet–emotion pre- diction of movie viewers using multimodal fusion with self-attention,","venue":null,"work_id":"9b19cc47-ff6d-4967-94ee-38a3a1400e13","year":2021},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.424057Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:5757369bbf55f06a2419adb69c2162c0ea606535670fb58dca3f38541ef5d875","observation_id":"48d25803-3e24-4035-bc77-87021a8676c0","resolution":{"observed_at":"2026-08-16T00:36:43.252296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10453","last_updated":"2022-02-19T07:36:43Z","snapshot_observed_at":"2026-08-16T17:20:09.762654Z","submitted_at":"2022-02-19T07:36:43Z","title":"Predicting emotion from music videos: exploring the relative contribution of visual and auditory information to affective responses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10453","snapshot_observed_at":"2026-08-16T00:36:42.427623Z","title":"Predicting emotion from music videos: exploring the relative contribution of vi- sual and auditory information to affective responses,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.427623Z"},"links":{"cited_paper":"/paper/2202.10453","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:a1b7883ed0a8b4f0949fb56a3d66a3f414d810868d762162558f4c00307130fe","observation_id":"cefa76f8-82df-4414-a38f-80e911720855","resolution":{"observed_at":"2026-08-16T00:36:42.427623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.236401Z","title":"The cognitive processing of film and musical soundtracks,","venue":null,"work_id":"dea1aad2-bc57-4b39-a91c-8f62fdfdab81","year":2004},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.431355Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:67a00dc333f2d911208d7a0d11ced33a9a714af5bbbc310805d75bedafa416e2","observation_id":"aefa4075-821b-4a94-9155-3c07c6c43813","resolution":{"observed_at":"2026-08-16T00:36:43.240784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.226077Z","title":"Multimodal deep models for predicting affec- tive responses evoked by movies.,","venue":null,"work_id":"22709a3e-bc5c-40d2-80ee-d145e7b26857","year":2019},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.434869Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:04286ad1d8afafc8fd8745d396d8f2ef34635cc5c955b5466a5c8f176bafb167","observation_id":"008a119a-ccf9-473b-b194-b9633b4b2f70","resolution":{"observed_at":"2026-08-16T00:36:43.229494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.215788Z","title":"On music’s potential to convey meaning in film: A systematic review of empirical evi- dence,","venue":null,"work_id":"ec1c6f97-124e-440e-a031-1caa5d60b0a8","year":2021},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.438501Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:2cd6c7861091336300a851dc51a3c19956e181342a4569ae9915513fcf81e09a","observation_id":"fa33de3d-8bb4-4105-b5cc-52ed53cdaad7","resolution":{"observed_at":"2026-08-16T00:36:43.219280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13468","last_updated":"2021-11-26T12:31:41Z","snapshot_observed_at":"2026-08-16T17:39:09.673394Z","submitted_at":"2021-11-26T12:31:41Z","title":"Emotion Embedding Spaces for Matching Music to Stories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13468","snapshot_observed_at":"2026-08-16T00:36:42.442268Z","title":"Emotion embedding spaces for matching music to stories,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.442268Z"},"links":{"cited_paper":"/paper/2111.13468","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:eac27408657fac455cdf4eee29b32c0dd69ec70530885cd10a90d32cbe81e1b9","observation_id":"e4bb1dcc-a488-4e3f-b982-43011b6020d4","resolution":{"observed_at":"2026-08-16T00:36:42.442268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.204657Z","title":"Foley music: Learning to generate music from videos,","venue":null,"work_id":"d6c4a15b-c4ae-44db-a9bc-1acdcb3b0f71","year":2020},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.446296Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:647d686101ec710c610f633ba3121bb7a88c0a70af788b7703ddf51a269c80f4","observation_id":"b24fc0fe-dfd4-463c-96d2-b5d1293e74d7","resolution":{"observed_at":"2026-08-16T00:36:43.208400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.193418Z","title":"V2meow: Meow- ing to the visual beat via video-to-music generation,","venue":null,"work_id":"ecaedcb1-0b01-4447-be66-e86e3aa26f3b","year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.450042Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:07ad7930011a9029b2ef478204a5f2c16ef9416c64ab38be7ad6953e2e4ae2eb","observation_id":"4b2cefab-443c-4b9e-8172-064e5352d578","resolution":{"observed_at":"2026-08-16T00:36:43.197380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.181953Z","title":"Vidmuse: A simple video-to-music generation framework with long-short-term modeling,","venue":null,"work_id":"503475c3-d099-4472-b402-b957a9cf61d9","year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.453909Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:04aa458eb6096dd43bd050c487091cb05320c1fabe3f87265d3e00a5edc7fc3b","observation_id":"fd6a3ed6-191b-4b45-8089-1bf9bbd4218a","resolution":{"observed_at":"2026-08-16T00:36:43.185861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.170710Z","title":"Vmas: Video-to-music generation via semantic alignment in web music videos,","venue":null,"work_id":"68597e30-3338-4318-ac6b-80d00c0a8bc9","year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.457562Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:54be052a8e24de4e7cb37919a1e1ce229f1944b8e998972bf8e6f3cef266851b","observation_id":"1ceb4568-70ff-40a4-9f39-ff64d417ccc9","resolution":{"observed_at":"2026-08-16T00:36:43.174223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.159607Z","title":"Sonique: Video background music generation using unpaired audio- visual data,","venue":null,"work_id":"0866f7c7-922f-475f-b628-e4c1b309f8b2","year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.461759Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:589436022a0b9ec6a25239e48c28ef61c98b2d13ffd6eed90889acb1e7b9c23f","observation_id":"0a616f9c-5105-4098-9803-76aed2621f3b","resolution":{"observed_at":"2026-08-16T00:36:43.163597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09972","last_updated":"2025-01-17T06:30:11Z","snapshot_observed_at":"2026-08-18T01:42:03.563191Z","submitted_at":"2025-01-17T06:30:11Z","title":"GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09972","snapshot_observed_at":"2026-08-16T00:36:42.465952Z","title":"Gvmgen: A general video-to-music genera- tion model with hierarchical attentions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.465952Z"},"links":{"cited_paper":"/paper/2501.09972","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:64919e3958007a062712020fe2593ab3ce230a81f69306fa7c1cf713aaa51343","observation_id":"707f5136-b83a-41bc-bac4-8007b047d9ec","resolution":{"observed_at":"2026-08-16T00:36:42.465952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21254","last_updated":"2025-03-27T08:21:54Z","snapshot_observed_at":"2026-08-16T12:46:23.176315Z","submitted_at":"2025-03-27T08:21:54Z","title":"Vision-to-Music Generation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21254","snapshot_observed_at":"2026-08-16T00:36:42.470428Z","title":"Vision-to-music generation: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.470428Z"},"links":{"cited_paper":"/paper/2503.21254","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:a6c171a0339b958407a35f83f69327786eb025bd813a908f0c3d3cf62742324e","observation_id":"19f194b0-b420-4d16-8e89-42189f1c22a4","resolution":{"observed_at":"2026-08-16T00:36:42.470428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.147105Z","title":"Ai- based chinese-style music generation from video con- tent: a study on cross-modal analysis and generation methods,","venue":null,"work_id":"75c681de-9e15-46a6-85a3-4cbf38239412","year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.474275Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:e4ae4f8730f3a802426326cc67aa94250a65eb854b2b65ce2dc4000eb003eaf0","observation_id":"a329da2a-9f37-45c7-a4d3-bad6ee9ea753","resolution":{"observed_at":"2026-08-16T00:36:43.151434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11042","last_updated":"2026-05-13T23:32:35Z","snapshot_observed_at":"2026-08-02T22:16:22.293642Z","submitted_at":"2026-03-11T17:59:40Z","title":"V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation","version":2},"cited_work":{"arxiv_id":"2603.11042","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.11042","snapshot_observed_at":"2026-08-16T00:36:42.888927Z","title":"V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation","venue":"cs.CV","work_id":"cffc4622-b8fc-4575-a40f-c2ea9624815d","year":2026},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.478417Z"},"links":{"cited_paper":"/paper/2603.11042","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:0a26d8730928d29e5adbc63520542f87b36c8359b841273889e56471ea3bf37d","observation_id":"81b7990b-37ce-403d-83d9-2d9c84b6d211","resolution":{"observed_at":"2026-08-16T00:36:42.893043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.135989Z","title":"Diff- v2m: A hierarchical conditional diffusion model with explicit rhythmic modeling for video-to-music genera- tion,","venue":null,"work_id":"d81db846-74fe-4642-9c18-1d241feb9b3f","year":2026},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.482121Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:6e7b33dc31792d5428cf6674bbb208a7fef26327f167f13bd3798e7fac175594","observation_id":"aa944ece-843f-4cd3-9506-b9cc63eb9cc7","resolution":{"observed_at":"2026-08-16T00:36:43.139456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.124982Z","title":"Quan- tized gan for complex music generation from dance videos,","venue":null,"work_id":"a1849abe-d85c-4a34-94c7-5f133a6db757","year":2022},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.489105Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:ca00aca63d01bfd52cef1ae295862b40a54e879505f27668644dcf7ff70f9ddd","observation_id":"10022ec1-ca19-4aa1-bf0f-aad20ccbb1fe","resolution":{"observed_at":"2026-08-16T00:36:43.128702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.114255Z","title":"Video background music genera- tion: Dataset, method and evaluation,","venue":null,"work_id":"31274676-f289-4501-8be1-80f1e42381b6","year":2023},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.492941Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:5031433ff8f5563365a19a62bd7a2cf47657b3b25acfd3180de6037b5499c6cd","observation_id":"b2d7c4b9-30bd-4184-86b6-a939bf58ac3e","resolution":{"observed_at":"2026-08-16T00:36:43.117905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06761","last_updated":"2017-09-01T14:08:06Z","snapshot_observed_at":"2026-08-14T21:05:27.537277Z","submitted_at":"2017-04-22T07:40:16Z","title":"Content-Based Video-Music Retrieval Using Soft Intra-Modal Structure Constraint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06761","snapshot_observed_at":"2026-08-16T00:36:42.496612Z","title":"Diff-bgm: A diffusion model for video back- ground music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.496612Z"},"links":{"cited_paper":"/paper/1704.06761","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:873756689855aef556c1c2cc6a0c596af7057824a30f109ab098d25d66ffed0c","observation_id":"990607ec-3e49-4516-874e-35c7c1f52409","resolution":{"observed_at":"2026-08-16T00:36:42.496612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-15T13:48:37.038734Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12573","snapshot_observed_at":"2026-08-16T00:36:42.500746Z","title":"Video-guided text- to-music generation using public domain movie collec- tions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.500746Z"},"links":{"cited_paper":"/paper/2506.12573","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:718de42c84ef1d5b8f244b3def6445eac6eaab8077f9baeb6e1310ccc36a5999","observation_id":"8147f160-bd41-4192-82f0-c30b73745ab6","resolution":{"observed_at":"2026-08-16T00:36:42.500746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.101808Z","title":"Acoustic profiles in vocal emotion expression.,","venue":null,"work_id":"907cf329-944b-468f-951f-5e9aa83f3b1c","year":1996},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.504700Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:b389ab81b62468d8b98df49b0f1b314af2d87d3b45c6b968bdfc1999603a5e16","observation_id":"fa6e8aab-9e17-454e-b054-7b958e060045","resolution":{"observed_at":"2026-08-16T00:36:43.106258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.088527Z","title":"Background ducking to produce esthetically pleasing audio for tv with clear speech,","venue":null,"work_id":"494e475c-9230-439e-85dd-4d0643ead688","year":2019},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.508491Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:060513f14a59fccee1656b0325807931781dd15003255f37dd07d4422dc5d679","observation_id":"6abfe8f2-f194-4e2c-84c1-41efdb5a99a1","resolution":{"observed_at":"2026-08-16T00:36:43.092776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.076153Z","title":"Improving dialogue intelligi- bility in streaming media,","venue":null,"work_id":"2d086472-fa4c-4673-9499-f9c44777a466","year":2026},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.512290Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:fd33399da319ab90a7813c69fc28951315a8d591e3a30725048fedcdc33c276d","observation_id":"bee2f69a-b172-452f-ae3e-7047d87f4192","resolution":{"observed_at":"2026-08-16T00:36:43.080172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.065341Z","title":"Creating a multitrack clas- sical music performance dataset for multimodal mu- sic analysis: Challenges, insights, and applications,","venue":null,"work_id":"77e20fee-e236-4c0c-b6b2-3c03431286b5","year":2019},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.517678Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:bd472f759a14ee826f32f1a77576be5a36b49a75b0190d7853fcbe6883573912","observation_id":"120bc34a-93c5-4792-90e6-0256dc84d0c3","resolution":{"observed_at":"2026-08-16T00:36:43.068775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.053884Z","title":"Video2music: Suitable music generation from videos using an affective multimodal transformer model,","venue":null,"work_id":"4d0fb60b-9ccb-41c9-b809-b0f66cbde212","year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.521020Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:8b2d8c95245b75b8c5e14988476c87304cd867df488b1142043732d47d6f5749","observation_id":"ebc889d5-7b93-4f4d-9a5e-3aeb1039d244","resolution":{"observed_at":"2026-08-16T00:36:43.058045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07594","last_updated":"2025-04-10T09:47:26Z","snapshot_observed_at":"2026-08-16T12:42:26.581733Z","submitted_at":"2025-04-10T09:47:26Z","title":"Extending Visual Dynamics for Video-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07594","snapshot_observed_at":"2026-08-16T00:36:42.524714Z","title":"Extending visual dynamics for video-to-music genera- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.524714Z"},"links":{"cited_paper":"/paper/2504.07594","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:9257be0892a8fa28e7bc275d7c8e9f988f46d03b3f2f991561bb3471b33f0620","observation_id":"e1e7e50f-29fd-4335-a102-3ddf5172aec5","resolution":{"observed_at":"2026-08-16T00:36:42.524714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06296","last_updated":"2024-12-09T08:40:10Z","snapshot_observed_at":"2026-08-13T10:26:54.016382Z","submitted_at":"2024-12-09T08:40:10Z","title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06296","snapshot_observed_at":"2026-08-16T00:36:42.528088Z","title":"Vid- musician: Video-to-music generation with semantic- rhythmic alignment via hierarchical visual features,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.528088Z"},"links":{"cited_paper":"/paper/2412.06296","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:e80c3851b1790e4068595a73b36d1c033d7c6a02787e8137c3ccead8e65b719f","observation_id":"bd94a98a-47b9-4228-ba40-0b7c2eac11fb","resolution":{"observed_at":"2026-08-16T00:36:42.528088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-08-16T13:08:41.343567Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-16T00:36:42.531770Z","title":"Muvi: Video-to-music gen- eration with semantic alignment and rhythmic synchro- nization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.531770Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:2f4d8d5b687f7828517f6217fdd90fe73b2edc5d3946142ecb5535e66d1ddd0c","observation_id":"f06b666f-bace-4d58-a581-5d524fbabd79","resolution":{"observed_at":"2026-08-16T00:36:42.531770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09585","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:42.811519Z","title":"Video echoed in music: Semantic, temporal, and rhythmic alignment for video-to-music generation,","venue":null,"work_id":"0f217346-17dd-4f7a-8d7e-57808a7719f3","year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.535975Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:fa909c952ae754b3d92ff91950a7430aa36da4147dcd574ab0e9163d36813a77","observation_id":"6e1b4654-799c-4717-9f79-8ce89d3db55f","resolution":{"observed_at":"2026-08-16T00:36:42.818139Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17656","last_updated":"2026-04-22T20:49:39Z","snapshot_observed_at":"2026-08-03T22:32:47.528222Z","submitted_at":"2026-04-19T22:54:56Z","title":"Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation","version":2},"cited_work":{"arxiv_id":"2604.17656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.17656","snapshot_observed_at":"2026-08-16T00:36:42.738737Z","title":"Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation","venue":"cs.SD","work_id":"60e1bb38-68e0-45bd-88dd-02c097168fec","year":2026},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.539678Z"},"links":{"cited_paper":"/paper/2604.17656","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:6ca5692d796d0c772be55336967f8ee7ae327e42fd3ed802571c4c7496565ca7","observation_id":"7c0c2411-6d68-43cc-8757-d2ece80bb540","resolution":{"observed_at":"2026-08-16T00:36:42.743314Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07539","last_updated":"2024-11-12T04:34:09Z","snapshot_observed_at":"2026-08-16T13:00:56.591254Z","submitted_at":"2024-11-12T04:34:09Z","title":"Harmonizing Pixels and Melodies: Maestro-Guided Film Score Generation and Composition Style Transfer","version":1},"cited_work":{"arxiv_id":"2411.07539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.07539","snapshot_observed_at":"2026-08-16T00:36:42.722218Z","title":"Harmonizing Pixels and Melodies: Maestro-Guided Film Score Generation and Composition Style Transfer","venue":"cs.MM","work_id":"d8e9c286-47b3-407e-a74f-7fba2be8f8fb","year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.544084Z"},"links":{"cited_paper":"/paper/2411.07539","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:859058ad5ed196fc0c78549034311d2fb87431199de8876594dfce45f2296a5a","observation_id":"21d31ded-83a0-4005-be0e-91e719cd9342","resolution":{"observed_at":"2026-08-16T00:36:42.726835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08147","last_updated":"2025-03-11T08:05:11Z","snapshot_observed_at":"2026-08-16T12:51:14.331940Z","submitted_at":"2025-03-11T08:05:11Z","title":"FilmComposer: LLM-Driven Music Production for Silent Film Clips","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08147","snapshot_observed_at":"2026-08-16T00:36:42.548207Z","title":"Filmcomposer: Llm-driven music production for silent film clips,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.548207Z"},"links":{"cited_paper":"/paper/2503.08147","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:44e29bdfed7cc3efcba400c24d9c2c406e6ab9ddfcf4750c591e8513ff543ed6","observation_id":"1209e8e0-5c05-4638-a493-3f2d2ff08163","resolution":{"observed_at":"2026-08-16T00:36:42.548207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11255","last_updated":"2024-12-09T16:15:07Z","snapshot_observed_at":"2026-08-16T14:42:06.397804Z","submitted_at":"2023-11-19T06:50:52Z","title":"M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11255","snapshot_observed_at":"2026-08-16T00:36:42.551715Z","title":"M 2ugen: Multi-modal mu- sic understanding and generation with the power of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.551715Z"},"links":{"cited_paper":"/paper/2311.11255","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:57fd22086f1e749344d8c675805dbf422d0af545540977215de1a60a5deab1fb","observation_id":"72562688-b4de-4467-b3ec-8b104b63b241","resolution":{"observed_at":"2026-08-16T00:36:42.551715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-13T09:14:45.905037Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-16T00:36:42.555094Z","title":"Mumu-llama: Multi-modal music understanding and generation via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.555094Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:6632bb9503c30dac55d3aa65b85e4b80f4c773cf1c23569c3edfafe550b2ae1e","observation_id":"16bf29af-c87e-4b33-9971-4c33d6f8d77d","resolution":{"observed_at":"2026-08-16T00:36:42.555094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09428","last_updated":"2024-12-12T16:33:21Z","snapshot_observed_at":"2026-08-16T13:00:08.968404Z","submitted_at":"2024-12-12T16:33:21Z","title":"Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09428","snapshot_observed_at":"2026-08-16T00:36:42.558498Z","title":"Multimodal music generation with explicit bridges and retrieval augmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.558498Z"},"links":{"cited_paper":"/paper/2412.09428","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:78ccbbbbbd19b3c07f2b66b49e9549db925d2d7f3fa75447f80d78de52605986","observation_id":"8d8c3492-5c3a-4909-9fa0-35fc7b2ed464","resolution":{"observed_at":"2026-08-16T00:36:42.558498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07489","last_updated":"2024-05-07T10:35:10Z","snapshot_observed_at":"2026-08-16T15:33:33.587481Z","submitted_at":"2023-05-12T14:00:26Z","title":"Benchmarks and leaderboards for sound demixing tasks","version":2},"cited_work":{"arxiv_id":"2305.07489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07489","snapshot_observed_at":"2026-08-16T00:36:42.655396Z","title":"Benchmarks and leaderboards for sound demixing tasks","venue":"cs.SD","work_id":"a50229b4-f514-4321-baf5-c73bfc4110d7","year":2023},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.562317Z"},"links":{"cited_paper":"/paper/2305.07489","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:0d2a43bfe41309744a9de3067de1ef495639d5521e1c4931f1394c5c99c96b7c","observation_id":"b074ce61-01be-4387-8b04-d49dfe2f24fd","resolution":{"observed_at":"2026-08-16T00:36:42.661931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.043315Z","title":"Panns: Large- scale pretrained audio neural networks for audio pat- tern recognition,","venue":null,"work_id":"48886d68-b318-4767-8f64-703da778e9e0","year":2020},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.566111Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:18ee06826402f3b6ad69486ea990634e08773976e0bff6a3b7161bfeafd3aa5e","observation_id":"eb3d6160-8e0d-4e0f-a8db-8702c047d2af","resolution":{"observed_at":"2026-08-16T00:36:43.046961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:42.569655Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.569655Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:63a1d454b909e7eaf1f86890d6b10e7b87e587c1c5271779d3fd2b6077b825fb","observation_id":"653a13bf-c98b-4d2a-83cf-051647f1e180","resolution":{"observed_at":"2026-08-16T00:36:42.569655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.024506Z","title":"Simple and controllable music generation,","venue":null,"work_id":"490f9ab3-9e30-4abf-8339-d7cfe8ab15b8","year":2023},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.573729Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:c629fde88eafb06b290c21b149110bb69f54487df4a6465ba8010cfeee2d42ad","observation_id":"da8bf902-2b3d-4bbe-9776-dc74b80f2ac7","resolution":{"observed_at":"2026-08-16T00:36:43.028037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:42.578021Z","title":"Learning transferable visual models from natural lan- guage supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.578021Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:2afff8dc130bbaa85673d21d44241de1cb9aef02a8feba2f26020edebe6cca1e","observation_id":"3ce23509-f9dd-4bc1-aec2-972436a940c0","resolution":{"observed_at":"2026-08-16T00:36:42.578021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:43.004794Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models,","venue":null,"work_id":"a135417f-2f97-4f37-a0a4-7d79beefeed5","year":2023},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.581737Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:3e12137fa2c908a834dd142e3f67c445c39db5eef224b85a662f27932b801623","observation_id":"3eee001c-eab3-4d51-b092-e28182dd0b42","resolution":{"observed_at":"2026-08-16T00:36:43.008983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:42.585657Z","title":"Stable audio open,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.585657Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:371dab7868ff23db3ec58aa35a55dc6ba6a0881c890f34161a3fa2f3d32e01fc","observation_id":"8dba42b6-6f13-4d4f-ac83-62e87cb04ec0","resolution":{"observed_at":"2026-08-16T00:36:42.585657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-16T00:36:42.589124Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.589124Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:4917632f2b6c79b1210ad417eae0bc629b9f361ec7cd52c8480dfef0a12b6b71","observation_id":"845fcd3d-3188-46eb-b21f-4d82c9bd4ff7","resolution":{"observed_at":"2026-08-16T00:36:42.589124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:42.982028Z","title":"Reliable fidelity and diversity metrics for generative models,","venue":null,"work_id":"8225e442-c7d9-42cf-8900-1a0ca7493092","year":2020},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.592522Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:54da586949757ac8b67e9c0e976ccbaf920bb5e225a000fe9627b9d7738aff0e","observation_id":"033875e8-7627-4d8c-9f7d-d2ee6ffd8ca0","resolution":{"observed_at":"2026-08-16T00:36:42.986288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:42.967242Z","title":"Large-scale contrastive language-audio pretraining with feature fu- sion and keyword-to-caption augmentation,","venue":null,"work_id":"0fa7963d-11ae-40e3-904c-63b8143387d7","year":2023},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.595514Z"},"links":{"citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:e47f4551e2381b61a4966eff4bda9f9290ff616f6f16472b6e4547015c2e75d2","observation_id":"94ed3f79-cf9d-4933-9880-15011d8c22bb","resolution":{"observed_at":"2026-08-16T00:36:42.972018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-16T17:50:24.547828Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-16T00:36:42.599014Z","title":"Efficient training of audio transform- ers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:42.599014Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2608.11576"},"observation_digest":"sha256:669ba9ea3ee2bd6c37d1853b3afa3b4c276db24a4f346a80dcd30e0d7a3b0c7b","observation_id":"8a87dcdc-06b6-4acc-8217-f75e2e86a756","resolution":{"observed_at":"2026-08-16T00:36:42.599014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11576","last_updated":"2026-08-12T02:32:32Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T14:10:56.755456Z","submitted_at":"2026-08-12T02:32:32Z","title":"Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2608.11576."}