{"as_of":"2026-08-08T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cec3b28aa08620c4038e7b0070986e337b370b8b8dab4a334dd8af48ef59cd7a","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:31:15.877382Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20627/citation-record","integrity":"/paper/2507.20627/integrity","json":"/paper/2507.20627/citation-record.json","paper":"/paper/2507.20627"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-06T13:31:09.594836Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.594836Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:691c71624e06588c70138727b41e3b36f363c35fe9a3b2abe18c73c75152cda9","observation_id":"50a8ccca-ab7d-4a8e-b595-35754c1a399f","resolution":{"observed_at":"2026-08-06T13:31:09.594836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T13:31:09.644755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.644755Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:c312a3749a1489cbe396f73b6d5a383e224f674292a6704d4a0eb8b1ecc940cd","observation_id":"0d64c2eb-cee3-43b4-a8af-a56e5325446f","resolution":{"observed_at":"2026-08-06T13:31:09.644755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.971140Z","title":null,"venue":null,"work_id":"ab41b17f-2007-4654-a643-4aa3dea8e88e","year":2016},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.682524Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:ba0cc920ecf02ad8e6a526cab81bfa36e6e3d9472c6257e6e7f42fee426d2945","observation_id":"cf21a038-aa49-4002-858a-ec21d7fa3562","resolution":{"observed_at":"2026-08-06T13:31:29.103936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.724751Z","title":null,"venue":null,"work_id":"c4e5b29f-d308-44e2-8962-c52ebf073259","year":2016},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.734742Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:d99ad163b9682c65698036eb394a317d3fa0b6300e17da3dc0da658daeefcee4","observation_id":"adaaca03-ad53-4b3b-9d52-2334bada7476","resolution":{"observed_at":"2026-08-06T13:31:28.771472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.464763Z","title":null,"venue":null,"work_id":"2d1eca6c-ed05-45cb-9b8b-467dcce53529","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.784830Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b4e00c320ca6cb850c0a9c393a4b90c529d5f8812d056980c8277b453111445f","observation_id":"e1ea48b7-d993-44db-9214-e9c8120ed55d","resolution":{"observed_at":"2026-08-06T13:31:28.561902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.214843Z","title":null,"venue":null,"work_id":"a9f8fff1-46ed-46e9-b2a6-0cc4157ccb4d","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.824745Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:1037709dd819e7d368fe9cdafec25d466c5903bf79903e2c78cfcdd56dfc0884","observation_id":"42b5f16a-e52c-4f1b-8559-19e4bf028450","resolution":{"observed_at":"2026-08-06T13:31:28.277866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:27.984748Z","title":null,"venue":null,"work_id":"0dea0e54-dcf2-4bf4-a487-23962da0b12c","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.884851Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:67244a46dce9c9e974ba6328e356965850290ca853e342dd7e5771a358c00c5f","observation_id":"59d179fc-1983-443a-b2fd-82bb0b6aa8e8","resolution":{"observed_at":"2026-08-06T13:31:28.134534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:27.712651Z","title":null,"venue":null,"work_id":"a63534fe-356d-4319-aaaa-dd84a9eb6903","year":2019},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.944740Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:47f7e9038fba00a77caa5621dd3077b2cfb42866c45d4281638d21e067569652","observation_id":"bc688ee9-ee26-4633-af41-1ef2619a0985","resolution":{"observed_at":"2026-08-06T13:31:27.805295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:27.319329Z","title":null,"venue":null,"work_id":"e626e93f-b44e-4eec-a5e5-917deda33577","year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.995041Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:21608811a8f4df87718dda90f0934d11ba5ccd0ba37ae74668afe1ce58a25a7f","observation_id":"25393314-7b92-4192-9c71-555b8b57b618","resolution":{"observed_at":"2026-08-06T13:31:27.495146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:26.954841Z","title":null,"venue":null,"work_id":"4590f7c4-ae08-42fe-ab00-824ba5bbcb57","year":2009},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.044753Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:7e1aa6ad71e6ec9a5f168b8d9fa69f6e6f2005220227f021ca8267f745a2054a","observation_id":"36d708d8-fc83-4d8b-8a8a-aac212e81931","resolution":{"observed_at":"2026-08-06T13:31:27.059741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T13:31:10.094748Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.094748Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:27751afd0eca5525d6794eb008c30400d1d983cd1e72c08dd3fbc2f365873f72","observation_id":"9e36dfe1-2ebc-4765-ae8d-0e9e4c5c7bc0","resolution":{"observed_at":"2026-08-06T13:31:10.094748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:26.644747Z","title":null,"venue":null,"work_id":"c3288610-985a-4e8d-820b-ace177f5f4e0","year":2021},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.144749Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:5294ca4b10775d14986a4b406950ff0e6e4393201561e71caae4a6b7c190442d","observation_id":"fc20ac14-8671-42bb-8e3f-b80d611dbfce","resolution":{"observed_at":"2026-08-06T13:31:26.764745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:26.264913Z","title":null,"venue":null,"work_id":"c8edea44-5212-4a42-83cc-288d7de615bd","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.194749Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:61a011756a139ae060fcb55a40852c292fb8f57df677ad41bbddd0e51dfade28","observation_id":"eca0b752-2071-432d-a5e6-f9086a21055d","resolution":{"observed_at":"2026-08-06T13:31:26.430944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.919494Z","title":null,"venue":null,"work_id":"e0ab7507-be89-4427-bef0-9accc71a9926","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.254758Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:6187ed0b97a53deb5326a8dbfba902e69a9b2af26498c8fcd738aae335b4697b","observation_id":"41237e2c-c97e-4480-b283-fc5b1657f422","resolution":{"observed_at":"2026-08-06T13:31:26.075802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:10.304754Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.304754Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:1aa56c36498819a373d706db8f19e791514f8283b122a8072b23a1aa150deef3","observation_id":"4f4d9030-6339-4f37-a94d-dcf583f7e0ae","resolution":{"observed_at":"2026-08-06T13:31:10.304754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.604680Z","title":null,"venue":null,"work_id":"4c026759-27ad-4b71-807d-e9132945cc97","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.343135Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:4f1dfdd0881cb5411a263410d2267ccdc8ca489046bcbf382c70644c5f671135","observation_id":"0fd85f8e-8465-4e2f-97be-fd03bc26c7c6","resolution":{"observed_at":"2026-08-06T13:31:25.686144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.349095Z","title":null,"venue":null,"work_id":"1a2e33e1-29fa-4e0c-b366-1ccf1103b6f1","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.414752Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:e92e5f99d2a4dca61ec44cca68c3989a7385a779fe3d000beca868f5be734538","observation_id":"08bb5222-5302-4189-83ad-c54a676d110b","resolution":{"observed_at":"2026-08-06T13:31:25.454749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.114774Z","title":null,"venue":null,"work_id":"075c4cb9-d907-4c26-8530-96566345f609","year":2017},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.464837Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b992caf4f0341e314d916de7f2fa59e4688f7f9c02058fa50cb370cf17cc1bd0","observation_id":"20daa7b9-6d47-4c8f-8e30-c534cdc8ab20","resolution":{"observed_at":"2026-08-06T13:31:25.193454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:10.524754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.524754Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b1f96f37cefa16d8f3ed9cae573fabc08738f518e87f740f8e66d511e3665208","observation_id":"9c81f4d7-ae80-4c22-b572-84c06cbf8a0e","resolution":{"observed_at":"2026-08-06T13:31:10.524754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:24.884756Z","title":null,"venue":null,"work_id":"0f73314b-1fc9-44d0-be66-f707fb81a71d","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.574747Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:fd4a1e383ca10ed3d47e70247f35330fcf7d8b51c6516745f01e44d6d3b311a0","observation_id":"411b26f5-8943-457c-877b-10dfc4cfc111","resolution":{"observed_at":"2026-08-06T13:31:25.013940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T13:31:10.654753Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.654753Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:e26e91e82363b6331328d708f51da7abcab38990ede90fcab54e3a88a8a181c4","observation_id":"7321d4b3-ac83-4834-860b-9831bd6725e7","resolution":{"observed_at":"2026-08-06T13:31:10.654753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:10.714769Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.714769Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:08cd64691bd7ee73d3bebc19adabd6033d5d59281d637ab8e70a1e80e6e5d762","observation_id":"b2f42de8-e8a2-4ea4-9f61-669641f4f390","resolution":{"observed_at":"2026-08-06T13:31:10.714769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:24.424770Z","title":null,"venue":null,"work_id":"6eb12ef5-f337-4ba2-993e-08727c17edaf","year":2015},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.763908Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:436b8e9311bb00e4f5a6c4ac8b06281d30ea85542adf35b5c292c494ea510658","observation_id":"cedab653-cea7-4ad5-abb0-8dbe1fcaf414","resolution":{"observed_at":"2026-08-06T13:31:24.510267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15060","last_updated":"2024-07-21T05:27:53Z","snapshot_observed_at":"2026-08-05T22:36:17.342102Z","submitted_at":"2024-07-21T05:27:53Z","title":"MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15060","snapshot_observed_at":"2026-08-06T13:31:10.834751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.834751Z"},"links":{"cited_paper":"/paper/2407.15060","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b0b4fdf3e0a54de405305ba281da804f9cb18ac4d5c18a5a48478cfa49afe1c8","observation_id":"09781b71-b120-4f52-8a6a-e45d94bd576c","resolution":{"observed_at":"2026-08-06T13:31:10.834751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07674","last_updated":"2025-03-10T03:30:55Z","snapshot_observed_at":"2026-08-07T17:18:07.972907Z","submitted_at":"2025-03-10T03:30:55Z","title":"TVNet: A Novel Time Series Analysis Method Based on Dynamic Convolution and 3D-Variation","version":1},"cited_work":{"arxiv_id":"2503.07674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07674","snapshot_observed_at":"2026-08-06T13:31:17.505096Z","title":"TVNet: A Novel Time Series Analysis Method Based on Dynamic Convolution and 3D-Variation","venue":"cs.LG","work_id":"fd302602-0944-4d27-a959-6f448a0b32ac","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.964752Z"},"links":{"cited_paper":"/paper/2503.07674","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:e7d4a40a3a906c1aadfa69467203806158cf568e577c6e2d673084759b9faf13","observation_id":"4666f6b3-0360-41cb-97c8-cc5004d07115","resolution":{"observed_at":"2026-08-06T13:31:17.676029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:24.025765Z","title":null,"venue":null,"work_id":"cfbaf8b8-eb96-4c9f-b0ff-2c8f851dceca","year":null},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.164763Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b7f9193a8468b790e1cda97222c8952743cadd53d6b794a2e7957e628d2d419f","observation_id":"cf37bb44-a4e5-4807-a087-2789161cf54b","resolution":{"observed_at":"2026-08-06T13:31:24.184748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.810110Z","title":null,"venue":null,"work_id":"29049890-8aaf-4ebf-a0cf-3b0bc4620298","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.548557Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:57a655917c5784df3d2394b39901d51a599899b72de4223e7a7be6aeebc60f2b","observation_id":"fada53b0-1ac8-463c-88ef-a5e836b19338","resolution":{"observed_at":"2026-08-06T13:31:23.884754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06296","last_updated":"2024-12-09T08:40:10Z","snapshot_observed_at":"2026-08-01T15:37:54.932804Z","submitted_at":"2024-12-09T08:40:10Z","title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","version":1},"cited_work":{"arxiv_id":"2412.06296","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06296","snapshot_observed_at":"2026-08-06T13:31:17.167933Z","title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","venue":"cs.SD","work_id":"abed0374-2b20-4e2d-b74c-96992a9a2fa0","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.694752Z"},"links":{"cited_paper":"/paper/2412.06296","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:32a7d6734af7d6f88247ed3af177389aab1b158c842fd647f1bc13cc37675168","observation_id":"307c7773-b5bc-4cc0-9a3b-d2cb44054f48","resolution":{"observed_at":"2026-08-06T13:31:17.313299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.583068Z","title":null,"venue":null,"work_id":"b170180c-d1bb-40e0-8336-8c6d7fa89c61","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.824752Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:ba32a802f78160d307909f309e5560c0f0a3c215de30a91e39cfdb1fe803ae3b","observation_id":"e368d43f-6a09-47b8-b896-ffda2e51463f","resolution":{"observed_at":"2026-08-06T13:31:23.663726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07450","last_updated":"2024-09-11T17:56:48Z","snapshot_observed_at":"2026-07-06T19:13:55.363649Z","submitted_at":"2024-09-11T17:56:48Z","title":"VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07450","snapshot_observed_at":"2026-08-06T13:31:11.984761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.984761Z"},"links":{"cited_paper":"/paper/2409.07450","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:6960abd168efd6a6c922542c526b65b96f68844d0c4dc14c438ac20a1663aa10","observation_id":"a9a6679b-1c10-40a5-951a-300cf4e957b5","resolution":{"observed_at":"2026-08-06T13:31:11.984761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11255","last_updated":"2024-12-09T16:15:07Z","snapshot_observed_at":"2026-07-06T16:49:33.776407Z","submitted_at":"2023-11-19T06:50:52Z","title":"M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11255","snapshot_observed_at":"2026-08-06T13:31:12.134837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.134837Z"},"links":{"cited_paper":"/paper/2311.11255","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:d0284a11a6266e6c671772371003d1271a7297f4489dc261afb3b6fc7080305a","observation_id":"1f26ac52-abd5-4bb1-9adc-3a21d04b7115","resolution":{"observed_at":"2026-08-06T13:31:12.134837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.291014Z","title":null,"venue":null,"work_id":"5559680b-39d0-4428-9930-215b0a4e5d84","year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.254746Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:fe6d15286a064f88286fe1dc065189c11c2e5f3b75993f96aefd5d61fd0da7c7","observation_id":"7bc6798d-0256-4778-81a6-16bb1ac55eb9","resolution":{"observed_at":"2026-08-06T13:31:23.460845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-06T19:39:54.540216Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-06T13:31:12.444751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.444751Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:bb1b70924eb64b97402cc06ab6aba567cb35dafa5d74e9b3a5b4c1804aece467","observation_id":"96a2debe-1a19-49b5-b9b0-f38a10d7574e","resolution":{"observed_at":"2026-08-06T13:31:12.444751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.055726Z","title":null,"venue":null,"work_id":"df9ecca3-0523-46b9-86c3-89eaa5308772","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.584749Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:28666cc60ab43dbe6d3c8914dce89720d4b8ce3c0ad1a9748284f95587538d5e","observation_id":"bdbbdedb-aa69-4eea-a382-764b21ae2964","resolution":{"observed_at":"2026-08-06T13:31:23.181364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:12.714746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.714746Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:70454e059d8494a299d8382d533b12ab404328dd629f873a62504c8a2a626d53","observation_id":"1163c1bf-85d0-4b3b-8c86-af8826b7f75f","resolution":{"observed_at":"2026-08-06T13:31:12.714746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:22.544172Z","title":null,"venue":null,"work_id":"82040616-66db-451f-98aa-a0fe6b67d188","year":2014},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.804394Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:653b9dbf6e87aa7241127734429c17eef92bcf4edc82b259b8b40a3fe064bd1e","observation_id":"098dadb1-c5ce-4a30-954e-2b2793cab6a6","resolution":{"observed_at":"2026-08-06T13:31:22.734752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12563","last_updated":"2024-07-30T09:44:09Z","snapshot_observed_at":"2026-08-06T07:00:18.363594Z","submitted_at":"2024-07-17T13:47:17Z","title":"Audio Conditioning for Music Generation via Discrete Bottleneck Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12563","snapshot_observed_at":"2026-08-06T13:31:12.936145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.936145Z"},"links":{"cited_paper":"/paper/2407.12563","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:72f3e8b9bf4f27f1d7992e0366ffe18be3a83f97cb2384563e61c82f887853f4","observation_id":"0b578196-a503-4a14-9c5f-9cea4eb10f9e","resolution":{"observed_at":"2026-08-06T13:31:12.936145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:22.237024Z","title":null,"venue":null,"work_id":"70f3e9f3-33ec-4b1d-a6ed-c2e6022e5f47","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.043146Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:df52f019d73fc87827e79675c939cdbd680844842a22334db269a1411c78e357","observation_id":"f2b9779e-e847-401d-b822-88c8bfa616b5","resolution":{"observed_at":"2026-08-06T13:31:22.324750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:13.204743Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.204743Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:5f288f692d8c723e496fff1bbb11a9ef5da2ad9d0a3c7d797bf85475dc6d3556","observation_id":"5847cef5-d2f6-41c8-8bc1-45a2ae556c1e","resolution":{"observed_at":"2026-08-06T13:31:13.204743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:21.814647Z","title":null,"venue":null,"work_id":"b809b2fc-3dc8-4b19-bbd9-9d5ab0809988","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.315774Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:140a0539d16fb592c3da40d85cd8fa65cded59bc5e596423b04a49149d1981fb","observation_id":"d7f0e449-40ea-4cfb-9429-c25d112d2dc2","resolution":{"observed_at":"2026-08-06T13:31:21.975006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03478","last_updated":"2020-12-07T06:54:10Z","snapshot_observed_at":"2026-08-04T07:30:08.371048Z","submitted_at":"2020-12-07T06:54:10Z","title":"Multi-Instrumentalist Net: Unsupervised Generation of Music from Body Movements","version":1},"cited_work":{"arxiv_id":"2012.03478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03478","snapshot_observed_at":"2026-08-06T13:31:16.334863Z","title":"Multi-Instrumentalist Net: Unsupervised Generation of Music from Body Movements","venue":"cs.SD","work_id":"8af94fba-b73f-4235-8c68-1bf3a9269957","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.454309Z"},"links":{"cited_paper":"/paper/2012.03478","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:4ff0dd6d273bffdf24a986de127ea114f644abf75f0dd7a43dfa59f2c93f7212","observation_id":"b312366f-bc89-470a-b2fe-9179c8ed0cfe","resolution":{"observed_at":"2026-08-06T13:31:16.476702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04321","last_updated":"2025-05-07T15:59:51Z","snapshot_observed_at":"2026-08-06T11:22:41.689160Z","submitted_at":"2024-06-06T17:58:11Z","title":"VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04321","snapshot_observed_at":"2026-08-06T13:31:13.546156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.546156Z"},"links":{"cited_paper":"/paper/2406.04321","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:d16bcd7168a4b20d279427fe9e14bb3c40986c98dc4ace08f03b52c5a60d64a7","observation_id":"7ddbb19c-5d4a-4b51-af85-9cd9dbd4a62e","resolution":{"observed_at":"2026-08-06T13:31:13.546156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:13.683006Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.683006Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:449d6db480bb993c911d63505c5fe688502a2482b67a3834a9cf6e1a87ea3f8c","observation_id":"765d0d1f-a737-4c32-9fb7-c8f9a579cf9b","resolution":{"observed_at":"2026-08-06T13:31:13.683006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:21.394766Z","title":null,"venue":null,"work_id":"eea82c64-3763-437b-8df6-403ca15f0ef3","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.976066Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:e487725f92c98e1c42680c573497bd88286dbf1f472f9065911288b9d98a235c","observation_id":"4350494e-071a-4d12-9830-ae1370eb45bf","resolution":{"observed_at":"2026-08-06T13:31:21.524443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:21.178647Z","title":null,"venue":null,"work_id":"971a2cb5-8994-40f6-a06e-bae2d967d0d9","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.101294Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:03d3d497da7d2cdc72f2f3a2b7fd156bf9a3b48800d3b07b8300be784cf35d07","observation_id":"f5792cba-75b0-4f1a-8a0b-d42dbdd3dc68","resolution":{"observed_at":"2026-08-06T13:31:21.277512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.897788Z","title":null,"venue":null,"work_id":"d37c3edb-f86a-4fea-8582-9d076e082c89","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.262983Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:a22736bedda52a88972f19cd5af3bb0d547520148c5753a0b2539633583fa9b2","observation_id":"24e46f06-4091-4fe9-a704-691d0f600eb7","resolution":{"observed_at":"2026-08-06T13:31:21.064754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.554750Z","title":null,"venue":null,"work_id":"79014024-58ff-445c-b2ca-a1729c8c214b","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.384752Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:0518baf42886efc6724fa8bfe1ebda3f967c74d6ead800fcac9c400b409037c0","observation_id":"6d12b699-e03b-428c-b768-1935218270f4","resolution":{"observed_at":"2026-08-06T13:31:20.667105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.304742Z","title":null,"venue":null,"work_id":"d71f2142-3732-465a-b3f2-bdf30804b398","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.484865Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:96599f56a74688b5315b849a063df06af2e2265b5f840ba8d988e9a4d52c83b4","observation_id":"923dc8ce-bde2-42aa-b084-b425dead1057","resolution":{"observed_at":"2026-08-06T13:31:20.417611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.076226Z","title":null,"venue":null,"work_id":"94d16e61-c4f4-4dc5-8e7d-452e65fee2f4","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.674753Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:cf05943c5134aebaf5a9e1cc84d8a262580112e937a314e196277ec5a5e91ebb","observation_id":"64c2885d-a07c-4c86-9e42-163d706026ed","resolution":{"observed_at":"2026-08-06T13:31:20.134807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:19.788533Z","title":null,"venue":null,"work_id":"14443f8d-134c-412b-a2f8-511e72f5b677","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.872875Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:673d701cdd1b297a4c2779baeb4bcb26565c21e72dcf354b8e4655d6c9519939","observation_id":"abfd928d-26b0-4b57-9ad5-318dbf747c82","resolution":{"observed_at":"2026-08-06T13:31:19.931114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:19.392928Z","title":null,"venue":null,"work_id":"5af6c112-a684-4382-8de7-5b4410aac446","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.064107Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:8464a12cbec78f5eb7f6ba6f860e182c6e17e3cd92b273aaa44803ae86078b30","observation_id":"da89b970-7cfe-4a4d-997a-decb600d8280","resolution":{"observed_at":"2026-08-06T13:31:19.586700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:15.267845Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.267845Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:1c7a663498c3448b909d48a3f9fbb73a16b7001562f9de6eebd7a585d05095b4","observation_id":"c35b3feb-0e55-4a8c-9fec-1e2535dbaa1a","resolution":{"observed_at":"2026-08-06T13:31:15.267845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:19.035836Z","title":null,"venue":null,"work_id":"08515fe2-058c-442d-9150-4bacda242bb2","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.479723Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:fed0a21cbd864a5a2d1f4302c93d0f872b86165d628ef1b87bd62dbacb051251","observation_id":"76fe97e4-5fa1-4b50-9cd3-422060b6ae5c","resolution":{"observed_at":"2026-08-06T13:31:19.177842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:18.784774Z","title":null,"venue":null,"work_id":"61165dec-d87c-40bc-aa8f-2660136ac7b8","year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.591214Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:e65cb23d8a7475b82a825f3410c7b140cbc10e5d8be06bea5c4033f13b42b5e5","observation_id":"f80f374f-554f-46db-b81c-bd6c7f992cb6","resolution":{"observed_at":"2026-08-06T13:31:18.875328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:18.559141Z","title":null,"venue":null,"work_id":"69db734a-4a28-4b9b-ad1d-51e92f26736a","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.749347Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:cbd44cf5e96d94c2e1bec828111a2d6236db04eca42c3121811a20817edacd7c","observation_id":"49a9a8de-dafa-48c4-9402-eabe254b2b5f","resolution":{"observed_at":"2026-08-06T13:31:18.626356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:18.394787Z","title":"rhythm presets","venue":null,"work_id":"248123c5-5075-4fc2-8b3d-f779aba24132","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.877382Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:320b05b67f8b2c0b215184952fc418ab3098e28c1cb97dd69857a8596d15ee05","observation_id":"53de3b0b-5939-4cbd-8a45-f297a4f41c9d","resolution":{"observed_at":"2026-08-06T13:31:18.494815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-06T13:31:11.375359Z","title":"arXiv preprint arXiv:2410.12957 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.375359Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:525e2fd3e3d79c944d0c8103f3d6043ab41d311a6b2aa47a0cdaa6fa6c03bcdd","observation_id":"b1c89c59-1a2a-4c02-bf83-afc3c1a059e2","resolution":{"observed_at":"2026-08-06T13:31:11.375359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T13:56:06.044916Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.20627."}