{"as_of":"2026-08-08T23:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8112b313a645322358857e8828d285edc26adc9f184921c5951668dc85bc6afe","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:05:12.150659Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20038/citation-record","integrity":"/paper/2505.20038/integrity","json":"/paper/2505.20038/citation-record.json","paper":"/paper/2505.20038"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17698","last_updated":"2025-03-17T17:44:37Z","snapshot_observed_at":"2026-07-31T09:11:09.636803Z","submitted_at":"2024-11-26T18:59:58Z","title":"Video-Guided Foley Sound Generation with Multimodal Controls","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17698","snapshot_observed_at":"2026-08-07T14:05:09.819840Z","title":"Video-guided foley sound generation with multimodal con- trols","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:09.819840Z"},"links":{"cited_paper":"/paper/2411.17698","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:2573980e06c205973546914d00f8642406aac7381fc9aa01f93527251512e46b","observation_id":"5001ff69-54ec-4cfe-8d99-1f5e3c17a8b5","resolution":{"observed_at":"2026-08-07T14:05:09.819840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-06T05:50:22.451260Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"cited_work":{"arxiv_id":"2412.09168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09168","snapshot_observed_at":"2026-08-07T14:05:12.689961Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","venue":"cs.SD","work_id":"5af1b514-b51b-46ba-b3a7-c958279d146b","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:09.874214Z"},"links":{"cited_paper":"/paper/2412.09168","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:ab4257765cbe49af69ac2328935254f37f56e6b2166373859742326b6a0b8225","observation_id":"bade64f8-cec2-4ab2-ab56-2e7f85d2b730","resolution":{"observed_at":"2026-08-07T14:05:12.786853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T14:05:09.943750Z","title":"Tam- ing multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:09.943750Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:885817be3565a98f507d243ece1f841f88ebfe8e39c223d6ca1e8af4e4cd8403","observation_id":"2309e642-f146-464a-a083-36fb2b903a66","resolution":{"observed_at":"2026-08-07T14:05:09.943750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:05:10.009315Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.009315Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:c07e74fd9820cb179e34d0264f0766aff116efb009adfe37cd27cd9a87d5dd42","observation_id":"0d41f6e1-c5b0-4aba-8b10-537ae6f9645d","resolution":{"observed_at":"2026-08-07T14:05:10.009315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:10.132451Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.132451Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:c0fea969db1e02b37ff0926e573af9052b92b4fca1da55e7db325bbaebed6e6e","observation_id":"26bf0cc3-e0af-410d-8e83-5b219d1d5a88","resolution":{"observed_at":"2026-08-07T14:05:10.132451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:14.405555Z","title":"Taming visually guided sound generation","venue":null,"work_id":"65ee2283-7ec6-4b78-a64d-a8996be772d3","year":2021},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.225285Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:5476f1acde7ccffb5185545b721182e496d4d11f2785d891865ebe8dcd98a67d","observation_id":"be61c9ec-bfb7-4bdc-9141-01856861c8e0","resolution":{"observed_at":"2026-08-07T14:05:14.505860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:14.212468Z","title":"Sophia Koepke, Olivia Wiles, Yael Moses, and Andrew Zisserman","venue":null,"work_id":"b7904ded-0b40-43e0-907e-1decaf81d52e","year":2020},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.374623Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:b9942e803e0aabf93de9eea484e315c0a77568e451cf9b691dde51b7e1edccdf","observation_id":"0562a702-3591-42da-91a1-9f6291dbbe66","resolution":{"observed_at":"2026-08-07T14:05:14.327614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.965213Z","title":"Crandall, and Christopher Raphael","venue":null,"work_id":"fa376e28-3a21-40e0-ae6f-446471a9de56","year":2019},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.495877Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:acd74beb175965a073e965d5ecfcfcbc0e8966b567e70980b2a26c94157b933a","observation_id":"84250236-4a2f-410b-8b7e-80c0110144ff","resolution":{"observed_at":"2026-08-07T14:05:14.101676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20378","last_updated":"2024-12-29T06:46:24Z","snapshot_observed_at":"2026-08-06T09:56:03.623451Z","submitted_at":"2024-12-29T06:46:24Z","title":"Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control","version":1},"cited_work":{"arxiv_id":"2412.20378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20378","snapshot_observed_at":"2026-08-07T14:05:12.498296Z","title":"Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control","venue":"cs.CV","work_id":"0e4cedca-3691-49e5-b480-0ee629216324","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.608172Z"},"links":{"cited_paper":"/paper/2412.20378","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:acbe89f0fceec92d2065c6f9d7ffbeb81edd62525059ab4c4f4dc455e6982515","observation_id":"8e7bcbcc-767a-40d2-ae68-369c5ecf4d75","resolution":{"observed_at":"2026-08-07T14:05:12.592926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.724190Z","title":"Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models, 2023","venue":null,"work_id":"479eed8f-0d48-4c88-85fd-5942799fc2a4","year":2023},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.693496Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:29ad8306d68105cf17cff6ee4102b111215a38b917dfa3178857248227d8ea1f","observation_id":"58c5112c-09e0-4fee-8b63-9ea593e6c88e","resolution":{"observed_at":"2026-08-07T14:05:13.840027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.470928Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":"67d83394-1be1-4953-a957-6aedee9f2343","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.818067Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:e343c284b4877eb32e404707c71b5041fe864246583458dca59ce86dd52801cc","observation_id":"142adb7a-b282-4e1f-b92e-0b5caa682562","resolution":{"observed_at":"2026-08-07T14:05:13.604068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.338648Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":"aa776937-a873-47a2-a397-82f7e53a4e38","year":2025},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.960063Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:59cd9f3211845f177a772f167e34577409e645ab9f1bc1b27f7af1608ed15ee1","observation_id":"5726a169-6270-466d-b1fa-5fbad09bc8d6","resolution":{"observed_at":"2026-08-07T14:05:13.403506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.035226Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.035226Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:fbc5fdf78493fa6a80b69a66690d0571f22c38ebade3d5ce42205a60e5e124e8","observation_id":"571820b7-73f0-4787-ac9a-5534892b862e","resolution":{"observed_at":"2026-08-07T14:05:11.035226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.152150Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.152150Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:2f2088f55df193cb50ce3a2c3238987d2a834579c6cc14e69c5c3fa5ad35a5d2","observation_id":"0c40d3e8-45a1-4301-9083-8ca8d04573a2","resolution":{"observed_at":"2026-08-07T14:05:11.152150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14348","last_updated":"2020-06-23T00:58:59Z","snapshot_observed_at":"2026-07-06T09:32:42.212884Z","submitted_at":"2020-06-23T00:58:59Z","title":"Audeo: Audio Generation for a Silent Performance Video","version":1},"cited_work":{"arxiv_id":"2006.14348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.14348","snapshot_observed_at":"2026-08-07T14:05:12.329790Z","title":"Audeo: Audio Generation for a Silent Performance Video","venue":"cs.CV","work_id":"894ed98e-4bc7-4cb4-b104-2291d0f88221","year":2020},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.255279Z"},"links":{"cited_paper":"/paper/2006.14348","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:0a0b932cfa607a8de929a8795480cf1fa81b2c2a838acaa95d4ab38297afc046","observation_id":"2fde6f11-e80f-45b7-9201-2879022d1fe5","resolution":{"observed_at":"2026-08-07T14:05:12.402036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-07T14:05:11.305127Z","title":"Audiox: Diffusion transformer for anything-to-audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.305127Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:785aecf8dd8fdd9258534d734a5076e3b35a5d627c76274d33692009009c48eb","observation_id":"bfde4dd2-da87-4953-a989-e1eb11484bd0","resolution":{"observed_at":"2026-08-07T14:05:11.305127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-04T07:34:16.448345Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-07T14:05:11.397850Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.397850Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:9195ab7d15873ad406bf2d7067eadab1096c20f78962e8cee3380b4cbc97e135","observation_id":"8aab714f-f38e-46bd-abbc-3c3d4a717b46","resolution":{"observed_at":"2026-08-07T14:05:11.397850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.082175Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models, 2023","venue":null,"work_id":"41cdb009-283d-485b-b66e-a1cc37b8514c","year":2023},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.478150Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:f86009f63d2072689b979e451f09da7f0a9eb59368b6592c62b485d76c27d6d7","observation_id":"4163fa1e-cbdb-4479-8a77-037d6e2d1217","resolution":{"observed_at":"2026-08-07T14:05:13.199507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-07-06T18:23:39.931536Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-07T14:05:11.602718Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.602718Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:5b3ee1b9d89a10c502f4b876b2c3d11cebc8aaef276b5092245c8c6393ebeaf6","observation_id":"c847c1af-9770-42ea-b268-32cd39ee6b86","resolution":{"observed_at":"2026-08-07T14:05:11.602718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.717744Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.717744Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:acafe2796fb065e64ec89169b65f25885b240950807dc9d3b8c48dea3032bcc3","observation_id":"d01e4aff-f9f4-49a1-abdd-c810a9e3ff68","resolution":{"observed_at":"2026-08-07T14:05:11.717744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.786319Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.786319Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:06db733cae5e87bfdeee039c52d7eb95289ea2dcc4519afa5f4416ba32ab4e7f","observation_id":"04a16f20-97f0-4ae9-ba51-3c4b66cfaf48","resolution":{"observed_at":"2026-08-07T14:05:11.786319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T14:05:11.869274Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.869274Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:7c54714a0c35c0b6e84cc955430269f9910301f51eb03ab51bf6f325f91b7297","observation_id":"c82a12f4-a32d-4160-8063-9d5fe817a8ea","resolution":{"observed_at":"2026-08-07T14:05:11.869274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:12.883583Z","title":"Diverse and aligned audio-to-video genera- tion via text-to-video model adaptation","venue":null,"work_id":"c92f59e7-035c-4968-880d-0dd54c0f2c26","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.940525Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:70d8e2648bb7002fde326a233cc55909bfbf58a4da53a370274dd8b18bda2ee8","observation_id":"408206cd-881b-4eb6-be8a-b9c0006f1583","resolution":{"observed_at":"2026-08-07T14:05:12.973198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T14:05:12.046711Z","title":"Improve vision language model chain-of- thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:12.046711Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:a5549736d5f63e762d4096af014d041f0796bd17ee583954fb1b6d94be075170","observation_id":"10a5b411-b034-47a1-b8e3-b003ce232157","resolution":{"observed_at":"2026-08-07T14:05:12.046711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T14:05:12.150659Z","title":"Foley- crafter: Bring silent videos to life with lifelike and synchro- nized sounds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:12.150659Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:05fdf4357a6046224b9994c2d5a15d4a1771c4199741e9a1738647391e704880","observation_id":"e5935e36-2c37-445e-81ae-9d1e08b05f4c","resolution":{"observed_at":"2026-08-07T14:05:12.150659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T13:58:26.646650Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2505.20038."}