{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:S6MCCZQPX6JKTLISKO7FL7JYIT","short_pith_number":"pith:S6MCCZQP","schema_version":"1.0","canonical_sha256":"979821660fbf92a9ad1253be55fd3844c40ed7ea86d7f969dd4c74689c5eae5b","source":{"kind":"arxiv","id":"2412.06296","version":1},"attestation_state":"computed","paper":{"title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Binxin Yang, Chen Li, Chong Sun, Chunji Yin, Sifei Li, Weiming Dong, Yuxin Zhang","submitted_at":"2024-12-09T08:40:10Z","abstract_excerpt":"Video-to-music generation presents significant potential in video production, requiring the generated music to be both semantically and rhythmically aligned with the video. Achieving this alignment demands advanced music generation capabilities, sophisticated video understanding, and an efficient mechanism to learn the correspondence between the two modalities. In this paper, we propose VidMusician, a parameter-efficient video-to-music generation framework built upon text-to-music models. VidMusician leverages hierarchical visual features to ensure semantic and rhythmic alignment between video"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.06296","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.SD","submitted_at":"2024-12-09T08:40:10Z","cross_cats_sorted":["eess.AS"],"title_canon_sha256":"a3c2335127667363815c3be3142d72e7ba1e920dd534012389d335e349307a79","abstract_canon_sha256":"d7999e4233919f07a21e564fb524af222de4d759593ce28bf4eaab84bdf0489d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:46:18.738603Z","signature_b64":"s8KfmJc8TaXNt/cR01ySZ9tMO+5egzsaWpOmU+lj+8bt+ezPeicqe8KF3wA+z7vt1GNbZUCHnKXarXh1MNYTCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"979821660fbf92a9ad1253be55fd3844c40ed7ea86d7f969dd4c74689c5eae5b","last_reissued_at":"2026-07-05T09:46:18.738113Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:46:18.738113Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Binxin Yang, Chen Li, Chong Sun, Chunji Yin, Sifei Li, Weiming Dong, Yuxin Zhang","submitted_at":"2024-12-09T08:40:10Z","abstract_excerpt":"Video-to-music generation presents significant potential in video production, requiring the generated music to be both semantically and rhythmically aligned with the video. Achieving this alignment demands advanced music generation capabilities, sophisticated video understanding, and an efficient mechanism to learn the correspondence between the two modalities. In this paper, we propose VidMusician, a parameter-efficient video-to-music generation framework built upon text-to-music models. VidMusician leverages hierarchical visual features to ensure semantic and rhythmic alignment between video"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.06296","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.06296/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.06296","created_at":"2026-07-05T09:46:18.738180+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.06296v1","created_at":"2026-07-05T09:46:18.738180+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.06296","created_at":"2026-07-05T09:46:18.738180+00:00"},{"alias_kind":"pith_short_12","alias_value":"S6MCCZQPX6JK","created_at":"2026-07-05T09:46:18.738180+00:00"},{"alias_kind":"pith_short_16","alias_value":"S6MCCZQPX6JKTLIS","created_at":"2026-07-05T09:46:18.738180+00:00"},{"alias_kind":"pith_short_8","alias_value":"S6MCCZQP","created_at":"2026-07-05T09:46:18.738180+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.20627","citing_title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","ref_index":28,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT","json":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT.json","graph_json":"https://pith.science/api/pith-number/S6MCCZQPX6JKTLISKO7FL7JYIT/graph.json","events_json":"https://pith.science/api/pith-number/S6MCCZQPX6JKTLISKO7FL7JYIT/events.json","paper":"https://pith.science/paper/S6MCCZQP"},"agent_actions":{"view_html":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT","download_json":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT.json","view_paper":"https://pith.science/paper/S6MCCZQP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.06296&json=true","fetch_graph":"https://pith.science/api/pith-number/S6MCCZQPX6JKTLISKO7FL7JYIT/graph.json","fetch_events":"https://pith.science/api/pith-number/S6MCCZQPX6JKTLISKO7FL7JYIT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT/action/storage_attestation","attest_author":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT/action/author_attestation","sign_citation":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT/action/citation_signature","submit_replication":"https://pith.science/pith/S6MCCZQPX6JKTLISKO7FL7JYIT/action/replication_record"}},"created_at":"2026-07-05T09:46:18.738180+00:00","updated_at":"2026-07-05T09:46:18.738180+00:00"}