{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:6VFWJJVLXYSYOL3HT3ZAKUZHDN","short_pith_number":"pith:6VFWJJVL","schema_version":"1.0","canonical_sha256":"f54b64a6abbe25872f679ef20553271b735c6205ac232532d3f0d4a0d19eec81","source":{"kind":"arxiv","id":"2407.20962","version":3},"attestation_state":"computed","paper":{"title":"MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.MM","cs.SD","eess.AS"],"primary_cat":"cs.CV","authors_text":"Aosong Cheng, Jiahao Pan, Mengfei Li, Pengjun Fang, Qifeng Chen, Qifeng Liu, Rongyu Zhang, Ruibin Yuan, Shanghang Zhang, Wei Xue, Wenhan Luo, Xiaowei Chi, Xingqun Qi, Yanbing Jiang, Yatian Wang, Yike Guo, Yingqing He, Zeyue Tian, Zhaoyang Liu","submitted_at":"2024-07-30T16:43:24Z","abstract_excerpt":"Massive multi-modality datasets play a significant role in facilitating the success of large video-language models. However, current video-language datasets primarily provide text descriptions for visual frames, considering audio to be weakly related information. They usually overlook exploring the potential of inherent audio-visual correlation, leading to monotonous annotation within each modality instead of comprehensive and precise descriptions. Such ignorance results in the difficulty of multiple cross-modality studies. To fulfill this gap, we present MMTrail, a large-scale multi-modality "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.20962","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-07-30T16:43:24Z","cross_cats_sorted":["cs.MM","cs.SD","eess.AS"],"title_canon_sha256":"335c37f76fdd2adb20d5d0d61f9cdd6cdda5a33339d801957eab0060d0c530fa","abstract_canon_sha256":"ec2094f9c2b5ffddc6db0c8aac94816b324672198a7df19b4b88908509966734"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:50:04.285168Z","signature_b64":"v2x64LnfRDy7zoskYojf6Bjw3r+lAa0w3vy+rQqjrazzamPSEGeXJMvt6Tr/Uf0psbaA83RlTcg+V1lWfo/cDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f54b64a6abbe25872f679ef20553271b735c6205ac232532d3f0d4a0d19eec81","last_reissued_at":"2026-07-05T09:50:04.284556Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:50:04.284556Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.MM","cs.SD","eess.AS"],"primary_cat":"cs.CV","authors_text":"Aosong Cheng, Jiahao Pan, Mengfei Li, Pengjun Fang, Qifeng Chen, Qifeng Liu, Rongyu Zhang, Ruibin Yuan, Shanghang Zhang, Wei Xue, Wenhan Luo, Xiaowei Chi, Xingqun Qi, Yanbing Jiang, Yatian Wang, Yike Guo, Yingqing He, Zeyue Tian, Zhaoyang Liu","submitted_at":"2024-07-30T16:43:24Z","abstract_excerpt":"Massive multi-modality datasets play a significant role in facilitating the success of large video-language models. However, current video-language datasets primarily provide text descriptions for visual frames, considering audio to be weakly related information. They usually overlook exploring the potential of inherent audio-visual correlation, leading to monotonous annotation within each modality instead of comprehensive and precise descriptions. Such ignorance results in the difficulty of multiple cross-modality studies. To fulfill this gap, we present MMTrail, a large-scale multi-modality "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.20962","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.20962/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.20962","created_at":"2026-07-05T09:50:04.284639+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.20962v3","created_at":"2026-07-05T09:50:04.284639+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.20962","created_at":"2026-07-05T09:50:04.284639+00:00"},{"alias_kind":"pith_short_12","alias_value":"6VFWJJVLXYSY","created_at":"2026-07-05T09:50:04.284639+00:00"},{"alias_kind":"pith_short_16","alias_value":"6VFWJJVLXYSYOL3H","created_at":"2026-07-05T09:50:04.284639+00:00"},{"alias_kind":"pith_short_8","alias_value":"6VFWJJVL","created_at":"2026-07-05T09:50:04.284639+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05971","citing_title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","ref_index":3,"is_internal_anchor":true},{"citing_arxiv_id":"2606.12555","citing_title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01703","citing_title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04953","citing_title":"Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN","json":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN.json","graph_json":"https://pith.science/api/pith-number/6VFWJJVLXYSYOL3HT3ZAKUZHDN/graph.json","events_json":"https://pith.science/api/pith-number/6VFWJJVLXYSYOL3HT3ZAKUZHDN/events.json","paper":"https://pith.science/paper/6VFWJJVL"},"agent_actions":{"view_html":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN","download_json":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN.json","view_paper":"https://pith.science/paper/6VFWJJVL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.20962&json=true","fetch_graph":"https://pith.science/api/pith-number/6VFWJJVLXYSYOL3HT3ZAKUZHDN/graph.json","fetch_events":"https://pith.science/api/pith-number/6VFWJJVLXYSYOL3HT3ZAKUZHDN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN/action/storage_attestation","attest_author":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN/action/author_attestation","sign_citation":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN/action/citation_signature","submit_replication":"https://pith.science/pith/6VFWJJVLXYSYOL3HT3ZAKUZHDN/action/replication_record"}},"created_at":"2026-07-05T09:50:04.284639+00:00","updated_at":"2026-07-05T09:50:04.284639+00:00"}