{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:SSZU5CXICXLLOSK5BLEU6OCT5W","short_pith_number":"pith:SSZU5CXI","schema_version":"1.0","canonical_sha256":"94b34e8ae815d6b7495d0ac94f3853edb2f5a982288e566515c6df845aa11473","source":{"kind":"arxiv","id":"2411.16201","version":1},"attestation_state":"computed","paper":{"title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"cs.LG","authors_text":"Di Zhang, Fuzheng Zhang, Hao Yi, Qingyang Li, Yong Liu, Yulan Hu","submitted_at":"2024-11-25T08:59:39Z","abstract_excerpt":"High-quality video-text preference data is crucial for Multimodal Large Language Models (MLLMs) alignment. However, existing preference data is very scarce. Obtaining VQA preference data for preference training is costly, and manually annotating responses is highly unreliable, which could result in low-quality pairs. Meanwhile, AI-generated responses controlled by temperature adjustment lack diversity. To address these issues, we propose a high-quality VQA preference dataset, called \\textit{\\textbf{M}ultiple \\textbf{M}ultimodal \\textbf{A}rtificial \\textbf{I}ntelligence \\textbf{P}reference Data"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.16201","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-11-25T08:59:39Z","cross_cats_sorted":["cs.CL","cs.CV"],"title_canon_sha256":"c546a6fdd7a47c1a42a4bae6c5c4c862ad5accaf8810e05f09c1b2290a214cbc","abstract_canon_sha256":"83dd5bdd0b48bd8fbde73daa17ee2bc54a85ec85ecc7e31aa70d8282c5d04d65"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:40:05.762067Z","signature_b64":"vnlVVeyULlzi9zLfeZAnAfgVQd2LGJbIsyy2NAICufCukxJBnw4tsf/Ie8xsYwvlmmNoCjqMHNm+5haQrLVtDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"94b34e8ae815d6b7495d0ac94f3853edb2f5a982288e566515c6df845aa11473","last_reissued_at":"2026-07-05T09:40:05.761734Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:40:05.761734Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"cs.LG","authors_text":"Di Zhang, Fuzheng Zhang, Hao Yi, Qingyang Li, Yong Liu, Yulan Hu","submitted_at":"2024-11-25T08:59:39Z","abstract_excerpt":"High-quality video-text preference data is crucial for Multimodal Large Language Models (MLLMs) alignment. However, existing preference data is very scarce. Obtaining VQA preference data for preference training is costly, and manually annotating responses is highly unreliable, which could result in low-quality pairs. Meanwhile, AI-generated responses controlled by temperature adjustment lack diversity. To address these issues, we propose a high-quality VQA preference dataset, called \\textit{\\textbf{M}ultiple \\textbf{M}ultimodal \\textbf{A}rtificial \\textbf{I}ntelligence \\textbf{P}reference Data"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.16201","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.16201/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.16201","created_at":"2026-07-05T09:40:05.761789+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.16201v1","created_at":"2026-07-05T09:40:05.761789+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.16201","created_at":"2026-07-05T09:40:05.761789+00:00"},{"alias_kind":"pith_short_12","alias_value":"SSZU5CXICXLL","created_at":"2026-07-05T09:40:05.761789+00:00"},{"alias_kind":"pith_short_16","alias_value":"SSZU5CXICXLLOSK5","created_at":"2026-07-05T09:40:05.761789+00:00"},{"alias_kind":"pith_short_8","alias_value":"SSZU5CXI","created_at":"2026-07-05T09:40:05.761789+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W","json":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W.json","graph_json":"https://pith.science/api/pith-number/SSZU5CXICXLLOSK5BLEU6OCT5W/graph.json","events_json":"https://pith.science/api/pith-number/SSZU5CXICXLLOSK5BLEU6OCT5W/events.json","paper":"https://pith.science/paper/SSZU5CXI"},"agent_actions":{"view_html":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W","download_json":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W.json","view_paper":"https://pith.science/paper/SSZU5CXI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.16201&json=true","fetch_graph":"https://pith.science/api/pith-number/SSZU5CXICXLLOSK5BLEU6OCT5W/graph.json","fetch_events":"https://pith.science/api/pith-number/SSZU5CXICXLLOSK5BLEU6OCT5W/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W/action/storage_attestation","attest_author":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W/action/author_attestation","sign_citation":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W/action/citation_signature","submit_replication":"https://pith.science/pith/SSZU5CXICXLLOSK5BLEU6OCT5W/action/replication_record"}},"created_at":"2026-07-05T09:40:05.761789+00:00","updated_at":"2026-07-05T09:40:05.761789+00:00"}