{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:B7E5CCZTPTYYIJMAZUWCLYFJVP","short_pith_number":"pith:B7E5CCZT","schema_version":"1.0","canonical_sha256":"0fc9d10b337cf1842580cd2c25e0a9abcd1e53f675e2ad1d5110b826da81cff8","source":{"kind":"arxiv","id":"2502.10391","version":1},"attestation_state":"computed","paper":{"title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.CL","authors_text":"Bin Wen, Chaoyou Fu, Di Zhang, Fan Yang, Haochen Tian, Huanyu Zhang, Jianshu Zeng, Junkang Wu, Liang Wang, Peiyan Li, Rong Jin, Tao Yu, Tieniu Tan, Tingting Gao, Wulin Xie, Xue Wang, Yang Shi, Yibo Hu, Yi-Fan Zhang, Zhang Zhang","submitted_at":"2025-02-14T18:59:51Z","abstract_excerpt":"Despite notable advancements in Multimodal Large Language Models (MLLMs), most state-of-the-art models have not undergone thorough alignment with human preferences. This gap exists because current alignment research has primarily achieved progress in specific areas (e.g., hallucination reduction), while the broader question of whether aligning models with human preferences can systematically enhance MLLM capability remains largely unexplored. To this end, we introduce MM-RLHF, a dataset containing $\\mathbf{120k}$ fine-grained, human-annotated preference comparison pairs. This dataset represent"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.10391","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-02-14T18:59:51Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"ace61238885667c876e75c9e84823fd50767ffaa5e55372c0766b1ccc08ca04a","abstract_canon_sha256":"880d0a2188ab199f11fcbb7c75e77abf0786be3acca58013864d2e23170cb6a5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:14:33.343153Z","signature_b64":"ycpAYTwe0Y3WO6XPzPKoC6dI/gp8utG1g4mCP150mOs9kinhcy1EXh2MeG+DczjVK2Mrzf1txcrdWtaQXdelCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0fc9d10b337cf1842580cd2c25e0a9abcd1e53f675e2ad1d5110b826da81cff8","last_reissued_at":"2026-07-05T10:14:33.342669Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:14:33.342669Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.CL","authors_text":"Bin Wen, Chaoyou Fu, Di Zhang, Fan Yang, Haochen Tian, Huanyu Zhang, Jianshu Zeng, Junkang Wu, Liang Wang, Peiyan Li, Rong Jin, Tao Yu, Tieniu Tan, Tingting Gao, Wulin Xie, Xue Wang, Yang Shi, Yibo Hu, Yi-Fan Zhang, Zhang Zhang","submitted_at":"2025-02-14T18:59:51Z","abstract_excerpt":"Despite notable advancements in Multimodal Large Language Models (MLLMs), most state-of-the-art models have not undergone thorough alignment with human preferences. This gap exists because current alignment research has primarily achieved progress in specific areas (e.g., hallucination reduction), while the broader question of whether aligning models with human preferences can systematically enhance MLLM capability remains largely unexplored. To this end, we introduce MM-RLHF, a dataset containing $\\mathbf{120k}$ fine-grained, human-annotated preference comparison pairs. This dataset represent"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.10391","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.10391/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.10391","created_at":"2026-07-05T10:14:33.342723+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.10391v1","created_at":"2026-07-05T10:14:33.342723+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.10391","created_at":"2026-07-05T10:14:33.342723+00:00"},{"alias_kind":"pith_short_12","alias_value":"B7E5CCZTPTYY","created_at":"2026-07-05T10:14:33.342723+00:00"},{"alias_kind":"pith_short_16","alias_value":"B7E5CCZTPTYYIJMA","created_at":"2026-07-05T10:14:33.342723+00:00"},{"alias_kind":"pith_short_8","alias_value":"B7E5CCZT","created_at":"2026-07-05T10:14:33.342723+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.10651","citing_title":"Kwai Keye-VL-2.0 Technical Report","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08525","citing_title":"DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03089","citing_title":"Constitutional On-Policy Safe Distillation","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25343","citing_title":"Toward Native Multimodal Modeling: A Roadmap","ref_index":143,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22012","citing_title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18984","citing_title":"Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2510.21122","citing_title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2502.17419","citing_title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","ref_index":283,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09269","citing_title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21718","citing_title":"Building a Precise Video Language with Human-AI Oversight","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12424","citing_title":"Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18091","citing_title":"Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts","ref_index":61,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP","json":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP.json","graph_json":"https://pith.science/api/pith-number/B7E5CCZTPTYYIJMAZUWCLYFJVP/graph.json","events_json":"https://pith.science/api/pith-number/B7E5CCZTPTYYIJMAZUWCLYFJVP/events.json","paper":"https://pith.science/paper/B7E5CCZT"},"agent_actions":{"view_html":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP","download_json":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP.json","view_paper":"https://pith.science/paper/B7E5CCZT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.10391&json=true","fetch_graph":"https://pith.science/api/pith-number/B7E5CCZTPTYYIJMAZUWCLYFJVP/graph.json","fetch_events":"https://pith.science/api/pith-number/B7E5CCZTPTYYIJMAZUWCLYFJVP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP/action/storage_attestation","attest_author":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP/action/author_attestation","sign_citation":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP/action/citation_signature","submit_replication":"https://pith.science/pith/B7E5CCZTPTYYIJMAZUWCLYFJVP/action/replication_record"}},"created_at":"2026-07-05T10:14:33.342723+00:00","updated_at":"2026-07-05T10:14:33.342723+00:00"}