{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:EUHJMUW3CBO432GXF2JVRHF7V2","short_pith_number":"pith:EUHJMUW3","schema_version":"1.0","canonical_sha256":"250e9652db105dcde8d72e93589cbfaebf030a260082f8032539a19e7478e468","source":{"kind":"arxiv","id":"2407.04842","version":1},"attestation_state":"computed","paper":{"title":"MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Canyu Chen, Chaoqi Wang, Chelsea Finn, Chenhang Cui, Haoqin Tu, Huaxiu Yao, Jiawei Zhou, Qinghao Ye, Qinglan Huang, Rafael Rafailov, Yichao Du, Yiyang Zhou, Yuqing Zhang, Zhaorun Chen, Zhengwei Tong, Zhenzhen Weng, Zhihong Zhu, Zhuokai Zhao, Zichen Wen","submitted_at":"2024-07-05T20:03:16Z","abstract_excerpt":"While text-to-image models like DALLE-3 and Stable Diffusion are rapidly proliferating, they often encounter challenges such as hallucination, bias, and the production of unsafe, low-quality output. To effectively address these issues, it is crucial to align these models with desired behaviors based on feedback from a multimodal judge. Despite their significance, current multimodal judges frequently undergo inadequate evaluation of their capabilities and limitations, potentially leading to misalignment and unsafe fine-tuning outcomes. To address this issue, we introduce MJ-Bench, a novel bench"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.04842","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-07-05T20:03:16Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"c4b2bf715043f6706a34d9239015fcdcded664618736f46663233d213b8b2165","abstract_canon_sha256":"0e5eb99383a203f8e95f9cbcb7a68b30fca01c3e2d7f994156f4d5db16297413"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:40:42.734069Z","signature_b64":"ybhHa0Tp71/j70xRsTgtNNXFFPCn/QGIi3vVFifEzH3jJGy09Kef2rjXDIswssyfvON2fbgXnVXLTv45odI7BA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"250e9652db105dcde8d72e93589cbfaebf030a260082f8032539a19e7478e468","last_reissued_at":"2026-07-05T08:40:42.733636Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:40:42.733636Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Canyu Chen, Chaoqi Wang, Chelsea Finn, Chenhang Cui, Haoqin Tu, Huaxiu Yao, Jiawei Zhou, Qinghao Ye, Qinglan Huang, Rafael Rafailov, Yichao Du, Yiyang Zhou, Yuqing Zhang, Zhaorun Chen, Zhengwei Tong, Zhenzhen Weng, Zhihong Zhu, Zhuokai Zhao, Zichen Wen","submitted_at":"2024-07-05T20:03:16Z","abstract_excerpt":"While text-to-image models like DALLE-3 and Stable Diffusion are rapidly proliferating, they often encounter challenges such as hallucination, bias, and the production of unsafe, low-quality output. To effectively address these issues, it is crucial to align these models with desired behaviors based on feedback from a multimodal judge. Despite their significance, current multimodal judges frequently undergo inadequate evaluation of their capabilities and limitations, potentially leading to misalignment and unsafe fine-tuning outcomes. To address this issue, we introduce MJ-Bench, a novel bench"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.04842","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.04842/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.04842","created_at":"2026-07-05T08:40:42.733692+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.04842v1","created_at":"2026-07-05T08:40:42.733692+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.04842","created_at":"2026-07-05T08:40:42.733692+00:00"},{"alias_kind":"pith_short_12","alias_value":"EUHJMUW3CBO4","created_at":"2026-07-05T08:40:42.733692+00:00"},{"alias_kind":"pith_short_16","alias_value":"EUHJMUW3CBO432GX","created_at":"2026-07-05T08:40:42.733692+00:00"},{"alias_kind":"pith_short_8","alias_value":"EUHJMUW3","created_at":"2026-07-05T08:40:42.733692+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09076","citing_title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2504.12501","citing_title":"Reinforcement Learning from Human Feedback","ref_index":103,"is_internal_anchor":false},{"citing_arxiv_id":"2501.09732","citing_title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16732","citing_title":"DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2506.01937","citing_title":"RewardBench 2: Advancing Reward Model Evaluation","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2412.21059","citing_title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2603.11665","citing_title":"Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2","json":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2.json","graph_json":"https://pith.science/api/pith-number/EUHJMUW3CBO432GXF2JVRHF7V2/graph.json","events_json":"https://pith.science/api/pith-number/EUHJMUW3CBO432GXF2JVRHF7V2/events.json","paper":"https://pith.science/paper/EUHJMUW3"},"agent_actions":{"view_html":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2","download_json":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2.json","view_paper":"https://pith.science/paper/EUHJMUW3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.04842&json=true","fetch_graph":"https://pith.science/api/pith-number/EUHJMUW3CBO432GXF2JVRHF7V2/graph.json","fetch_events":"https://pith.science/api/pith-number/EUHJMUW3CBO432GXF2JVRHF7V2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2/action/storage_attestation","attest_author":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2/action/author_attestation","sign_citation":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2/action/citation_signature","submit_replication":"https://pith.science/pith/EUHJMUW3CBO432GXF2JVRHF7V2/action/replication_record"}},"created_at":"2026-07-05T08:40:42.733692+00:00","updated_at":"2026-07-05T08:40:42.733692+00:00"}