{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:MWZG7PTELHSEQEHF6QRUENIQOD","short_pith_number":"pith:MWZG7PTE","canonical_record":{"source":{"id":"2505.18531","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.AI","submitted_at":"2025-05-24T05:50:07Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"d9f5d6412a51f02a9cd11602d34b6d6dffa1b5ba6ae229a451cb410ea3324ba7","abstract_canon_sha256":"94e6c41ac7eda42f88626992cd8c08f8ccc108304e6f477e9366f88ae4a4b12f"},"schema_version":"1.0"},"canonical_sha256":"65b26fbe6459e44810e5f42342351070f2a5a147290a57714875b0bdb8eb3bb5","source":{"kind":"arxiv","id":"2505.18531","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.18531","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"arxiv_version","alias_value":"2505.18531v1","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.18531","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"pith_short_12","alias_value":"MWZG7PTELHSE","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"pith_short_16","alias_value":"MWZG7PTELHSEQEHF","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"pith_short_8","alias_value":"MWZG7PTE","created_at":"2026-07-05T11:08:47Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:MWZG7PTELHSEQEHF6QRUENIQOD","target":"record","payload":{"canonical_record":{"source":{"id":"2505.18531","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.AI","submitted_at":"2025-05-24T05:50:07Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"d9f5d6412a51f02a9cd11602d34b6d6dffa1b5ba6ae229a451cb410ea3324ba7","abstract_canon_sha256":"94e6c41ac7eda42f88626992cd8c08f8ccc108304e6f477e9366f88ae4a4b12f"},"schema_version":"1.0"},"canonical_sha256":"65b26fbe6459e44810e5f42342351070f2a5a147290a57714875b0bdb8eb3bb5","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:08:47.813949Z","signature_b64":"y+IZWkr1BJxvNIxL6jrMONx9ZwEYDVlD5QM+GRBl6GlqpJ5HGbHXXimD+Z4PAitHNkOjXmSFKzuGOzo0jcUMAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"65b26fbe6459e44810e5f42342351070f2a5a147290a57714875b0bdb8eb3bb5","last_reissued_at":"2026-07-05T11:08:47.813445Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:08:47.813445Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2505.18531","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:08:47Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"aorG+WN+rmRMEqFA9ka0uz78485p206MBThVfLraNwP+IAwzSDIhcp2l4M3L6ZQOrdZ6rxHogpSjMdhiJKtAAw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-10T08:45:16.850945Z"},"content_sha256":"8b52dae1dd24bc79fb76ada8b5613ffd8b06227b12e603cfab86bed1b9485758","schema_version":"1.0","event_id":"sha256:8b52dae1dd24bc79fb76ada8b5613ffd8b06227b12e603cfab86bed1b9485758"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:MWZG7PTELHSEQEHF6QRUENIQOD","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.AI","authors_text":"Boyuan Chen, Donghai Hong, Jiaming Ji, Jiapeng Sun, Jiayi Zhou, Sirui Han, Wenqi Chen, Yaodong Yang, Yike Guo","submitted_at":"2025-05-24T05:50:07Z","abstract_excerpt":"Training multi-modal large language models (MLLMs) that align with human intentions is a long-term challenge. Traditional score-only reward models for alignment suffer from low accuracy, weak generalization, and poor interpretability, blocking the progress of alignment methods, e.g., reinforcement learning from human feedback (RLHF). Generative reward models (GRMs) leverage MLLMs' intrinsic reasoning capabilities to discriminate pair-wise responses, but their pair-wise paradigm makes it hard to generalize to learnable rewards. We introduce Generative RLHF-V, a novel alignment framework that in"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.18531","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.18531/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:08:47Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"+KQO7X9cEJHrijd2qlecn+UYWUTIyNLjdcJ7Orc0utK8plxSuqDOTQmx2e7yebSreBZBLVdJE2pcndfQ5A+7Dg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-10T08:45:16.851611Z"},"content_sha256":"d6da98d2c88902148dcee95c99e3c6c379c29bcab4abfa4a42d40b1db546d118","schema_version":"1.0","event_id":"sha256:d6da98d2c88902148dcee95c99e3c6c379c29bcab4abfa4a42d40b1db546d118"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/MWZG7PTELHSEQEHF6QRUENIQOD/bundle.json","state_url":"https://pith.science/pith/MWZG7PTELHSEQEHF6QRUENIQOD/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/MWZG7PTELHSEQEHF6QRUENIQOD/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-10T08:45:16Z","links":{"resolver":"https://pith.science/pith/MWZG7PTELHSEQEHF6QRUENIQOD","bundle":"https://pith.science/pith/MWZG7PTELHSEQEHF6QRUENIQOD/bundle.json","state":"https://pith.science/pith/MWZG7PTELHSEQEHF6QRUENIQOD/state.json","well_known_bundle":"https://pith.science/.well-known/pith/MWZG7PTELHSEQEHF6QRUENIQOD/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:MWZG7PTELHSEQEHF6QRUENIQOD","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"94e6c41ac7eda42f88626992cd8c08f8ccc108304e6f477e9366f88ae4a4b12f","cross_cats_sorted":["cs.CV"],"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.AI","submitted_at":"2025-05-24T05:50:07Z","title_canon_sha256":"d9f5d6412a51f02a9cd11602d34b6d6dffa1b5ba6ae229a451cb410ea3324ba7"},"schema_version":"1.0","source":{"id":"2505.18531","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.18531","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"arxiv_version","alias_value":"2505.18531v1","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.18531","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"pith_short_12","alias_value":"MWZG7PTELHSE","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"pith_short_16","alias_value":"MWZG7PTELHSEQEHF","created_at":"2026-07-05T11:08:47Z"},{"alias_kind":"pith_short_8","alias_value":"MWZG7PTE","created_at":"2026-07-05T11:08:47Z"}],"graph_snapshots":[{"event_id":"sha256:d6da98d2c88902148dcee95c99e3c6c379c29bcab4abfa4a42d40b1db546d118","target":"graph","created_at":"2026-07-05T11:08:47Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2505.18531/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Training multi-modal large language models (MLLMs) that align with human intentions is a long-term challenge. Traditional score-only reward models for alignment suffer from low accuracy, weak generalization, and poor interpretability, blocking the progress of alignment methods, e.g., reinforcement learning from human feedback (RLHF). Generative reward models (GRMs) leverage MLLMs' intrinsic reasoning capabilities to discriminate pair-wise responses, but their pair-wise paradigm makes it hard to generalize to learnable rewards. We introduce Generative RLHF-V, a novel alignment framework that in","authors_text":"Boyuan Chen, Donghai Hong, Jiaming Ji, Jiapeng Sun, Jiayi Zhou, Sirui Han, Wenqi Chen, Yaodong Yang, Yike Guo","cross_cats":["cs.CV"],"headline":"","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.AI","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.18531","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:8b52dae1dd24bc79fb76ada8b5613ffd8b06227b12e603cfab86bed1b9485758","target":"record","created_at":"2026-07-05T11:08:47Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"94e6c41ac7eda42f88626992cd8c08f8ccc108304e6f477e9366f88ae4a4b12f","cross_cats_sorted":["cs.CV"],"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.AI","submitted_at":"2025-05-24T05:50:07Z","title_canon_sha256":"d9f5d6412a51f02a9cd11602d34b6d6dffa1b5ba6ae229a451cb410ea3324ba7"},"schema_version":"1.0","source":{"id":"2505.18531","kind":"arxiv","version":1}},"canonical_sha256":"65b26fbe6459e44810e5f42342351070f2a5a147290a57714875b0bdb8eb3bb5","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"65b26fbe6459e44810e5f42342351070f2a5a147290a57714875b0bdb8eb3bb5","first_computed_at":"2026-07-05T11:08:47.813445Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:08:47.813445Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"y+IZWkr1BJxvNIxL6jrMONx9ZwEYDVlD5QM+GRBl6GlqpJ5HGbHXXimD+Z4PAitHNkOjXmSFKzuGOzo0jcUMAw==","signature_status":"signed_v1","signed_at":"2026-07-05T11:08:47.813949Z","signed_message":"canonical_sha256_bytes"},"source_id":"2505.18531","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:8b52dae1dd24bc79fb76ada8b5613ffd8b06227b12e603cfab86bed1b9485758","sha256:d6da98d2c88902148dcee95c99e3c6c379c29bcab4abfa4a42d40b1db546d118"],"state_sha256":"d0df2779d40bca5ffba71836e10e7986826ce5433c4001b10807cbfe7b28df87"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"5zc/083CxDowr9f4Qy6v/giq/QhDoEC1UV+LqgqYQJ9veLtFWUb4OYBAtZyohjkdcg8gO9f1oJ/1KvkHO1QvBg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-10T08:45:16.855425Z","bundle_sha256":"7cdd54ea6e54e1f58cb751408e7536d811e946c037880f9da5dd66eb9b0980d2"}}