{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GDLG3EEB53MBY54HP2SMGP5BGF","short_pith_number":"pith:GDLG3EEB","schema_version":"1.0","canonical_sha256":"30d66d9081eed81c77877ea4c33fa131402cb551c669d091b7ce401c7930b515","source":{"kind":"arxiv","id":"2504.04950","version":1},"attestation_state":"computed","paper":{"title":"A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Chao Xin, Lin Yan, Wenyuan Xu, Xiaochen Zuo, Yonghui Wu, Yu Yue","submitted_at":"2025-04-07T11:34:48Z","abstract_excerpt":"Reinforcement Learning from Human Feedback (RLHF) has emerged as a important paradigm for aligning large language models (LLMs) with human preferences during post-training. This framework typically involves two stages: first, training a reward model on human preference data, followed by optimizing the language model using reinforcement learning algorithms. However, current RLHF approaches may constrained by two limitations. First, existing RLHF frameworks often rely on Bradley-Terry models to assign scalar rewards based on pairwise comparisons of individual responses. However, this approach im"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.04950","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-04-07T11:34:48Z","cross_cats_sorted":[],"title_canon_sha256":"5a5bc99217c40aeee8e5a435dcf9b48b1a69c3c4f8feae19e1ee3a55635e1ae5","abstract_canon_sha256":"13fd7271c1f5025bb05efa8859595c3b9fbcfb9b231e21c31a172222e0c6353a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:45:31.916641Z","signature_b64":"lpBFnXdAXT2vimfka1xVze8OLrG/gFwwItyFwPxxuUQeCWWgdORDTqi6ytifmum4/89sPXK90CdjiIZztK4GBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"30d66d9081eed81c77877ea4c33fa131402cb551c669d091b7ce401c7930b515","last_reissued_at":"2026-07-05T10:45:31.916169Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:45:31.916169Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Chao Xin, Lin Yan, Wenyuan Xu, Xiaochen Zuo, Yonghui Wu, Yu Yue","submitted_at":"2025-04-07T11:34:48Z","abstract_excerpt":"Reinforcement Learning from Human Feedback (RLHF) has emerged as a important paradigm for aligning large language models (LLMs) with human preferences during post-training. This framework typically involves two stages: first, training a reward model on human preference data, followed by optimizing the language model using reinforcement learning algorithms. However, current RLHF approaches may constrained by two limitations. First, existing RLHF frameworks often rely on Bradley-Terry models to assign scalar rewards based on pairwise comparisons of individual responses. However, this approach im"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.04950","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.04950/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.04950","created_at":"2026-07-05T10:45:31.916225+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.04950v1","created_at":"2026-07-05T10:45:31.916225+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.04950","created_at":"2026-07-05T10:45:31.916225+00:00"},{"alias_kind":"pith_short_12","alias_value":"GDLG3EEB53MB","created_at":"2026-07-05T10:45:31.916225+00:00"},{"alias_kind":"pith_short_16","alias_value":"GDLG3EEB53MBY54H","created_at":"2026-07-05T10:45:31.916225+00:00"},{"alias_kind":"pith_short_8","alias_value":"GDLG3EEB","created_at":"2026-07-05T10:45:31.916225+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":197,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27505","citing_title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18191","citing_title":"Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2510.24235","citing_title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27505","citing_title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2505.07062","citing_title":"Seed1.5-VL Technical Report","ref_index":157,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF","json":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF.json","graph_json":"https://pith.science/api/pith-number/GDLG3EEB53MBY54HP2SMGP5BGF/graph.json","events_json":"https://pith.science/api/pith-number/GDLG3EEB53MBY54HP2SMGP5BGF/events.json","paper":"https://pith.science/paper/GDLG3EEB"},"agent_actions":{"view_html":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF","download_json":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF.json","view_paper":"https://pith.science/paper/GDLG3EEB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.04950&json=true","fetch_graph":"https://pith.science/api/pith-number/GDLG3EEB53MBY54HP2SMGP5BGF/graph.json","fetch_events":"https://pith.science/api/pith-number/GDLG3EEB53MBY54HP2SMGP5BGF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF/action/storage_attestation","attest_author":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF/action/author_attestation","sign_citation":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF/action/citation_signature","submit_replication":"https://pith.science/pith/GDLG3EEB53MBY54HP2SMGP5BGF/action/replication_record"}},"created_at":"2026-07-05T10:45:31.916225+00:00","updated_at":"2026-07-05T10:45:31.916225+00:00"}