{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:DJERVDEORMFD7KIAACCXJJEJGV","short_pith_number":"pith:DJERVDEO","schema_version":"1.0","canonical_sha256":"1a491a8c8e8b0a3fa900008574a489354f6319a1464d1ccfa3229e69cbb96883","source":{"kind":"arxiv","id":"2608.01556","version":1},"attestation_state":"computed","paper":{"title":"Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Boryeong Cho, Jihwan Oh, Seokhyun Chung, Seongyoon Kim, Se-Young Yun","submitted_at":"2026-08-03T00:25:52Z","abstract_excerpt":"Large language models are increasingly aligned to human preferences via reward modeling, but user preference data are sensitive and often cannot be centralized. Federated learning keeps such data local while learning a shared initial reward model, which is later personalized for each client through local fine-tuning. Because users often assign opposite labels to the same pair of responses, existing federated methods address preference heterogeneity by clustering similar clients and training one reward model per group, assuming that each group requires its own initialization. We show that this "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2608.01556","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-08-03T00:25:52Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"2543a0727cbf6339d8d0d6abd4d6e0080d9852e3d5fd235e97f183d649298763","abstract_canon_sha256":"1843317de42795e4a1360dc59c57ab3b7e1ce55d5a1b58cffc0cc0b04f05f076"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-04T02:05:58.589385Z","signature_b64":"Jx8KPKUrYpUIwnQIqwVHrq9LzRlDyBg9CT3f7giPZQ8m4eFE51JRiBBKVl956KtduCsIv7g2Os+uwV+w+vU3BQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1a491a8c8e8b0a3fa900008574a489354f6319a1464d1ccfa3229e69cbb96883","last_reissued_at":"2026-08-04T02:05:58.587813Z","signature_status":"signed_v1","first_computed_at":"2026-08-04T02:05:58.587813Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Boryeong Cho, Jihwan Oh, Seokhyun Chung, Seongyoon Kim, Se-Young Yun","submitted_at":"2026-08-03T00:25:52Z","abstract_excerpt":"Large language models are increasingly aligned to human preferences via reward modeling, but user preference data are sensitive and often cannot be centralized. Federated learning keeps such data local while learning a shared initial reward model, which is later personalized for each client through local fine-tuning. Because users often assign opposite labels to the same pair of responses, existing federated methods address preference heterogeneity by clustering similar clients and training one reward model per group, assuming that each group requires its own initialization. We show that this "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2608.01556","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2608.01556/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2608.01556","created_at":"2026-08-04T02:05:58.589259+00:00"},{"alias_kind":"arxiv_version","alias_value":"2608.01556v1","created_at":"2026-08-04T02:05:58.589259+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2608.01556","created_at":"2026-08-04T02:05:58.589259+00:00"},{"alias_kind":"pith_short_12","alias_value":"DJERVDEORMFD","created_at":"2026-08-04T02:05:58.589259+00:00"},{"alias_kind":"pith_short_16","alias_value":"DJERVDEORMFD7KIA","created_at":"2026-08-04T02:05:58.589259+00:00"},{"alias_kind":"pith_short_8","alias_value":"DJERVDEO","created_at":"2026-08-04T02:05:58.589259+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV","json":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV.json","graph_json":"https://pith.science/api/pith-number/DJERVDEORMFD7KIAACCXJJEJGV/graph.json","events_json":"https://pith.science/api/pith-number/DJERVDEORMFD7KIAACCXJJEJGV/events.json","paper":"https://pith.science/paper/DJERVDEO"},"agent_actions":{"view_html":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV","download_json":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV.json","view_paper":"https://pith.science/paper/DJERVDEO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2608.01556&json=true","fetch_graph":"https://pith.science/api/pith-number/DJERVDEORMFD7KIAACCXJJEJGV/graph.json","fetch_events":"https://pith.science/api/pith-number/DJERVDEORMFD7KIAACCXJJEJGV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV/action/storage_attestation","attest_author":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV/action/author_attestation","sign_citation":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV/action/citation_signature","submit_replication":"https://pith.science/pith/DJERVDEORMFD7KIAACCXJJEJGV/action/replication_record"}},"created_at":"2026-08-04T02:05:58.589259+00:00","updated_at":"2026-08-04T02:05:58.589259+00:00"}