{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:RUDLKCMMNR7L6KJOPF4DLYUWHW","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"70f4a48c7aa46a668b83c9af792d40155cb6fb82176b49c018693d607b14a512","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-06T16:03:59Z","title_canon_sha256":"ac4d66b9a4339a1b5501db92fb3345cec88dea1bda947deb716dcd01fa403e51"},"schema_version":"1.0","source":{"id":"2309.03126","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2309.03126","created_at":"2026-07-05T06:50:58Z"},{"alias_kind":"arxiv_version","alias_value":"2309.03126v2","created_at":"2026-07-05T06:50:58Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.03126","created_at":"2026-07-05T06:50:58Z"},{"alias_kind":"pith_short_12","alias_value":"RUDLKCMMNR7L","created_at":"2026-07-05T06:50:58Z"},{"alias_kind":"pith_short_16","alias_value":"RUDLKCMMNR7L6KJO","created_at":"2026-07-05T06:50:58Z"},{"alias_kind":"pith_short_8","alias_value":"RUDLKCMM","created_at":"2026-07-05T06:50:58Z"}],"graph_snapshots":[{"event_id":"sha256:c50c47f6b8f8cf5078c1a58a67b096daaa51185c71e845d8de11fa8d728d32fc","target":"graph","created_at":"2026-07-05T06:50:58Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2309.03126/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reward models (RMs) are essential for aligning large language models (LLMs) with human preferences to improve interaction quality. However, the real world is pluralistic, which leads to diversified human preferences with respect to different religions, politics, cultures, etc. Moreover, each individual can have their unique preferences on various topics. Neglecting the diversity of human preferences, current human feedback aligning methods only consider a general reward model, which is below satisfaction for customized or personalized application scenarios. To explore customized preference lea","authors_text":"Jiawen Xie, Ke Bai, Nan Du, Pengyu Cheng, Yong Dai","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-06T16:03:59Z","title":"Everyone Deserves A Reward: Learning Customized Human Preferences"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.03126","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:982560e83478717163bc2efd8072816af7b7176303e0aa37ff775d7dffb95dff","target":"record","created_at":"2026-07-05T06:50:58Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"70f4a48c7aa46a668b83c9af792d40155cb6fb82176b49c018693d607b14a512","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-06T16:03:59Z","title_canon_sha256":"ac4d66b9a4339a1b5501db92fb3345cec88dea1bda947deb716dcd01fa403e51"},"schema_version":"1.0","source":{"id":"2309.03126","kind":"arxiv","version":2}},"canonical_sha256":"8d06b5098c6c7ebf292e797835e2963da4f1fe2cd8472d6732fd7fabcec00fb2","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"8d06b5098c6c7ebf292e797835e2963da4f1fe2cd8472d6732fd7fabcec00fb2","first_computed_at":"2026-07-05T06:50:58.313760Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T06:50:58.313760Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"DcZFik7tEEUDyYMDZh9s8WNS2rsBcYC+Nkx/0mPzNrNMZCeocCk9AQx3vxuRLhPXeOxrzZvW/SHRwJkLYqPuDg==","signature_status":"signed_v1","signed_at":"2026-07-05T06:50:58.314385Z","signed_message":"canonical_sha256_bytes"},"source_id":"2309.03126","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:982560e83478717163bc2efd8072816af7b7176303e0aa37ff775d7dffb95dff","sha256:c50c47f6b8f8cf5078c1a58a67b096daaa51185c71e845d8de11fa8d728d32fc"],"state_sha256":"013e9763cb3b1588c3d42ccbff5b1660d6bcd5d59b603d49f2f33432f447c6e6"}