{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:BQ4XRC6RV7IPENIK4YADW3PVC6","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"543767d8aa00ed680c13b35805cec6763b8f523970804daeb0bb121bd0d9e89d","cross_cats_sorted":["cs.AI","cs.CL"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","title_canon_sha256":"afa32b7c7afdfb2c877608433d8f4fd86b1cd5b727cfea990d1e1ed920c98643"},"schema_version":"1.0","source":{"id":"2410.10148","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2410.10148","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"arxiv_version","alias_value":"2410.10148v4","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.10148","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_12","alias_value":"BQ4XRC6RV7IP","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_16","alias_value":"BQ4XRC6RV7IPENIK","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_8","alias_value":"BQ4XRC6R","created_at":"2026-07-05T11:39:44Z"}],"graph_snapshots":[{"event_id":"sha256:f39d97003f615a0ccba82ebfc3a4f6f67678ce32ed8cb2fd2ccea1afe0442ca5","target":"graph","created_at":"2026-07-05T11:39:44Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2410.10148/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Aligning large language models (LLMs) with human values and intentions is crucial for their utility, honesty, and safety. Reinforcement learning from human feedback (RLHF) is a popular approach to achieve this alignment, but it faces challenges in computational efficiency and training stability. Recent methods like Direct Preference Optimization (DPO) and Simple Preference Optimization (SimPO) have proposed offline alternatives to RLHF, simplifying the process by reparameterizing the reward function. However, DPO depends on a potentially suboptimal reference model, and SimPO's assumption of a ","authors_text":"Bolin Ding, Jiancan Wu, Jinyang Gao, Junkang Wu, Xiangnan He, Xiang Wang, Xue Wang, Zhengyi Yang","cross_cats":["cs.AI","cs.CL"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.10148","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:3de5a461446215c3d9ab330ea9b8791a3010d5a5e13719b522c655eef8004c92","target":"record","created_at":"2026-07-05T11:39:44Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"543767d8aa00ed680c13b35805cec6763b8f523970804daeb0bb121bd0d9e89d","cross_cats_sorted":["cs.AI","cs.CL"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","title_canon_sha256":"afa32b7c7afdfb2c877608433d8f4fd86b1cd5b727cfea990d1e1ed920c98643"},"schema_version":"1.0","source":{"id":"2410.10148","kind":"arxiv","version":4}},"canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","first_computed_at":"2026-07-05T11:39:44.056820Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:39:44.056820Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"ouZVzBicqxEHem9/jXZU7LvZbamJ1oDXhvwcXXGW1P91tzn/kxR/sfSW3eFn4ubspbtYhY+qcuRh7eBCS4ofBg==","signature_status":"signed_v1","signed_at":"2026-07-05T11:39:44.057376Z","signed_message":"canonical_sha256_bytes"},"source_id":"2410.10148","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:3de5a461446215c3d9ab330ea9b8791a3010d5a5e13719b522c655eef8004c92","sha256:f39d97003f615a0ccba82ebfc3a4f6f67678ce32ed8cb2fd2ccea1afe0442ca5"],"state_sha256":"5021cf3c0c90e26f508f9a35a3388237cde8b8aa3290b50ee5f6637ed7d27f12"}