{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2024:BQ4XRC6RV7IPENIK4YADW3PVC6","short_pith_number":"pith:BQ4XRC6R","canonical_record":{"source":{"id":"2410.10148","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"afa32b7c7afdfb2c877608433d8f4fd86b1cd5b727cfea990d1e1ed920c98643","abstract_canon_sha256":"543767d8aa00ed680c13b35805cec6763b8f523970804daeb0bb121bd0d9e89d"},"schema_version":"1.0"},"canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","source":{"kind":"arxiv","id":"2410.10148","version":4},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2410.10148","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"arxiv_version","alias_value":"2410.10148v4","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.10148","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_12","alias_value":"BQ4XRC6RV7IP","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_16","alias_value":"BQ4XRC6RV7IPENIK","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_8","alias_value":"BQ4XRC6R","created_at":"2026-07-05T11:39:44Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2024:BQ4XRC6RV7IPENIK4YADW3PVC6","target":"record","payload":{"canonical_record":{"source":{"id":"2410.10148","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"afa32b7c7afdfb2c877608433d8f4fd86b1cd5b727cfea990d1e1ed920c98643","abstract_canon_sha256":"543767d8aa00ed680c13b35805cec6763b8f523970804daeb0bb121bd0d9e89d"},"schema_version":"1.0"},"canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:39:44.057376Z","signature_b64":"ouZVzBicqxEHem9/jXZU7LvZbamJ1oDXhvwcXXGW1P91tzn/kxR/sfSW3eFn4ubspbtYhY+qcuRh7eBCS4ofBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","last_reissued_at":"2026-07-05T11:39:44.056820Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:39:44.056820Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2410.10148","source_version":4,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:39:44Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"/MyfgX6s1Wv24scXSL1t2dct5qCA442InKegG6lMQv9bB6cysEMuzyF91QeJbLcdp6N5zm3HWJxnALBvVAstDw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-09T10:50:38.400494Z"},"content_sha256":"3de5a461446215c3d9ab330ea9b8791a3010d5a5e13719b522c655eef8004c92","schema_version":"1.0","event_id":"sha256:3de5a461446215c3d9ab330ea9b8791a3010d5a5e13719b522c655eef8004c92"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2024:BQ4XRC6RV7IPENIK4YADW3PVC6","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Bolin Ding, Jiancan Wu, Jinyang Gao, Junkang Wu, Xiangnan He, Xiang Wang, Xue Wang, Zhengyi Yang","submitted_at":"2024-10-14T04:29:57Z","abstract_excerpt":"Aligning large language models (LLMs) with human values and intentions is crucial for their utility, honesty, and safety. Reinforcement learning from human feedback (RLHF) is a popular approach to achieve this alignment, but it faces challenges in computational efficiency and training stability. Recent methods like Direct Preference Optimization (DPO) and Simple Preference Optimization (SimPO) have proposed offline alternatives to RLHF, simplifying the process by reparameterizing the reward function. However, DPO depends on a potentially suboptimal reference model, and SimPO's assumption of a "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.10148","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.10148/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:39:44Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"e6sakxbEV6dHE2Pc9dRq+lJ9QzG0JYo/DbJgAKdG5+TtjkhxIsQMoCVAgF4SXDnjfMZ720yP3+39DVW3OnXgCA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-09T10:50:38.401548Z"},"content_sha256":"f39d97003f615a0ccba82ebfc3a4f6f67678ce32ed8cb2fd2ccea1afe0442ca5","schema_version":"1.0","event_id":"sha256:f39d97003f615a0ccba82ebfc3a4f6f67678ce32ed8cb2fd2ccea1afe0442ca5"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/BQ4XRC6RV7IPENIK4YADW3PVC6/bundle.json","state_url":"https://pith.science/pith/BQ4XRC6RV7IPENIK4YADW3PVC6/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/BQ4XRC6RV7IPENIK4YADW3PVC6/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-09T10:50:38Z","links":{"resolver":"https://pith.science/pith/BQ4XRC6RV7IPENIK4YADW3PVC6","bundle":"https://pith.science/pith/BQ4XRC6RV7IPENIK4YADW3PVC6/bundle.json","state":"https://pith.science/pith/BQ4XRC6RV7IPENIK4YADW3PVC6/state.json","well_known_bundle":"https://pith.science/.well-known/pith/BQ4XRC6RV7IPENIK4YADW3PVC6/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:BQ4XRC6RV7IPENIK4YADW3PVC6","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"543767d8aa00ed680c13b35805cec6763b8f523970804daeb0bb121bd0d9e89d","cross_cats_sorted":["cs.AI","cs.CL"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","title_canon_sha256":"afa32b7c7afdfb2c877608433d8f4fd86b1cd5b727cfea990d1e1ed920c98643"},"schema_version":"1.0","source":{"id":"2410.10148","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2410.10148","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"arxiv_version","alias_value":"2410.10148v4","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.10148","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_12","alias_value":"BQ4XRC6RV7IP","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_16","alias_value":"BQ4XRC6RV7IPENIK","created_at":"2026-07-05T11:39:44Z"},{"alias_kind":"pith_short_8","alias_value":"BQ4XRC6R","created_at":"2026-07-05T11:39:44Z"}],"graph_snapshots":[{"event_id":"sha256:f39d97003f615a0ccba82ebfc3a4f6f67678ce32ed8cb2fd2ccea1afe0442ca5","target":"graph","created_at":"2026-07-05T11:39:44Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2410.10148/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Aligning large language models (LLMs) with human values and intentions is crucial for their utility, honesty, and safety. Reinforcement learning from human feedback (RLHF) is a popular approach to achieve this alignment, but it faces challenges in computational efficiency and training stability. Recent methods like Direct Preference Optimization (DPO) and Simple Preference Optimization (SimPO) have proposed offline alternatives to RLHF, simplifying the process by reparameterizing the reward function. However, DPO depends on a potentially suboptimal reference model, and SimPO's assumption of a ","authors_text":"Bolin Ding, Jiancan Wu, Jinyang Gao, Junkang Wu, Xiangnan He, Xiang Wang, Xue Wang, Zhengyi Yang","cross_cats":["cs.AI","cs.CL"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.10148","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:3de5a461446215c3d9ab330ea9b8791a3010d5a5e13719b522c655eef8004c92","target":"record","created_at":"2026-07-05T11:39:44Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"543767d8aa00ed680c13b35805cec6763b8f523970804daeb0bb121bd0d9e89d","cross_cats_sorted":["cs.AI","cs.CL"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-14T04:29:57Z","title_canon_sha256":"afa32b7c7afdfb2c877608433d8f4fd86b1cd5b727cfea990d1e1ed920c98643"},"schema_version":"1.0","source":{"id":"2410.10148","kind":"arxiv","version":4}},"canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"0c39788bd1afd0f2350ae6003b6df517b7e1007385e08f26ee503c587ab163fb","first_computed_at":"2026-07-05T11:39:44.056820Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:39:44.056820Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"ouZVzBicqxEHem9/jXZU7LvZbamJ1oDXhvwcXXGW1P91tzn/kxR/sfSW3eFn4ubspbtYhY+qcuRh7eBCS4ofBg==","signature_status":"signed_v1","signed_at":"2026-07-05T11:39:44.057376Z","signed_message":"canonical_sha256_bytes"},"source_id":"2410.10148","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:3de5a461446215c3d9ab330ea9b8791a3010d5a5e13719b522c655eef8004c92","sha256:f39d97003f615a0ccba82ebfc3a4f6f67678ce32ed8cb2fd2ccea1afe0442ca5"],"state_sha256":"5021cf3c0c90e26f508f9a35a3388237cde8b8aa3290b50ee5f6637ed7d27f12"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"z8IXcw9DBYD1KEXw8bXwRfHT2QMUEmczBzUW1CRMIIlNp4lADW9rdz47x8qbsoxYyHKt8HQsjtVI9nDFBlsoAA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-09T10:50:38.407970Z","bundle_sha256":"5e63538b1a3a5f8fa3bf999fb0a211575d08a10ed7bdfbb8952259f4fc925c95"}}