{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:NI4ABZHOT2NFHOKLOA5CWPNJUN","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"bc1e2267d50b4447263b7d17cf1d8b5a6a18856f41287abcdb952617b52cc880","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-05-26T20:18:11Z","title_canon_sha256":"4a1334f8fee055fd5c533b943555cee44c20c9ee4b8ef2fcf3e64c055f8ab4d0"},"schema_version":"1.0","source":{"id":"2405.16681","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2405.16681","created_at":"2026-07-05T10:15:43Z"},{"alias_kind":"arxiv_version","alias_value":"2405.16681v2","created_at":"2026-07-05T10:15:43Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.16681","created_at":"2026-07-05T10:15:43Z"},{"alias_kind":"pith_short_12","alias_value":"NI4ABZHOT2NF","created_at":"2026-07-05T10:15:43Z"},{"alias_kind":"pith_short_16","alias_value":"NI4ABZHOT2NFHOKL","created_at":"2026-07-05T10:15:43Z"},{"alias_kind":"pith_short_8","alias_value":"NI4ABZHO","created_at":"2026-07-05T10:15:43Z"}],"graph_snapshots":[{"event_id":"sha256:7980167acba747173a72a3757dae152a7422174c8d0fb7473416dde2d257ba09","target":"graph","created_at":"2026-07-05T10:15:43Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2405.16681/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement Learning with Human Feedback (RLHF) enhances the alignment of Large Language Models (LLMs). However, its limitations have led to the development of Direct Preference Optimization (DPO), an RL-free approach designed to overcome these shortcomings. While studies have shown that DPO improves instruction-following capabilities, it negatively impacts the reasoning ability of LLMs. Additionally, DPO is highly sensitive to judgment noise in preference datasets and the size of the training set. Although several modifications to DPO have been proposed, they still fail to fully resolve the","authors_text":"Amir Saeidi, Aswin RRV, Chitta Baral, Kashif Rasul, Shivanshu Verma","cross_cats":[],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-05-26T20:18:11Z","title":"Triple Preference Optimization: Achieving Better Alignment using a Single Step Optimization"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.16681","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:2e44882d39db2d53fd6a8e1a038c96ac91612f17adaf3b4e4bc56803787d0c16","target":"record","created_at":"2026-07-05T10:15:43Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"bc1e2267d50b4447263b7d17cf1d8b5a6a18856f41287abcdb952617b52cc880","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-05-26T20:18:11Z","title_canon_sha256":"4a1334f8fee055fd5c533b943555cee44c20c9ee4b8ef2fcf3e64c055f8ab4d0"},"schema_version":"1.0","source":{"id":"2405.16681","kind":"arxiv","version":2}},"canonical_sha256":"6a3800e4ee9e9a53b94b703a2b3da9a37cbdf5ccd5490a053b65fc69c8206212","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"6a3800e4ee9e9a53b94b703a2b3da9a37cbdf5ccd5490a053b65fc69c8206212","first_computed_at":"2026-07-05T10:15:43.782543Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:15:43.782543Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"MTQnopAGKSkYzGzojix9079jpxC7jmTdJa80kiY+U2HVjaQr+IaiIDp9JDQkKJHLqEIKmz6QOjujEAlmfiTdDg==","signature_status":"signed_v1","signed_at":"2026-07-05T10:15:43.783101Z","signed_message":"canonical_sha256_bytes"},"source_id":"2405.16681","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:2e44882d39db2d53fd6a8e1a038c96ac91612f17adaf3b4e4bc56803787d0c16","sha256:7980167acba747173a72a3757dae152a7422174c8d0fb7473416dde2d257ba09"],"state_sha256":"a9a8f07b258213d22dce88fd1b5fe236c2c39547e576ec92ab0d0333a299331a"}