{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:ZAFFDLPL77N6PTXWHCWF2AUGJT","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"49891ab733a20f0552b81d96d08f006b7d04531dded59ecba8145dcbec8c9fed","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-09-28T08:29:44Z","title_canon_sha256":"33c0fd9f5ef49d921ed1d0a040eaa17fa2c4c0ab4445cc030944175c4bd06be1"},"schema_version":"1.0","source":{"id":"2309.16240","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2309.16240","created_at":"2026-07-05T06:55:13Z"},{"alias_kind":"arxiv_version","alias_value":"2309.16240v1","created_at":"2026-07-05T06:55:13Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.16240","created_at":"2026-07-05T06:55:13Z"},{"alias_kind":"pith_short_12","alias_value":"ZAFFDLPL77N6","created_at":"2026-07-05T06:55:13Z"},{"alias_kind":"pith_short_16","alias_value":"ZAFFDLPL77N6PTXW","created_at":"2026-07-05T06:55:13Z"},{"alias_kind":"pith_short_8","alias_value":"ZAFFDLPL","created_at":"2026-07-05T06:55:13Z"}],"graph_snapshots":[{"event_id":"sha256:ef7a22bedac8c1701070db66400f3accd2a09ad5d8d27b348f0ae49c320f2caa","target":"graph","created_at":"2026-07-05T06:55:13Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2309.16240/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"The increasing capabilities of large language models (LLMs) raise opportunities for artificial general intelligence but concurrently amplify safety concerns, such as potential misuse of AI systems, necessitating effective AI alignment. Reinforcement Learning from Human Feedback (RLHF) has emerged as a promising pathway towards AI alignment but brings forth challenges due to its complexity and dependence on a separate reward model. Direct Preference Optimization (DPO) has been proposed as an alternative, and it remains equivalent to RLHF under the reverse KL regularization constraint. This pape","authors_text":"Chaoqi Wang, Chenghao Yang, Han Liu, Yibo Jiang, Yuxin Chen","cross_cats":["cs.AI","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.16240","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:3259d679d5701b1589d9df2881cb52f1821f828276866ae3f8d5889789b53f4c","target":"record","created_at":"2026-07-05T06:55:13Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"49891ab733a20f0552b81d96d08f006b7d04531dded59ecba8145dcbec8c9fed","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-09-28T08:29:44Z","title_canon_sha256":"33c0fd9f5ef49d921ed1d0a040eaa17fa2c4c0ab4445cc030944175c4bd06be1"},"schema_version":"1.0","source":{"id":"2309.16240","kind":"arxiv","version":1}},"canonical_sha256":"c80a51adebffdbe7cef638ac5d02864ce33e0515f5499dfba33b6cbe16f09e88","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"c80a51adebffdbe7cef638ac5d02864ce33e0515f5499dfba33b6cbe16f09e88","first_computed_at":"2026-07-05T06:55:13.185420Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T06:55:13.185420Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"8OY06xGJkjmihJnNbgefSnmdQvEtOEC2fyd49fvPJWiuxXi19ZLjTlz8mwJ1otl5ktksfNfFMfdGPEtZ1znDAg==","signature_status":"signed_v1","signed_at":"2026-07-05T06:55:13.185820Z","signed_message":"canonical_sha256_bytes"},"source_id":"2309.16240","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:3259d679d5701b1589d9df2881cb52f1821f828276866ae3f8d5889789b53f4c","sha256:ef7a22bedac8c1701070db66400f3accd2a09ad5d8d27b348f0ae49c320f2caa"],"state_sha256":"fe8a38d6020f11b4145c725563d1366c5455fd86d1445557d737e24668568f16"}