{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2024:JOBWDJRY4HVCYLGRX7VOCXGCVG","short_pith_number":"pith:JOBWDJRY","canonical_record":{"source":{"id":"2408.09834","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.AI","submitted_at":"2024-08-19T09:29:31Z","cross_cats_sorted":[],"title_canon_sha256":"678b4e06462d4813287b93736bcba2b95018e3b169cdf5cbbbf5b6cc5f9811f6","abstract_canon_sha256":"cfba817cc2a49dd46923122356345ec1941146209888dd4402b37700185be12b"},"schema_version":"1.0"},"canonical_sha256":"4b8361a638e1ea2c2cd1bfeae15cc2a9925e3027b0bbf108c3ac5fd58c1e6cbf","source":{"kind":"arxiv","id":"2408.09834","version":3},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2408.09834","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"arxiv_version","alias_value":"2408.09834v3","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.09834","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"pith_short_12","alias_value":"JOBWDJRY4HVC","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"pith_short_16","alias_value":"JOBWDJRY4HVCYLGR","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"pith_short_8","alias_value":"JOBWDJRY","created_at":"2026-07-05T09:01:04Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2024:JOBWDJRY4HVCYLGRX7VOCXGCVG","target":"record","payload":{"canonical_record":{"source":{"id":"2408.09834","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.AI","submitted_at":"2024-08-19T09:29:31Z","cross_cats_sorted":[],"title_canon_sha256":"678b4e06462d4813287b93736bcba2b95018e3b169cdf5cbbbf5b6cc5f9811f6","abstract_canon_sha256":"cfba817cc2a49dd46923122356345ec1941146209888dd4402b37700185be12b"},"schema_version":"1.0"},"canonical_sha256":"4b8361a638e1ea2c2cd1bfeae15cc2a9925e3027b0bbf108c3ac5fd58c1e6cbf","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:01:04.655908Z","signature_b64":"lbussXkbHEGo2si8Qgjxs7hM02BxBnU40v2MmNmk9lmwpWs3ZbYoTwonplu31kqTm501QOl6z+XwsdcL8E5/AA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4b8361a638e1ea2c2cd1bfeae15cc2a9925e3027b0bbf108c3ac5fd58c1e6cbf","last_reissued_at":"2026-07-05T09:01:04.655386Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:01:04.655386Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2408.09834","source_version":3,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T09:01:04Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"Zjmjjk5oIYAJ/uZ5w6pEnzJvEXet8ziN1kNaX7+c+62xGQ8BeMZ9/a8uEJ+QGHVN3rKefWbQBUIkyvpoOdZyDw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-07T19:06:17.275183Z"},"content_sha256":"c2da51651cac8d363ad47789f459abc227a4524732ef8c157cea4af49f318b16","schema_version":"1.0","event_id":"sha256:c2da51651cac8d363ad47789f459abc227a4524732ef8c157cea4af49f318b16"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2024:JOBWDJRY4HVCYLGRX7VOCXGCVG","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Minor DPO reject penalty to increase training robustness","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Fred Yu, Hong Chen, Shiming Xie, Xiuyu Wu, Yingfan Hu, Zeye Sun","submitted_at":"2024-08-19T09:29:31Z","abstract_excerpt":"Learning from human preference is a paradigm used in large-scale language model (LLM) fine-tuning step to better align pretrained LLM to human preference for downstream task. In the past it uses reinforcement learning from human feedback (RLHF) algorithm to optimize the LLM policy to align with these preferences and not to draft too far from the original model. Recently, Direct Preference Optimization (DPO) has been proposed to solve the alignment problem with a simplified RL-free method. Using preference pairs of chosen and reject data, DPO models the relative log probability as implicit rewa"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.09834","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.09834/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T09:01:04Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"OCQsNR3RhiinIRFvRMIYJ6QVmPd4yOrgLdURSMi3qbCqOEaO9BkuxbUGySWxbWJ0BmjTu7PzL4YpLhdlxsBqBg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-07T19:06:17.276218Z"},"content_sha256":"f6cbd969dff7fb0a4678156c2891a3208e7739a6673843c320992fc86ae8b44c","schema_version":"1.0","event_id":"sha256:f6cbd969dff7fb0a4678156c2891a3208e7739a6673843c320992fc86ae8b44c"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG/bundle.json","state_url":"https://pith.science/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-07T19:06:17Z","links":{"resolver":"https://pith.science/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG","bundle":"https://pith.science/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG/bundle.json","state":"https://pith.science/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG/state.json","well_known_bundle":"https://pith.science/.well-known/pith/JOBWDJRY4HVCYLGRX7VOCXGCVG/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:JOBWDJRY4HVCYLGRX7VOCXGCVG","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"cfba817cc2a49dd46923122356345ec1941146209888dd4402b37700185be12b","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.AI","submitted_at":"2024-08-19T09:29:31Z","title_canon_sha256":"678b4e06462d4813287b93736bcba2b95018e3b169cdf5cbbbf5b6cc5f9811f6"},"schema_version":"1.0","source":{"id":"2408.09834","kind":"arxiv","version":3}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2408.09834","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"arxiv_version","alias_value":"2408.09834v3","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.09834","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"pith_short_12","alias_value":"JOBWDJRY4HVC","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"pith_short_16","alias_value":"JOBWDJRY4HVCYLGR","created_at":"2026-07-05T09:01:04Z"},{"alias_kind":"pith_short_8","alias_value":"JOBWDJRY","created_at":"2026-07-05T09:01:04Z"}],"graph_snapshots":[{"event_id":"sha256:f6cbd969dff7fb0a4678156c2891a3208e7739a6673843c320992fc86ae8b44c","target":"graph","created_at":"2026-07-05T09:01:04Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2408.09834/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Learning from human preference is a paradigm used in large-scale language model (LLM) fine-tuning step to better align pretrained LLM to human preference for downstream task. In the past it uses reinforcement learning from human feedback (RLHF) algorithm to optimize the LLM policy to align with these preferences and not to draft too far from the original model. Recently, Direct Preference Optimization (DPO) has been proposed to solve the alignment problem with a simplified RL-free method. Using preference pairs of chosen and reject data, DPO models the relative log probability as implicit rewa","authors_text":"Fred Yu, Hong Chen, Shiming Xie, Xiuyu Wu, Yingfan Hu, Zeye Sun","cross_cats":[],"headline":"","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.AI","submitted_at":"2024-08-19T09:29:31Z","title":"Minor DPO reject penalty to increase training robustness"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.09834","kind":"arxiv","version":3},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:c2da51651cac8d363ad47789f459abc227a4524732ef8c157cea4af49f318b16","target":"record","created_at":"2026-07-05T09:01:04Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"cfba817cc2a49dd46923122356345ec1941146209888dd4402b37700185be12b","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.AI","submitted_at":"2024-08-19T09:29:31Z","title_canon_sha256":"678b4e06462d4813287b93736bcba2b95018e3b169cdf5cbbbf5b6cc5f9811f6"},"schema_version":"1.0","source":{"id":"2408.09834","kind":"arxiv","version":3}},"canonical_sha256":"4b8361a638e1ea2c2cd1bfeae15cc2a9925e3027b0bbf108c3ac5fd58c1e6cbf","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"4b8361a638e1ea2c2cd1bfeae15cc2a9925e3027b0bbf108c3ac5fd58c1e6cbf","first_computed_at":"2026-07-05T09:01:04.655386Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T09:01:04.655386Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"lbussXkbHEGo2si8Qgjxs7hM02BxBnU40v2MmNmk9lmwpWs3ZbYoTwonplu31kqTm501QOl6z+XwsdcL8E5/AA==","signature_status":"signed_v1","signed_at":"2026-07-05T09:01:04.655908Z","signed_message":"canonical_sha256_bytes"},"source_id":"2408.09834","source_kind":"arxiv","source_version":3}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:c2da51651cac8d363ad47789f459abc227a4524732ef8c157cea4af49f318b16","sha256:f6cbd969dff7fb0a4678156c2891a3208e7739a6673843c320992fc86ae8b44c"],"state_sha256":"2a7a18f3c11ea7ad52b9baf2256d240e6ff02455e2dbdfe8bedad657be7748fc"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"av0OKMCAjdkDzNEWQrB7fwV1g4+rt7M1EG7JknkcirqjhiR76lXRzO21TcnYOeBn5MX36x4ZkcTf3CoT+Su7Ag==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-07T19:06:17.287378Z","bundle_sha256":"5c3029fe03ee1d3c391392e0595b022b5170f7b43bec8764545058702740a0d4"}}