{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2026:BBUWX23DC3KF72C7O43NX6LJ6A","short_pith_number":"pith:BBUWX23D","canonical_record":{"source":{"id":"2607.09796","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-09T09:20:25Z","cross_cats_sorted":[],"title_canon_sha256":"7c1db98b6bc0de4227356c232fadec1132e7dda978c3633bfef8d99e9e1901b6","abstract_canon_sha256":"98067e63907a452a7ac325892889a97f4320840b46c05b60099828f484c5a229"},"schema_version":"1.0"},"canonical_sha256":"08696beb6316d45fe85f7736dbf969f0331b5c99ff5e0ca3cbb16dfecce3acf0","source":{"kind":"arxiv","id":"2607.09796","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2607.09796","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"arxiv_version","alias_value":"2607.09796v1","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.09796","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"pith_short_12","alias_value":"BBUWX23DC3KF","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"pith_short_16","alias_value":"BBUWX23DC3KF72C7","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"pith_short_8","alias_value":"BBUWX23D","created_at":"2026-07-14T00:18:36Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2026:BBUWX23DC3KF72C7O43NX6LJ6A","target":"record","payload":{"canonical_record":{"source":{"id":"2607.09796","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-09T09:20:25Z","cross_cats_sorted":[],"title_canon_sha256":"7c1db98b6bc0de4227356c232fadec1132e7dda978c3633bfef8d99e9e1901b6","abstract_canon_sha256":"98067e63907a452a7ac325892889a97f4320840b46c05b60099828f484c5a229"},"schema_version":"1.0"},"canonical_sha256":"08696beb6316d45fe85f7736dbf969f0331b5c99ff5e0ca3cbb16dfecce3acf0","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-14T00:18:36.335326Z","signature_b64":"1IuwlyNEad6w3AFkPclehsTipgERM5ijLMPRZkmYuhjTjWzLSZjmDXg7HSF1Is0U6aelJiNB5v7MHFfmoriNAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"08696beb6316d45fe85f7736dbf969f0331b5c99ff5e0ca3cbb16dfecce3acf0","last_reissued_at":"2026-07-14T00:18:36.334454Z","signature_status":"signed_v1","first_computed_at":"2026-07-14T00:18:36.334454Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2607.09796","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-14T00:18:36Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"q/W75NbeXzT60naqFIs33Dl2W5sac3CMkVGCcHcmOPTVyfO/iB7OhRWsEn3fIccjVE+Mv6AAmee9NzM/eRuJAQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-11T17:51:57.828235Z"},"content_sha256":"fb38f33d312fad829c8841875bf6a24ac845cd427849f191b2b661e914c2d24e","schema_version":"1.0","event_id":"sha256:fb38f33d312fad829c8841875bf6a24ac845cd427849f191b2b661e914c2d24e"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2026:BBUWX23DC3KF72C7O43NX6LJ6A","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Hua Qu, Xiaodong Yuan, Yifan Li","submitted_at":"2026-07-09T09:20:25Z","abstract_excerpt":"Direct Preference Optimization (DPO) has become an important method for aligning large language models (LLMs) with human preferences because it removes the need for explicit reward modeling and reinforcement learning optimization. However, its performance depends heavily on the quality of preference data, and noisy preference data in real-world settings can weaken alignment performance. To address this issue, we propose a bilevel optimization framework and prove, under certain assumptions, that this framework can recover the DPO optimum under clean data. We further derive a prior form for the "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.09796","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.09796/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-14T00:18:36Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"0zgfLpQI8vBoZBlhuuUbRL0OYPf8eliqTRkSDzvAGkiH9YAZv2NGu/M0dpkabk5g4OkS1xfjbcwSf75VTxgyDA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-11T17:51:57.828704Z"},"content_sha256":"45336682b29b8df808097a9c06e0a5be187714dca27834aba421fec035f465f9","schema_version":"1.0","event_id":"sha256:45336682b29b8df808097a9c06e0a5be187714dca27834aba421fec035f465f9"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/BBUWX23DC3KF72C7O43NX6LJ6A/bundle.json","state_url":"https://pith.science/pith/BBUWX23DC3KF72C7O43NX6LJ6A/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/BBUWX23DC3KF72C7O43NX6LJ6A/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-11T17:51:57Z","links":{"resolver":"https://pith.science/pith/BBUWX23DC3KF72C7O43NX6LJ6A","bundle":"https://pith.science/pith/BBUWX23DC3KF72C7O43NX6LJ6A/bundle.json","state":"https://pith.science/pith/BBUWX23DC3KF72C7O43NX6LJ6A/state.json","well_known_bundle":"https://pith.science/.well-known/pith/BBUWX23DC3KF72C7O43NX6LJ6A/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2026:BBUWX23DC3KF72C7O43NX6LJ6A","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"98067e63907a452a7ac325892889a97f4320840b46c05b60099828f484c5a229","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-09T09:20:25Z","title_canon_sha256":"7c1db98b6bc0de4227356c232fadec1132e7dda978c3633bfef8d99e9e1901b6"},"schema_version":"1.0","source":{"id":"2607.09796","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2607.09796","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"arxiv_version","alias_value":"2607.09796v1","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.09796","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"pith_short_12","alias_value":"BBUWX23DC3KF","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"pith_short_16","alias_value":"BBUWX23DC3KF72C7","created_at":"2026-07-14T00:18:36Z"},{"alias_kind":"pith_short_8","alias_value":"BBUWX23D","created_at":"2026-07-14T00:18:36Z"}],"graph_snapshots":[{"event_id":"sha256:45336682b29b8df808097a9c06e0a5be187714dca27834aba421fec035f465f9","target":"graph","created_at":"2026-07-14T00:18:36Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2607.09796/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Direct Preference Optimization (DPO) has become an important method for aligning large language models (LLMs) with human preferences because it removes the need for explicit reward modeling and reinforcement learning optimization. However, its performance depends heavily on the quality of preference data, and noisy preference data in real-world settings can weaken alignment performance. To address this issue, we propose a bilevel optimization framework and prove, under certain assumptions, that this framework can recover the DPO optimum under clean data. We further derive a prior form for the ","authors_text":"Hua Qu, Xiaodong Yuan, Yifan Li","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.09796","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:fb38f33d312fad829c8841875bf6a24ac845cd427849f191b2b661e914c2d24e","target":"record","created_at":"2026-07-14T00:18:36Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"98067e63907a452a7ac325892889a97f4320840b46c05b60099828f484c5a229","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-09T09:20:25Z","title_canon_sha256":"7c1db98b6bc0de4227356c232fadec1132e7dda978c3633bfef8d99e9e1901b6"},"schema_version":"1.0","source":{"id":"2607.09796","kind":"arxiv","version":1}},"canonical_sha256":"08696beb6316d45fe85f7736dbf969f0331b5c99ff5e0ca3cbb16dfecce3acf0","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"08696beb6316d45fe85f7736dbf969f0331b5c99ff5e0ca3cbb16dfecce3acf0","first_computed_at":"2026-07-14T00:18:36.334454Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-14T00:18:36.334454Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"1IuwlyNEad6w3AFkPclehsTipgERM5ijLMPRZkmYuhjTjWzLSZjmDXg7HSF1Is0U6aelJiNB5v7MHFfmoriNAQ==","signature_status":"signed_v1","signed_at":"2026-07-14T00:18:36.335326Z","signed_message":"canonical_sha256_bytes"},"source_id":"2607.09796","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:fb38f33d312fad829c8841875bf6a24ac845cd427849f191b2b661e914c2d24e","sha256:45336682b29b8df808097a9c06e0a5be187714dca27834aba421fec035f465f9"],"state_sha256":"c8b96eb5b2d4b63863424c87290fbb4dc1caaaee625cc3a593b52c52d040fcb6"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"zv37JrDEKZdBiny3PDgI7SE95pxvw262QRL3w9zbXoXocYvG4ru+gDN9gghng16r12v5S56BDtH7Y+jxQtfdAQ==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-11T17:51:57.831237Z","bundle_sha256":"14ccdac1489c92b3d04a7b4d1083583bd1268af17a653c7c0527b904ab82e4de"}}