{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:YTYKBXQYUNNYFBZNZ7HE6XAYVF","short_pith_number":"pith:YTYKBXQY","schema_version":"1.0","canonical_sha256":"c4f0a0de18a35b82872dcfce4f5c18a94ab3c23fe0b98caba4591200de13168b","source":{"kind":"arxiv","id":"2506.08712","version":2},"attestation_state":"computed","paper":{"title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Chang D. Yoo, Eunseop Yoon, Hee Suk Yoon, Mark Hasegawa-Johnson, Sungwoong Kim","submitted_at":"2025-06-10T11:54:22Z","abstract_excerpt":"We introduce ConfPO, a method for preference learning in Large Language Models (LLMs) that identifies and optimizes preference-critical tokens based solely on the training policy's confidence, without requiring any auxiliary models or compute. Unlike prior Direct Alignment Algorithms (DAAs) such as Direct Preference Optimization (DPO), which uniformly adjust all token probabilities regardless of their relevance to preference, ConfPO focuses optimization on the most impactful tokens. This targeted approach improves alignment quality while mitigating overoptimization (i.e., reward hacking) by us"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.08712","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-06-10T11:54:22Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"d0348ceacfa6c09a64956ed622d63a1830c54b8cac4aaa8e3aa8853995978487","abstract_canon_sha256":"abe9274a37833bd2a20e32eb860d9b05783ec1b16ff377f29ed108c16ef6afbc"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:14.306510Z","signature_b64":"huXeT6cgCaziDs4a3REHVNqJb/bO9P3v8wuuk6+vcU9QQ4MVm/dN/h6atSPHkS1bVwVEpPb5iMPRQM+LEmrGAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c4f0a0de18a35b82872dcfce4f5c18a94ab3c23fe0b98caba4591200de13168b","last_reissued_at":"2026-07-05T11:20:14.306040Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:14.306040Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Chang D. Yoo, Eunseop Yoon, Hee Suk Yoon, Mark Hasegawa-Johnson, Sungwoong Kim","submitted_at":"2025-06-10T11:54:22Z","abstract_excerpt":"We introduce ConfPO, a method for preference learning in Large Language Models (LLMs) that identifies and optimizes preference-critical tokens based solely on the training policy's confidence, without requiring any auxiliary models or compute. Unlike prior Direct Alignment Algorithms (DAAs) such as Direct Preference Optimization (DPO), which uniformly adjust all token probabilities regardless of their relevance to preference, ConfPO focuses optimization on the most impactful tokens. This targeted approach improves alignment quality while mitigating overoptimization (i.e., reward hacking) by us"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.08712","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.08712/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.08712","created_at":"2026-07-05T11:20:14.306093+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.08712v2","created_at":"2026-07-05T11:20:14.306093+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.08712","created_at":"2026-07-05T11:20:14.306093+00:00"},{"alias_kind":"pith_short_12","alias_value":"YTYKBXQYUNNY","created_at":"2026-07-05T11:20:14.306093+00:00"},{"alias_kind":"pith_short_16","alias_value":"YTYKBXQYUNNYFBZN","created_at":"2026-07-05T11:20:14.306093+00:00"},{"alias_kind":"pith_short_8","alias_value":"YTYKBXQY","created_at":"2026-07-05T11:20:14.306093+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2509.20265","citing_title":"Failure Modes of Maximum Entropy RLHF","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF","json":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF.json","graph_json":"https://pith.science/api/pith-number/YTYKBXQYUNNYFBZNZ7HE6XAYVF/graph.json","events_json":"https://pith.science/api/pith-number/YTYKBXQYUNNYFBZNZ7HE6XAYVF/events.json","paper":"https://pith.science/paper/YTYKBXQY"},"agent_actions":{"view_html":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF","download_json":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF.json","view_paper":"https://pith.science/paper/YTYKBXQY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.08712&json=true","fetch_graph":"https://pith.science/api/pith-number/YTYKBXQYUNNYFBZNZ7HE6XAYVF/graph.json","fetch_events":"https://pith.science/api/pith-number/YTYKBXQYUNNYFBZNZ7HE6XAYVF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF/action/storage_attestation","attest_author":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF/action/author_attestation","sign_citation":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF/action/citation_signature","submit_replication":"https://pith.science/pith/YTYKBXQYUNNYFBZNZ7HE6XAYVF/action/replication_record"}},"created_at":"2026-07-05T11:20:14.306093+00:00","updated_at":"2026-07-05T11:20:14.306093+00:00"}