{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:2N2EPDRCLGZQYNR6W4OWVPLZ35","short_pith_number":"pith:2N2EPDRC","schema_version":"1.0","canonical_sha256":"d374478e2259b30c363eb71d6abd79df445fe3accbaa7198693c0682cc14d65f","source":{"kind":"arxiv","id":"2608.09568","version":1},"attestation_state":"computed","paper":{"title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Shu Wang, Wenxiao Zhao, Ying Nian Wu","submitted_at":"2026-08-10T13:05:38Z","abstract_excerpt":"Direct Preference Optimization (DPO) aggregates token-level log-probability ratios via uniform summation, implicitly treating all tokens as contributing equally to the preference signal. However, the contribution of individual tokens to the preference signal varies. We introduce token credit, which modulates each token's KL regularization based on its contribution to the preference outcome. We derive that effective token credit is proportional to the magnitude of each token's implicit reward, and observe that this quantity evolves substantially during training. This implies that static token c"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2608.09568","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2026-08-10T13:05:38Z","cross_cats_sorted":[],"title_canon_sha256":"512b95e0c0fc8ded47bbf1e802ef7423139baa2854d65523938bed716b86ab71","abstract_canon_sha256":"ebe1646eed763adf4b8bd672f434de01f6c3346823d795ba6cd92749d2bf36fe"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-11T02:24:31.219241Z","signature_b64":"icZYHi9JFZaWKWW6frrnrlLq/83s2OhtTu17UZryZeDYulxvz45I9JO17SGs5RjANDmTH9QlH5INP+Q78Xd5CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d374478e2259b30c363eb71d6abd79df445fe3accbaa7198693c0682cc14d65f","last_reissued_at":"2026-08-11T02:24:31.217609Z","signature_status":"signed_v1","first_computed_at":"2026-08-11T02:24:31.217609Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Shu Wang, Wenxiao Zhao, Ying Nian Wu","submitted_at":"2026-08-10T13:05:38Z","abstract_excerpt":"Direct Preference Optimization (DPO) aggregates token-level log-probability ratios via uniform summation, implicitly treating all tokens as contributing equally to the preference signal. However, the contribution of individual tokens to the preference signal varies. We introduce token credit, which modulates each token's KL regularization based on its contribution to the preference outcome. We derive that effective token credit is proportional to the magnitude of each token's implicit reward, and observe that this quantity evolves substantially during training. This implies that static token c"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2608.09568","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2608.09568/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2608.09568","created_at":"2026-08-11T02:24:31.218335+00:00"},{"alias_kind":"arxiv_version","alias_value":"2608.09568v1","created_at":"2026-08-11T02:24:31.218335+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2608.09568","created_at":"2026-08-11T02:24:31.218335+00:00"},{"alias_kind":"pith_short_12","alias_value":"2N2EPDRCLGZQ","created_at":"2026-08-11T02:24:31.218335+00:00"},{"alias_kind":"pith_short_16","alias_value":"2N2EPDRCLGZQYNR6","created_at":"2026-08-11T02:24:31.218335+00:00"},{"alias_kind":"pith_short_8","alias_value":"2N2EPDRC","created_at":"2026-08-11T02:24:31.218335+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35","json":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35.json","graph_json":"https://pith.science/api/pith-number/2N2EPDRCLGZQYNR6W4OWVPLZ35/graph.json","events_json":"https://pith.science/api/pith-number/2N2EPDRCLGZQYNR6W4OWVPLZ35/events.json","paper":"https://pith.science/paper/2N2EPDRC"},"agent_actions":{"view_html":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35","download_json":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35.json","view_paper":"https://pith.science/paper/2N2EPDRC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2608.09568&json=true","fetch_graph":"https://pith.science/api/pith-number/2N2EPDRCLGZQYNR6W4OWVPLZ35/graph.json","fetch_events":"https://pith.science/api/pith-number/2N2EPDRCLGZQYNR6W4OWVPLZ35/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35/action/storage_attestation","attest_author":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35/action/author_attestation","sign_citation":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35/action/citation_signature","submit_replication":"https://pith.science/pith/2N2EPDRCLGZQYNR6W4OWVPLZ35/action/replication_record"}},"created_at":"2026-08-11T02:24:31.218335+00:00","updated_at":"2026-08-11T02:24:31.218335+00:00"}