{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:XAD6NZTIJVCPPKQ5UWDMFQNEXL","short_pith_number":"pith:XAD6NZTI","schema_version":"1.0","canonical_sha256":"b807e6e6684d44f7aa1da586c2c1a4baca26e9ae538ac7c5ff7349a07cca0c4f","source":{"kind":"arxiv","id":"2607.01392","version":1},"attestation_state":"computed","paper":{"title":"Multi-Objective Exploration and Preference Optimization via Mutual Information","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Deqing Wang, Hongyan Xie, Jianxin Li, Ruiyu Fang, Shuangyong Song, Yikun Ban, Zixuang Huang","submitted_at":"2026-07-01T18:50:14Z","abstract_excerpt":"Aligning large language models with diverse and heterogeneous human values requires multi-objective alignment methods to effectively trade off conflicting preference dimensions. Current methods achieve this trade-off by training policies conditioned on preference vectors and leveraging online direct preference optimization. However, exploration uncertainty can cause the reward distributions of responses generated under different preference vectors to overlap, and the generated responses may fail to effectively align with the corresponding preference vectors. In this paper, we propose Multi-Obj"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.01392","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2026-07-01T18:50:14Z","cross_cats_sorted":[],"title_canon_sha256":"a12ec27c5f8ce1e3e6e4eba94e91c538b4b6bf7fe585b83848d11b7c56029997","abstract_canon_sha256":"d48f1f386b3df1efbbe506bdab1384b2bedc4c9e21c68a000465e63a0e9c1622"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-03T00:16:59.165237Z","signature_b64":"m4FyDg5ImN60+ZF1zTKAesFLTsdZGhqOODISiW72BBm4NW1cORsBryT2SaZnPgxz+Z/VRHj9dLsxiDh9BNayAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b807e6e6684d44f7aa1da586c2c1a4baca26e9ae538ac7c5ff7349a07cca0c4f","last_reissued_at":"2026-07-03T00:16:59.164875Z","signature_status":"signed_v1","first_computed_at":"2026-07-03T00:16:59.164875Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Multi-Objective Exploration and Preference Optimization via Mutual Information","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Deqing Wang, Hongyan Xie, Jianxin Li, Ruiyu Fang, Shuangyong Song, Yikun Ban, Zixuang Huang","submitted_at":"2026-07-01T18:50:14Z","abstract_excerpt":"Aligning large language models with diverse and heterogeneous human values requires multi-objective alignment methods to effectively trade off conflicting preference dimensions. Current methods achieve this trade-off by training policies conditioned on preference vectors and leveraging online direct preference optimization. However, exploration uncertainty can cause the reward distributions of responses generated under different preference vectors to overlap, and the generated responses may fail to effectively align with the corresponding preference vectors. In this paper, we propose Multi-Obj"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.01392","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.01392/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.01392","created_at":"2026-07-03T00:16:59.164941+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.01392v1","created_at":"2026-07-03T00:16:59.164941+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.01392","created_at":"2026-07-03T00:16:59.164941+00:00"},{"alias_kind":"pith_short_12","alias_value":"XAD6NZTIJVCP","created_at":"2026-07-03T00:16:59.164941+00:00"},{"alias_kind":"pith_short_16","alias_value":"XAD6NZTIJVCPPKQ5","created_at":"2026-07-03T00:16:59.164941+00:00"},{"alias_kind":"pith_short_8","alias_value":"XAD6NZTI","created_at":"2026-07-03T00:16:59.164941+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL","json":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL.json","graph_json":"https://pith.science/api/pith-number/XAD6NZTIJVCPPKQ5UWDMFQNEXL/graph.json","events_json":"https://pith.science/api/pith-number/XAD6NZTIJVCPPKQ5UWDMFQNEXL/events.json","paper":"https://pith.science/paper/XAD6NZTI"},"agent_actions":{"view_html":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL","download_json":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL.json","view_paper":"https://pith.science/paper/XAD6NZTI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.01392&json=true","fetch_graph":"https://pith.science/api/pith-number/XAD6NZTIJVCPPKQ5UWDMFQNEXL/graph.json","fetch_events":"https://pith.science/api/pith-number/XAD6NZTIJVCPPKQ5UWDMFQNEXL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL/action/storage_attestation","attest_author":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL/action/author_attestation","sign_citation":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL/action/citation_signature","submit_replication":"https://pith.science/pith/XAD6NZTIJVCPPKQ5UWDMFQNEXL/action/replication_record"}},"created_at":"2026-07-03T00:16:59.164941+00:00","updated_at":"2026-07-03T00:16:59.164941+00:00"}