{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:72KOHCDG3JD2RODUJYCFEEWOM7","short_pith_number":"pith:72KOHCDG","schema_version":"1.0","canonical_sha256":"fe94e38866da47a8b8744e045212ce67c6dbe8fcdee27597dffec0bfa3b0b372","source":{"kind":"arxiv","id":"2310.13011","version":2},"attestation_state":"computed","paper":{"title":"Compositional preference models for aligning LMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Dongyoung Go, Germ\\'an Kruszewski, Jos Rozen, Marc Dymetman, Tomasz Korbak","submitted_at":"2023-10-17T01:31:59Z","abstract_excerpt":"As language models (LMs) become more capable, it is increasingly important to align them with human preferences. However, the dominant paradigm for training Preference Models (PMs) for that purpose suffers from fundamental limitations, such as lack of transparency and scalability, along with susceptibility to overfitting the preference dataset. We propose Compositional Preference Models (CPMs), a novel PM framework that decomposes one global preference assessment into several interpretable features, obtains scalar scores for these features from a prompted LM, and aggregates these scores using "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.13011","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-10-17T01:31:59Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"11899506fc8c9aaf0e65790e2c6258bf1419cf79a1550bd25470acf14fe9feac","abstract_canon_sha256":"580672e0812fb0b272630f768df997798dd83e0f22d7b4c599fa2aa031729668"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:56:18.091271Z","signature_b64":"tkPCOxIA95M4AVOS12xgbaP+c1Ub5EgUaDUpsIqVwbHvo54+hoIwAJsXBAeJ6oBU7bBRX7UI7Il77jGl1cZTBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fe94e38866da47a8b8744e045212ce67c6dbe8fcdee27597dffec0bfa3b0b372","last_reissued_at":"2026-07-05T07:56:18.090743Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:56:18.090743Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Compositional preference models for aligning LMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Dongyoung Go, Germ\\'an Kruszewski, Jos Rozen, Marc Dymetman, Tomasz Korbak","submitted_at":"2023-10-17T01:31:59Z","abstract_excerpt":"As language models (LMs) become more capable, it is increasingly important to align them with human preferences. However, the dominant paradigm for training Preference Models (PMs) for that purpose suffers from fundamental limitations, such as lack of transparency and scalability, along with susceptibility to overfitting the preference dataset. We propose Compositional Preference Models (CPMs), a novel PM framework that decomposes one global preference assessment into several interpretable features, obtains scalar scores for these features from a prompted LM, and aggregates these scores using "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.13011","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.13011/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.13011","created_at":"2026-07-05T07:56:18.090812+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.13011v2","created_at":"2026-07-05T07:56:18.090812+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.13011","created_at":"2026-07-05T07:56:18.090812+00:00"},{"alias_kind":"pith_short_12","alias_value":"72KOHCDG3JD2","created_at":"2026-07-05T07:56:18.090812+00:00"},{"alias_kind":"pith_short_16","alias_value":"72KOHCDG3JD2RODU","created_at":"2026-07-05T07:56:18.090812+00:00"},{"alias_kind":"pith_short_8","alias_value":"72KOHCDG","created_at":"2026-07-05T07:56:18.090812+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.12360","citing_title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11470","citing_title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27015","citing_title":"PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7","json":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7.json","graph_json":"https://pith.science/api/pith-number/72KOHCDG3JD2RODUJYCFEEWOM7/graph.json","events_json":"https://pith.science/api/pith-number/72KOHCDG3JD2RODUJYCFEEWOM7/events.json","paper":"https://pith.science/paper/72KOHCDG"},"agent_actions":{"view_html":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7","download_json":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7.json","view_paper":"https://pith.science/paper/72KOHCDG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.13011&json=true","fetch_graph":"https://pith.science/api/pith-number/72KOHCDG3JD2RODUJYCFEEWOM7/graph.json","fetch_events":"https://pith.science/api/pith-number/72KOHCDG3JD2RODUJYCFEEWOM7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7/action/storage_attestation","attest_author":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7/action/author_attestation","sign_citation":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7/action/citation_signature","submit_replication":"https://pith.science/pith/72KOHCDG3JD2RODUJYCFEEWOM7/action/replication_record"}},"created_at":"2026-07-05T07:56:18.090812+00:00","updated_at":"2026-07-05T07:56:18.090812+00:00"}