{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:6HJLP3I45QCWQQ53BDJGVCCSAA","short_pith_number":"pith:6HJLP3I4","schema_version":"1.0","canonical_sha256":"f1d2b7ed1cec056843bb08d26a8852001dcfba6be0d07b8f134bd006d6738570","source":{"kind":"arxiv","id":"2509.02534","version":1},"attestation_state":"computed","paper":{"title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Daniel Khashabi, Jack Lanchantin, Jason Weston, Ping Yu, Swarnadeep Saha, Tianjian Li, Tianlu Wang, Yiming Zhang","submitted_at":"2025-09-02T17:38:47Z","abstract_excerpt":"Post-training of Large Language Models (LMs) often prioritizes accuracy and helpfulness at the expense of diversity. This creates a tension: while post-training improves response quality, it also sharpens output distributions and reduces the range of ideas, limiting the usefulness of LMs in creative and exploratory tasks such as brainstorming, storytelling, or problem solving. We address this challenge with Diversity-Aware Reinforcement Learning (DARLING), a framework that jointly optimizes for response quality and semantic diversity. At its core, DARLING introduces a learned partition functio"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.02534","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-09-02T17:38:47Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"0d88f6488af2b782bd508612c86f4fc972f3c8b8db43a40c261ab9f034ec5a11","abstract_canon_sha256":"e731e181253f76fbfcab1caa30ac9697352f51a9804e6de02d2c8fe20c3c1f0a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:03:40.530585Z","signature_b64":"d5ZvPVBIXHZqKf5PQWUWgZvwKG72i8GMEfSSQf2KSmKjxujCqTi81G1/MPlCmj3eJq374+fbMdS+pr78c5tkAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f1d2b7ed1cec056843bb08d26a8852001dcfba6be0d07b8f134bd006d6738570","last_reissued_at":"2026-07-05T12:03:40.530064Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:03:40.530064Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Daniel Khashabi, Jack Lanchantin, Jason Weston, Ping Yu, Swarnadeep Saha, Tianjian Li, Tianlu Wang, Yiming Zhang","submitted_at":"2025-09-02T17:38:47Z","abstract_excerpt":"Post-training of Large Language Models (LMs) often prioritizes accuracy and helpfulness at the expense of diversity. This creates a tension: while post-training improves response quality, it also sharpens output distributions and reduces the range of ideas, limiting the usefulness of LMs in creative and exploratory tasks such as brainstorming, storytelling, or problem solving. We address this challenge with Diversity-Aware Reinforcement Learning (DARLING), a framework that jointly optimizes for response quality and semantic diversity. At its core, DARLING introduces a learned partition functio"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.02534","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.02534/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.02534","created_at":"2026-07-05T12:03:40.530126+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.02534v1","created_at":"2026-07-05T12:03:40.530126+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.02534","created_at":"2026-07-05T12:03:40.530126+00:00"},{"alias_kind":"pith_short_12","alias_value":"6HJLP3I45QCW","created_at":"2026-07-05T12:03:40.530126+00:00"},{"alias_kind":"pith_short_16","alias_value":"6HJLP3I45QCWQQ53","created_at":"2026-07-05T12:03:40.530126+00:00"},{"alias_kind":"pith_short_8","alias_value":"6HJLP3I4","created_at":"2026-07-05T12:03:40.530126+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26091","citing_title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01849","citing_title":"Decomposer: Learning to Decompile Symbolic Music to Programs","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10346","citing_title":"Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07856","citing_title":"Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@$K$ Crossover on a Free-Verifier Domain","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06096","citing_title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06080","citing_title":"On Advantage Estimates for Max@K Policy Gradients","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03962","citing_title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17314","citing_title":"Weak-to-Strong Elicitation via Mismatched Wrong Drafts","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27000","citing_title":"Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27130","citing_title":"DEI: Diversity in Evolutionary Inference for Quality-Diversity Search","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11461","citing_title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17314","citing_title":"Weak-to-Strong Elicitation via Mismatched Wrong Drafts","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2509.21267","citing_title":"Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2509.25424","citing_title":"Polychromic Objectives for Reinforcement Learning","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2509.08827","citing_title":"A Survey of Reinforcement Learning for Large Reasoning Models","ref_index":282,"is_internal_anchor":false},{"citing_arxiv_id":"2512.12072","citing_title":"VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03472","citing_title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11461","citing_title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06540","citing_title":"Ex Ante Evaluation of AI-Induced Idea Diversity Collapse","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18493","citing_title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","ref_index":39,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA","json":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA.json","graph_json":"https://pith.science/api/pith-number/6HJLP3I45QCWQQ53BDJGVCCSAA/graph.json","events_json":"https://pith.science/api/pith-number/6HJLP3I45QCWQQ53BDJGVCCSAA/events.json","paper":"https://pith.science/paper/6HJLP3I4"},"agent_actions":{"view_html":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA","download_json":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA.json","view_paper":"https://pith.science/paper/6HJLP3I4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.02534&json=true","fetch_graph":"https://pith.science/api/pith-number/6HJLP3I45QCWQQ53BDJGVCCSAA/graph.json","fetch_events":"https://pith.science/api/pith-number/6HJLP3I45QCWQQ53BDJGVCCSAA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA/action/storage_attestation","attest_author":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA/action/author_attestation","sign_citation":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA/action/citation_signature","submit_replication":"https://pith.science/pith/6HJLP3I45QCWQQ53BDJGVCCSAA/action/replication_record"}},"created_at":"2026-07-05T12:03:40.530126+00:00","updated_at":"2026-07-05T12:03:40.530126+00:00"}