{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:J3P74UFD7NXVW3QNESVTOSZRUE","short_pith_number":"pith:J3P74UFD","schema_version":"1.0","canonical_sha256":"4edffe50a3fb6f5b6e0d24ab374b31a11368d38a0a81a590c2a0a93a0d52f8ce","source":{"kind":"arxiv","id":"2311.14736","version":3},"attestation_state":"computed","paper":{"title":"Data Diversity Matters for Robust Instruction Tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Alexander Bukharin, Bing Yin, Chao Zhang, Haoming Jiang, Jingfeng Yang, Shiyang Li, Tuo Zhao, Xian Li, Zhengyang Wang","submitted_at":"2023-11-21T19:12:18Z","abstract_excerpt":"Recent works have shown that by curating high quality and diverse instruction tuning datasets, we can significantly improve instruction-following capabilities. However, creating such datasets is difficult and most works rely on manual curation or proprietary language models. Automatic data curation is difficult as it is still not clear how we can define diversity for instruction tuning, how diversity and quality depend on one other, and how we can optimize dataset quality and diversity. To resolve these issue, we propose a new algorithm, Quality-Diversity Instruction Tuning (QDIT). QDIT provid"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.14736","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-21T19:12:18Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"907b9a72a1362b5df1f0bab16bc103ec14aacb345bbeb5ceb3aec453eb0d6723","abstract_canon_sha256":"01b2a44078a92e506730447ed8cdbc39b3a30c4d2b15d89bba5dfb8d6dca4620"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:33:26.864996Z","signature_b64":"8jjej1fHcfotXg6AcZObxY2jcGbZuaLF4P8BeYt5OKW0YVwtW3nxcVhtColb7KHX6CY2K5+ZRWADk6o8vgThAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4edffe50a3fb6f5b6e0d24ab374b31a11368d38a0a81a590c2a0a93a0d52f8ce","last_reissued_at":"2026-07-05T09:33:26.864503Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:33:26.864503Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Data Diversity Matters for Robust Instruction Tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Alexander Bukharin, Bing Yin, Chao Zhang, Haoming Jiang, Jingfeng Yang, Shiyang Li, Tuo Zhao, Xian Li, Zhengyang Wang","submitted_at":"2023-11-21T19:12:18Z","abstract_excerpt":"Recent works have shown that by curating high quality and diverse instruction tuning datasets, we can significantly improve instruction-following capabilities. However, creating such datasets is difficult and most works rely on manual curation or proprietary language models. Automatic data curation is difficult as it is still not clear how we can define diversity for instruction tuning, how diversity and quality depend on one other, and how we can optimize dataset quality and diversity. To resolve these issue, we propose a new algorithm, Quality-Diversity Instruction Tuning (QDIT). QDIT provid"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.14736","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.14736/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.14736","created_at":"2026-07-05T09:33:26.864559+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.14736v3","created_at":"2026-07-05T09:33:26.864559+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.14736","created_at":"2026-07-05T09:33:26.864559+00:00"},{"alias_kind":"pith_short_12","alias_value":"J3P74UFD7NXV","created_at":"2026-07-05T09:33:26.864559+00:00"},{"alias_kind":"pith_short_16","alias_value":"J3P74UFD7NXVW3QN","created_at":"2026-07-05T09:33:26.864559+00:00"},{"alias_kind":"pith_short_8","alias_value":"J3P74UFD","created_at":"2026-07-05T09:33:26.864559+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.05227","citing_title":"Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE","json":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE.json","graph_json":"https://pith.science/api/pith-number/J3P74UFD7NXVW3QNESVTOSZRUE/graph.json","events_json":"https://pith.science/api/pith-number/J3P74UFD7NXVW3QNESVTOSZRUE/events.json","paper":"https://pith.science/paper/J3P74UFD"},"agent_actions":{"view_html":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE","download_json":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE.json","view_paper":"https://pith.science/paper/J3P74UFD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.14736&json=true","fetch_graph":"https://pith.science/api/pith-number/J3P74UFD7NXVW3QNESVTOSZRUE/graph.json","fetch_events":"https://pith.science/api/pith-number/J3P74UFD7NXVW3QNESVTOSZRUE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE/action/storage_attestation","attest_author":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE/action/author_attestation","sign_citation":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE/action/citation_signature","submit_replication":"https://pith.science/pith/J3P74UFD7NXVW3QNESVTOSZRUE/action/replication_record"}},"created_at":"2026-07-05T09:33:26.864559+00:00","updated_at":"2026-07-05T09:33:26.864559+00:00"}