{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:RIRWZXCSS5HIBF2BCRCU5PSUOX","short_pith_number":"pith:RIRWZXCS","schema_version":"1.0","canonical_sha256":"8a236cdc52974e80974114454ebe5475f3066f07779d6135f8098020c251f305","source":{"kind":"arxiv","id":"2210.02410","version":2},"attestation_state":"computed","paper":{"title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cond-mat.mtrl-sci","stat.ML"],"primary_cat":"cs.LG","authors_text":"Adji Bousso Dieng, Dan Friedman","submitted_at":"2022-10-05T17:32:16Z","abstract_excerpt":"Diversity is an important criterion for many areas of machine learning (ML), including generative modeling and dataset curation. However, existing metrics for measuring diversity are often domain-specific and limited in flexibility. In this paper, we address the diversity evaluation problem by proposing the Vendi Score, which connects and extends ideas from ecology and quantum statistical mechanics to ML. The Vendi Score is defined as the exponential of the Shannon entropy of the eigenvalues of a similarity matrix. This matrix is induced by a user-defined similarity function applied to the sam"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2210.02410","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2022-10-05T17:32:16Z","cross_cats_sorted":["cond-mat.mtrl-sci","stat.ML"],"title_canon_sha256":"9518415eb5693bf5d76728d01474076b8273fca130e3cfe670dc096ab03ad66c","abstract_canon_sha256":"51a7b8c69198615271f0111bddee2a53414b6eda884f6b0a608b1e21082dc4df"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:26:42.920963Z","signature_b64":"b9XWYVB/uxPpk+kEwZDDWcZ6Z70P8Nz/qHzIrnG+v4PbhZV3VLEp8b/D5vJA0vnDa5KDEhou6UJ5J4KaRzRjBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8a236cdc52974e80974114454ebe5475f3066f07779d6135f8098020c251f305","last_reissued_at":"2026-07-05T06:26:42.920480Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:26:42.920480Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cond-mat.mtrl-sci","stat.ML"],"primary_cat":"cs.LG","authors_text":"Adji Bousso Dieng, Dan Friedman","submitted_at":"2022-10-05T17:32:16Z","abstract_excerpt":"Diversity is an important criterion for many areas of machine learning (ML), including generative modeling and dataset curation. However, existing metrics for measuring diversity are often domain-specific and limited in flexibility. In this paper, we address the diversity evaluation problem by proposing the Vendi Score, which connects and extends ideas from ecology and quantum statistical mechanics to ML. The Vendi Score is defined as the exponential of the Shannon entropy of the eigenvalues of a similarity matrix. This matrix is induced by a user-defined similarity function applied to the sam"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2210.02410","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2210.02410/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2210.02410","created_at":"2026-07-05T06:26:42.920538+00:00"},{"alias_kind":"arxiv_version","alias_value":"2210.02410v2","created_at":"2026-07-05T06:26:42.920538+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2210.02410","created_at":"2026-07-05T06:26:42.920538+00:00"},{"alias_kind":"pith_short_12","alias_value":"RIRWZXCSS5HI","created_at":"2026-07-05T06:26:42.920538+00:00"},{"alias_kind":"pith_short_16","alias_value":"RIRWZXCSS5HIBF2B","created_at":"2026-07-05T06:26:42.920538+00:00"},{"alias_kind":"pith_short_8","alias_value":"RIRWZXCS","created_at":"2026-07-05T06:26:42.920538+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08515","citing_title":"Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH","ref_index":36,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26091","citing_title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27371","citing_title":"Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06813","citing_title":"Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14842","citing_title":"Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29448","citing_title":"How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30844","citing_title":"Fine-Tuning Improves Information Conveyance in Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2412.15689","citing_title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22564","citing_title":"SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17187","citing_title":"PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17193","citing_title":"Multi-LLM Systems Exhibit Robust Semantic Collapse","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20086","citing_title":"What Do Evolutionary Coding Agents Evolve?","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2509.25424","citing_title":"Polychromic Objectives for Reinforcement Learning","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2512.12072","citing_title":"VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2601.00090","citing_title":"It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2602.07633","citing_title":"Flow-Based Conformal Predictive Distributions","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2603.24480","citing_title":"Positive-First Most Ambiguous: A Simple Active Learning Criterion for Interactive Retrieval of Rare Categories","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03380","citing_title":"Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story Generation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03472","citing_title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11142","citing_title":"Rank Is Not Capacity: Spectral Occupancy for Latent Graph Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11494","citing_title":"STRIDE: Training-Free Diversity Guidance via PCA-Directed Feature Perturbation in Single-Step Diffusion Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11258","citing_title":"Unlocking LLM Creativity in Science through Analogical Reasoning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08472","citing_title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23540","citing_title":"Oracle Noise: Faster Semantic Spherical Alignment for Interpretable Latent Optimization","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05104","citing_title":"Building informative materials datasets beyond targeted objectives","ref_index":64,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX","json":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX.json","graph_json":"https://pith.science/api/pith-number/RIRWZXCSS5HIBF2BCRCU5PSUOX/graph.json","events_json":"https://pith.science/api/pith-number/RIRWZXCSS5HIBF2BCRCU5PSUOX/events.json","paper":"https://pith.science/paper/RIRWZXCS"},"agent_actions":{"view_html":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX","download_json":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX.json","view_paper":"https://pith.science/paper/RIRWZXCS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2210.02410&json=true","fetch_graph":"https://pith.science/api/pith-number/RIRWZXCSS5HIBF2BCRCU5PSUOX/graph.json","fetch_events":"https://pith.science/api/pith-number/RIRWZXCSS5HIBF2BCRCU5PSUOX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX/action/storage_attestation","attest_author":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX/action/author_attestation","sign_citation":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX/action/citation_signature","submit_replication":"https://pith.science/pith/RIRWZXCSS5HIBF2BCRCU5PSUOX/action/replication_record"}},"created_at":"2026-07-05T06:26:42.920538+00:00","updated_at":"2026-07-05T06:26:42.920538+00:00"}