{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:QYN6A6SC54E6XON2UUGCPI6Q3U","short_pith_number":"pith:QYN6A6SC","schema_version":"1.0","canonical_sha256":"861be07a42ef09ebb9baa50c27a3d0dd0ca9afe0f8d8e4e0c1099f23f605c291","source":{"kind":"arxiv","id":"2209.05355","version":4},"attestation_state":"computed","paper":{"title":"Analysis and Comparison of Classification Metrics","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Luciana Ferrer","submitted_at":"2022-09-12T16:06:10Z","abstract_excerpt":"A variety of different performance metrics are commonly used in the machine learning literature for the evaluation of classification systems. Some of the most common ones for measuring quality of hard decisions are standard and balanced accuracy, standard and balanced error rate, F-beta score, and Matthews correlation coefficient (MCC). In this document, we review the definition of these and other metrics and compare them with the expected cost (EC), a metric introduced in every statistical learning course but rarely used in the machine learning literature. We show that both the standard and b"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2209.05355","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-12T16:06:10Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"e36ddf475071a6777fc19a21e6b7a5a3b907864ffaee8513b388c034af4e7c7d","abstract_canon_sha256":"8306385a0433fdcfa26abdc3088eaf0579c7d76ea03730762106b7d7c0045e7c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:52:43.791341Z","signature_b64":"tkew7yCfZN4u9UIOeY4Vol30KahYxfOinA1/zAt7X1s+G81bO5w8+lNjSEd1Vk64bFx58dMeygRBQMjKWbOJCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"861be07a42ef09ebb9baa50c27a3d0dd0ca9afe0f8d8e4e0c1099f23f605c291","last_reissued_at":"2026-07-05T06:52:43.790823Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:52:43.790823Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Analysis and Comparison of Classification Metrics","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Luciana Ferrer","submitted_at":"2022-09-12T16:06:10Z","abstract_excerpt":"A variety of different performance metrics are commonly used in the machine learning literature for the evaluation of classification systems. Some of the most common ones for measuring quality of hard decisions are standard and balanced accuracy, standard and balanced error rate, F-beta score, and Matthews correlation coefficient (MCC). In this document, we review the definition of these and other metrics and compare them with the expected cost (EC), a metric introduced in every statistical learning course but rarely used in the machine learning literature. We show that both the standard and b"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2209.05355","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2209.05355/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2209.05355","created_at":"2026-07-05T06:52:43.790887+00:00"},{"alias_kind":"arxiv_version","alias_value":"2209.05355v4","created_at":"2026-07-05T06:52:43.790887+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2209.05355","created_at":"2026-07-05T06:52:43.790887+00:00"},{"alias_kind":"pith_short_12","alias_value":"QYN6A6SC54E6","created_at":"2026-07-05T06:52:43.790887+00:00"},{"alias_kind":"pith_short_16","alias_value":"QYN6A6SC54E6XON2","created_at":"2026-07-05T06:52:43.790887+00:00"},{"alias_kind":"pith_short_8","alias_value":"QYN6A6SC","created_at":"2026-07-05T06:52:43.790887+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.21088","citing_title":"Jet Quenching Identification via Supervised Learning in Simulated Heavy-Ion Collisions","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10372","citing_title":"ClinReadNet: A clinical reading-inspired network for low-dose abdominal CT image quality assessment","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21088","citing_title":"Jet Quenching Identification via Supervised Learning in Simulated Heavy-Ion Collisions","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01936","citing_title":"Pandora's Regret: A Proper Scoring Rule for Evaluating Sequential Search","ref_index":79,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U","json":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U.json","graph_json":"https://pith.science/api/pith-number/QYN6A6SC54E6XON2UUGCPI6Q3U/graph.json","events_json":"https://pith.science/api/pith-number/QYN6A6SC54E6XON2UUGCPI6Q3U/events.json","paper":"https://pith.science/paper/QYN6A6SC"},"agent_actions":{"view_html":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U","download_json":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U.json","view_paper":"https://pith.science/paper/QYN6A6SC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2209.05355&json=true","fetch_graph":"https://pith.science/api/pith-number/QYN6A6SC54E6XON2UUGCPI6Q3U/graph.json","fetch_events":"https://pith.science/api/pith-number/QYN6A6SC54E6XON2UUGCPI6Q3U/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U/action/timestamp_anchor","attest_storage":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U/action/storage_attestation","attest_author":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U/action/author_attestation","sign_citation":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U/action/citation_signature","submit_replication":"https://pith.science/pith/QYN6A6SC54E6XON2UUGCPI6Q3U/action/replication_record"}},"created_at":"2026-07-05T06:52:43.790887+00:00","updated_at":"2026-07-05T06:52:43.790887+00:00"}