{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:YPSI7QSMDI4NDPPNJAT6QRAMZA","short_pith_number":"pith:YPSI7QSM","schema_version":"1.0","canonical_sha256":"c3e48fc24c1a38d1bded4827e8440cc81ffaa87906ccf7248c9d7b8bb39e11bb","source":{"kind":"arxiv","id":"2409.17763","version":2},"attestation_state":"computed","paper":{"title":"Confidence intervals uncovered: Are we ready for real-world medical imaging AI?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Amber Simpson, Annette Kopp-Schneider, Annika Reinke, Carole H. Sudre, Evangelia Christodoulou, Ga\\\"el Varoquaux, Lena Maier-Hein, Leon D. Mayer, Ma\\\"elys Solal, Michela Antonelli, Minu D. Tizabi, M. Jorge Cardoso, Nicola Rieke, Ninon Burgos, Olivier Colliot, Paul F. J\\\"ager, Piotr Kalinowski, Rola Houhou, Selen Erkan, Sofi\\`ene Boutaj, Sophie Loizillon, Veronika Cheplygina","submitted_at":"2024-09-26T11:58:41Z","abstract_excerpt":"Medical imaging is spearheading the AI transformation of healthcare. Performance reporting is key to determine which methods should be translated into clinical practice. Frequently, broad conclusions are simply derived from mean performance values. In this paper, we argue that this common practice is often a misleading simplification as it ignores performance variability. Our contribution is threefold. (1) Analyzing all MICCAI segmentation papers (n = 221) published in 2023, we first observe that more than 50% of papers do not assess performance variability at all. Moreover, only one (0.5%) pa"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.17763","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-09-26T11:58:41Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"4542578be0138b73e7c8169cf1cc033d360469ca580721728f7be98b58366481","abstract_canon_sha256":"8eed5c35ab83f0106e497e41d50ffacf65fb012610d94a66be195aebc446799f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:12:31.515252Z","signature_b64":"/fK2cfqgq9RxYUsfKMy7TJYLwU9jT8QP7ZHdZjp2Ql50qiL1EYxzcgKq3Fb+h+Rn5mPop8Jwo6ZvyV2Xi4TFDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c3e48fc24c1a38d1bded4827e8440cc81ffaa87906ccf7248c9d7b8bb39e11bb","last_reissued_at":"2026-07-05T09:12:31.514700Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:12:31.514700Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Confidence intervals uncovered: Are we ready for real-world medical imaging AI?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Amber Simpson, Annette Kopp-Schneider, Annika Reinke, Carole H. Sudre, Evangelia Christodoulou, Ga\\\"el Varoquaux, Lena Maier-Hein, Leon D. Mayer, Ma\\\"elys Solal, Michela Antonelli, Minu D. Tizabi, M. Jorge Cardoso, Nicola Rieke, Ninon Burgos, Olivier Colliot, Paul F. J\\\"ager, Piotr Kalinowski, Rola Houhou, Selen Erkan, Sofi\\`ene Boutaj, Sophie Loizillon, Veronika Cheplygina","submitted_at":"2024-09-26T11:58:41Z","abstract_excerpt":"Medical imaging is spearheading the AI transformation of healthcare. Performance reporting is key to determine which methods should be translated into clinical practice. Frequently, broad conclusions are simply derived from mean performance values. In this paper, we argue that this common practice is often a misleading simplification as it ignores performance variability. Our contribution is threefold. (1) Analyzing all MICCAI segmentation papers (n = 221) published in 2023, we first observe that more than 50% of papers do not assess performance variability at all. Moreover, only one (0.5%) pa"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.17763","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.17763/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.17763","created_at":"2026-07-05T09:12:31.514760+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.17763v2","created_at":"2026-07-05T09:12:31.514760+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.17763","created_at":"2026-07-05T09:12:31.514760+00:00"},{"alias_kind":"pith_short_12","alias_value":"YPSI7QSMDI4N","created_at":"2026-07-05T09:12:31.514760+00:00"},{"alias_kind":"pith_short_16","alias_value":"YPSI7QSMDI4NDPPN","created_at":"2026-07-05T09:12:31.514760+00:00"},{"alias_kind":"pith_short_8","alias_value":"YPSI7QSM","created_at":"2026-07-05T09:12:31.514760+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA","json":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA.json","graph_json":"https://pith.science/api/pith-number/YPSI7QSMDI4NDPPNJAT6QRAMZA/graph.json","events_json":"https://pith.science/api/pith-number/YPSI7QSMDI4NDPPNJAT6QRAMZA/events.json","paper":"https://pith.science/paper/YPSI7QSM"},"agent_actions":{"view_html":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA","download_json":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA.json","view_paper":"https://pith.science/paper/YPSI7QSM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.17763&json=true","fetch_graph":"https://pith.science/api/pith-number/YPSI7QSMDI4NDPPNJAT6QRAMZA/graph.json","fetch_events":"https://pith.science/api/pith-number/YPSI7QSMDI4NDPPNJAT6QRAMZA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA/action/storage_attestation","attest_author":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA/action/author_attestation","sign_citation":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA/action/citation_signature","submit_replication":"https://pith.science/pith/YPSI7QSMDI4NDPPNJAT6QRAMZA/action/replication_record"}},"created_at":"2026-07-05T09:12:31.514760+00:00","updated_at":"2026-07-05T09:12:31.514760+00:00"}