{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:HRW3GNNV3SFLIROBQXBFIF2IOR","short_pith_number":"pith:HRW3GNNV","schema_version":"1.0","canonical_sha256":"3c6db335b5dc8ab445c185c2541748745a33dd63d2976203092bc73fb9cb9faa","source":{"kind":"arxiv","id":"2606.26422","version":1},"attestation_state":"computed","paper":{"title":"Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Kylie Anglin","submitted_at":"2026-06-24T22:24:25Z","abstract_excerpt":"Researchers increasingly use text classification--supervised models or large language models--to measure constructs from natural language, providing metrics such as recall and precision as evidence of their validity. Yet, though these metrics are point estimates subject to sampling variation, measures of uncertainty are inconsistently reported alongside them. Further, when they are reported, they are often estimated with methods that are not appropriate when relevant labelled datasets are small or performance is high. To increase and improve confidence interval reporting in the field, this pap"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2606.26422","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2026-06-24T22:24:25Z","cross_cats_sorted":[],"title_canon_sha256":"37a05658c1002337224a138ac1ec681f692793a3e8187576c85456d1a9446741","abstract_canon_sha256":"09728a3c7478062b1846078fe839209a69906de5dccd40a9a52dab327e7bfccc"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-06-26T00:15:40.481122Z","signature_b64":"RCk+W24o/oyBRxfpXL1M/w+qHXIwNnXa58c2yzeyni2cXR3e+7HJPzinlJG0s7mwPmKw+d4FEnC+zezhkGq+BA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3c6db335b5dc8ab445c185c2541748745a33dd63d2976203092bc73fb9cb9faa","last_reissued_at":"2026-06-26T00:15:40.480745Z","signature_status":"signed_v1","first_computed_at":"2026-06-26T00:15:40.480745Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Kylie Anglin","submitted_at":"2026-06-24T22:24:25Z","abstract_excerpt":"Researchers increasingly use text classification--supervised models or large language models--to measure constructs from natural language, providing metrics such as recall and precision as evidence of their validity. Yet, though these metrics are point estimates subject to sampling variation, measures of uncertainty are inconsistently reported alongside them. Further, when they are reported, they are often estimated with methods that are not appropriate when relevant labelled datasets are small or performance is high. To increase and improve confidence interval reporting in the field, this pap"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2606.26422","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2606.26422/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2606.26422","created_at":"2026-06-26T00:15:40.480802+00:00"},{"alias_kind":"arxiv_version","alias_value":"2606.26422v1","created_at":"2026-06-26T00:15:40.480802+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2606.26422","created_at":"2026-06-26T00:15:40.480802+00:00"},{"alias_kind":"pith_short_12","alias_value":"HRW3GNNV3SFL","created_at":"2026-06-26T00:15:40.480802+00:00"},{"alias_kind":"pith_short_16","alias_value":"HRW3GNNV3SFLIROB","created_at":"2026-06-26T00:15:40.480802+00:00"},{"alias_kind":"pith_short_8","alias_value":"HRW3GNNV","created_at":"2026-06-26T00:15:40.480802+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR","json":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR.json","graph_json":"https://pith.science/api/pith-number/HRW3GNNV3SFLIROBQXBFIF2IOR/graph.json","events_json":"https://pith.science/api/pith-number/HRW3GNNV3SFLIROBQXBFIF2IOR/events.json","paper":"https://pith.science/paper/HRW3GNNV"},"agent_actions":{"view_html":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR","download_json":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR.json","view_paper":"https://pith.science/paper/HRW3GNNV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2606.26422&json=true","fetch_graph":"https://pith.science/api/pith-number/HRW3GNNV3SFLIROBQXBFIF2IOR/graph.json","fetch_events":"https://pith.science/api/pith-number/HRW3GNNV3SFLIROBQXBFIF2IOR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR/action/storage_attestation","attest_author":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR/action/author_attestation","sign_citation":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR/action/citation_signature","submit_replication":"https://pith.science/pith/HRW3GNNV3SFLIROBQXBFIF2IOR/action/replication_record"}},"created_at":"2026-06-26T00:15:40.480802+00:00","updated_at":"2026-06-26T00:15:40.480802+00:00"}