{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CV6WMJVMA7ONVKG2BSHQB46QJ2","short_pith_number":"pith:CV6WMJVM","schema_version":"1.0","canonical_sha256":"157d6626ac07dcdaa8da0c8f00f3d04ea2385e7320766765aa4476a02c950fd8","source":{"kind":"arxiv","id":"2506.00637","version":2},"attestation_state":"computed","paper":{"title":"Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution's Characteristics","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Jackie Chi Kit Cheung, Lorenzo Jaime Yu Flores, Ori Ernst","submitted_at":"2025-05-31T17:01:45Z","abstract_excerpt":"Well-calibrated model confidence scores can improve the usefulness of text generation models. For example, users can be prompted to review predictions with low confidence scores, to prevent models from returning bad or potentially dangerous predictions. However, confidence metrics are not always well calibrated in text generation. One reason is that in generation, there can be many valid answers, which previous methods do not always account for. Hence, a confident model could distribute its output probability among multiple sequences because they are all valid. We propose task-agnostic confide"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.00637","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-05-31T17:01:45Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"69262247865d3f189fe8ece01ee502cef3ae9a89d07fc1c488b35dfd853c6e71","abstract_canon_sha256":"1945e3da00d35203460c9b8ce6a2a1c78b75ef9c293965af9de8f91ac4bc133b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:54.672792Z","signature_b64":"QseE5ob2hbmJP35a6t1VBxJUwrA2nw5T02kgchELjnbFL/CbKt+c31BSdCA4sjIUTV0zvKjqGu8ulmRA3zLsBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"157d6626ac07dcdaa8da0c8f00f3d04ea2385e7320766765aa4476a02c950fd8","last_reissued_at":"2026-07-05T11:20:54.672307Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:54.672307Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution's Characteristics","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Jackie Chi Kit Cheung, Lorenzo Jaime Yu Flores, Ori Ernst","submitted_at":"2025-05-31T17:01:45Z","abstract_excerpt":"Well-calibrated model confidence scores can improve the usefulness of text generation models. For example, users can be prompted to review predictions with low confidence scores, to prevent models from returning bad or potentially dangerous predictions. However, confidence metrics are not always well calibrated in text generation. One reason is that in generation, there can be many valid answers, which previous methods do not always account for. Hence, a confident model could distribute its output probability among multiple sequences because they are all valid. We propose task-agnostic confide"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.00637","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.00637/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.00637","created_at":"2026-07-05T11:20:54.672371+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.00637v2","created_at":"2026-07-05T11:20:54.672371+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.00637","created_at":"2026-07-05T11:20:54.672371+00:00"},{"alias_kind":"pith_short_12","alias_value":"CV6WMJVMA7ON","created_at":"2026-07-05T11:20:54.672371+00:00"},{"alias_kind":"pith_short_16","alias_value":"CV6WMJVMA7ONVKG2","created_at":"2026-07-05T11:20:54.672371+00:00"},{"alias_kind":"pith_short_8","alias_value":"CV6WMJVM","created_at":"2026-07-05T11:20:54.672371+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2","json":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2.json","graph_json":"https://pith.science/api/pith-number/CV6WMJVMA7ONVKG2BSHQB46QJ2/graph.json","events_json":"https://pith.science/api/pith-number/CV6WMJVMA7ONVKG2BSHQB46QJ2/events.json","paper":"https://pith.science/paper/CV6WMJVM"},"agent_actions":{"view_html":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2","download_json":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2.json","view_paper":"https://pith.science/paper/CV6WMJVM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.00637&json=true","fetch_graph":"https://pith.science/api/pith-number/CV6WMJVMA7ONVKG2BSHQB46QJ2/graph.json","fetch_events":"https://pith.science/api/pith-number/CV6WMJVMA7ONVKG2BSHQB46QJ2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2/action/storage_attestation","attest_author":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2/action/author_attestation","sign_citation":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2/action/citation_signature","submit_replication":"https://pith.science/pith/CV6WMJVMA7ONVKG2BSHQB46QJ2/action/replication_record"}},"created_at":"2026-07-05T11:20:54.672371+00:00","updated_at":"2026-07-05T11:20:54.672371+00:00"}