{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:X7LZYKZRAUM6DO4YHMR6GAZAFD","short_pith_number":"pith:X7LZYKZR","schema_version":"1.0","canonical_sha256":"bfd79c2b310519e1bb983b23e3032028ee4052e44926f557fa5c768ee10fc320","source":{"kind":"arxiv","id":"2309.01940","version":4},"attestation_state":"computed","paper":{"title":"CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Huacan Chai, Jianghao Lin, Jiayi Lei, Jingkuan Wang, Kangning Zhang, Kounianhua Du, Lingyue Fu, Longteng Fan, Renting Rui, Shuang Luo, Siyuan Qi, Weiming Zhang, Weinan Zhang, Yifan Liu, Yong Yu, Yuchen Fang","submitted_at":"2023-09-05T04:12:01Z","abstract_excerpt":"With the emergence of Large Language Models (LLMs), there has been a significant improvement in the programming capabilities of models, attracting growing attention from researchers. Evaluating the programming capabilities of LLMs is crucial as it reflects the multifaceted abilities of LLMs, and it has numerous downstream applications. In this paper, we propose CodeApex, a bilingual benchmark dataset focusing on the programming comprehension, code generation, and code correction abilities of LLMs. Programming comprehension task tests LLMs on multiple-choice exam questions covering conceptual u"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2309.01940","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-05T04:12:01Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"68b723c5f2a3e099fef2cac0a7ba515a929448b49cd56c5b4adbae8c6dc40497","abstract_canon_sha256":"baf224a4f8b2127e2a4db580917a6c69cdff7e07be142e83ed269bc84922453e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:54:32.627794Z","signature_b64":"csNfxx0c/aekVhP60IZR4A7ibhUGO26yhhvacsiWgbvINNiuxXCo98A0jYU+3bSn3KHbg6niGNReRLwKNUFGAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bfd79c2b310519e1bb983b23e3032028ee4052e44926f557fa5c768ee10fc320","last_reissued_at":"2026-07-05T07:54:32.627203Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:54:32.627203Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Huacan Chai, Jianghao Lin, Jiayi Lei, Jingkuan Wang, Kangning Zhang, Kounianhua Du, Lingyue Fu, Longteng Fan, Renting Rui, Shuang Luo, Siyuan Qi, Weiming Zhang, Weinan Zhang, Yifan Liu, Yong Yu, Yuchen Fang","submitted_at":"2023-09-05T04:12:01Z","abstract_excerpt":"With the emergence of Large Language Models (LLMs), there has been a significant improvement in the programming capabilities of models, attracting growing attention from researchers. Evaluating the programming capabilities of LLMs is crucial as it reflects the multifaceted abilities of LLMs, and it has numerous downstream applications. In this paper, we propose CodeApex, a bilingual benchmark dataset focusing on the programming comprehension, code generation, and code correction abilities of LLMs. Programming comprehension task tests LLMs on multiple-choice exam questions covering conceptual u"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.01940","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2309.01940/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2309.01940","created_at":"2026-07-05T07:54:32.627284+00:00"},{"alias_kind":"arxiv_version","alias_value":"2309.01940v4","created_at":"2026-07-05T07:54:32.627284+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.01940","created_at":"2026-07-05T07:54:32.627284+00:00"},{"alias_kind":"pith_short_12","alias_value":"X7LZYKZRAUM6","created_at":"2026-07-05T07:54:32.627284+00:00"},{"alias_kind":"pith_short_16","alias_value":"X7LZYKZRAUM6DO4Y","created_at":"2026-07-05T07:54:32.627284+00:00"},{"alias_kind":"pith_short_8","alias_value":"X7LZYKZR","created_at":"2026-07-05T07:54:32.627284+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.09515","citing_title":"When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD","json":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD.json","graph_json":"https://pith.science/api/pith-number/X7LZYKZRAUM6DO4YHMR6GAZAFD/graph.json","events_json":"https://pith.science/api/pith-number/X7LZYKZRAUM6DO4YHMR6GAZAFD/events.json","paper":"https://pith.science/paper/X7LZYKZR"},"agent_actions":{"view_html":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD","download_json":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD.json","view_paper":"https://pith.science/paper/X7LZYKZR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2309.01940&json=true","fetch_graph":"https://pith.science/api/pith-number/X7LZYKZRAUM6DO4YHMR6GAZAFD/graph.json","fetch_events":"https://pith.science/api/pith-number/X7LZYKZRAUM6DO4YHMR6GAZAFD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD/action/storage_attestation","attest_author":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD/action/author_attestation","sign_citation":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD/action/citation_signature","submit_replication":"https://pith.science/pith/X7LZYKZRAUM6DO4YHMR6GAZAFD/action/replication_record"}},"created_at":"2026-07-05T07:54:32.627284+00:00","updated_at":"2026-07-05T07:54:32.627284+00:00"}