{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:CXNHYI75BJVTVT3H33E2MCPWCD","short_pith_number":"pith:CXNHYI75","schema_version":"1.0","canonical_sha256":"15da7c23fd0a6b3acf67dec9a609f610e0bf02336a9056b3b119e479a6d6340b","source":{"kind":"arxiv","id":"2312.16132","version":2},"attestation_state":"computed","paper":{"title":"RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Deyi Xiong, Quan Tu, Sun Li, Tianhao Shen","submitted_at":"2023-12-26T17:40:55Z","abstract_excerpt":"The rapid evolution of large language models necessitates effective benchmarks for evaluating their role knowledge, which is essential for establishing connections with the real world and providing more immersive interactions. This paper introduces RoleEval, a bilingual benchmark designed to assess the memorization, utilization, and reasoning capabilities of role knowledge. RoleEval comprises RoleEval-Global (including internationally recognized characters) and RoleEval-Chinese (including characters popular in China), with 6,000 Chinese-English parallel multiple-choice questions focusing on 30"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.16132","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2023-12-26T17:40:55Z","cross_cats_sorted":[],"title_canon_sha256":"28c7d3e6ca41d96022c26579a43fdf72833105c03870dab00b75ccf11f9c1b62","abstract_canon_sha256":"ead90c504052884c7b310669a786987b7c6e4c33f818c09470ea1c3950eb259f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:45:51.497492Z","signature_b64":"51nX0blai1ZO5y4Lu+bvVo5BVcBjDePoXDb4+Zws8QoINGmibGUaj7+bRm7WAcHCUJ6NbtdMDcYoZVJUX05/BQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"15da7c23fd0a6b3acf67dec9a609f610e0bf02336a9056b3b119e479a6d6340b","last_reissued_at":"2026-07-05T07:45:51.497075Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:45:51.497075Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Deyi Xiong, Quan Tu, Sun Li, Tianhao Shen","submitted_at":"2023-12-26T17:40:55Z","abstract_excerpt":"The rapid evolution of large language models necessitates effective benchmarks for evaluating their role knowledge, which is essential for establishing connections with the real world and providing more immersive interactions. This paper introduces RoleEval, a bilingual benchmark designed to assess the memorization, utilization, and reasoning capabilities of role knowledge. RoleEval comprises RoleEval-Global (including internationally recognized characters) and RoleEval-Chinese (including characters popular in China), with 6,000 Chinese-English parallel multiple-choice questions focusing on 30"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.16132","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.16132/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.16132","created_at":"2026-07-05T07:45:51.497132+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.16132v2","created_at":"2026-07-05T07:45:51.497132+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.16132","created_at":"2026-07-05T07:45:51.497132+00:00"},{"alias_kind":"pith_short_12","alias_value":"CXNHYI75BJVT","created_at":"2026-07-05T07:45:51.497132+00:00"},{"alias_kind":"pith_short_16","alias_value":"CXNHYI75BJVTVT3H","created_at":"2026-07-05T07:45:51.497132+00:00"},{"alias_kind":"pith_short_8","alias_value":"CXNHYI75","created_at":"2026-07-05T07:45:51.497132+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.05553","citing_title":"ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01552","citing_title":"RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14368","citing_title":"Beyond Math: Stories as a Testbed for Memorization-Constrained Reasoning in LLMs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17044","citing_title":"PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14169","citing_title":"BOOKMARKS: Efficient Active Storyline Memory for Role-playing","ref_index":114,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13804","citing_title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD","json":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD.json","graph_json":"https://pith.science/api/pith-number/CXNHYI75BJVTVT3H33E2MCPWCD/graph.json","events_json":"https://pith.science/api/pith-number/CXNHYI75BJVTVT3H33E2MCPWCD/events.json","paper":"https://pith.science/paper/CXNHYI75"},"agent_actions":{"view_html":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD","download_json":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD.json","view_paper":"https://pith.science/paper/CXNHYI75","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.16132&json=true","fetch_graph":"https://pith.science/api/pith-number/CXNHYI75BJVTVT3H33E2MCPWCD/graph.json","fetch_events":"https://pith.science/api/pith-number/CXNHYI75BJVTVT3H33E2MCPWCD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD/action/storage_attestation","attest_author":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD/action/author_attestation","sign_citation":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD/action/citation_signature","submit_replication":"https://pith.science/pith/CXNHYI75BJVTVT3H33E2MCPWCD/action/replication_record"}},"created_at":"2026-07-05T07:45:51.497132+00:00","updated_at":"2026-07-05T07:45:51.497132+00:00"}