{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:BJGSCNZKVEZ5Q7PBPN7NPKIMYM","short_pith_number":"pith:BJGSCNZK","schema_version":"1.0","canonical_sha256":"0a4d21372aa933d87de17b7ed7a90cc331b4481251cba0a4cf555bb287922431","source":{"kind":"arxiv","id":"2603.08091","version":2},"attestation_state":"computed","paper":{"title":"Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bing Xu, Conghui Zhu, Hongli Zhou, Hui Huang, Kehai Chen, Muyun Yang, Rui Zhang, Tiejun Zhao","submitted_at":"2026-03-09T08:32:21Z","abstract_excerpt":"Large language model (LLM)-based judges are widely adopted for automated evaluation and reward modeling, yet their judgments are often affected by judgment biases. Accurately evaluating these biases is essential for ensuring the reliability of LLM-based judges. However, existing studies typically investigate limited biases under a single judge formulation, either generative or discriminative, lacking a comprehensive evaluation. To bridge this gap, we propose JudgeBiasBench, a benchmark for systematically quantifying biases in LLM-based judges. JudgeBiasBench defines a taxonomy of judgment bias"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2603.08091","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2026-03-09T08:32:21Z","cross_cats_sorted":[],"title_canon_sha256":"c105f1246d98b7d89256da2778ece2114553be3896c023e2868ad40b77648b6d","abstract_canon_sha256":"0a7ed39fc6773f14d6d1afcfc4040a6ee094072d6259530d12324fcb03d0e9e9"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-04T01:52:32.721709Z","signature_b64":"ztH+32TMqKIRB4Fgby5Ax8sY7MiXp5QGGDJ24l0HjDnYR7Xo8YNwOjWUiqHe+/3gffGFs4C00+Whan47NbqVDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0a4d21372aa933d87de17b7ed7a90cc331b4481251cba0a4cf555bb287922431","last_reissued_at":"2026-08-04T01:52:32.720092Z","signature_status":"signed_v1","first_computed_at":"2026-08-04T01:52:32.720092Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bing Xu, Conghui Zhu, Hongli Zhou, Hui Huang, Kehai Chen, Muyun Yang, Rui Zhang, Tiejun Zhao","submitted_at":"2026-03-09T08:32:21Z","abstract_excerpt":"Large language model (LLM)-based judges are widely adopted for automated evaluation and reward modeling, yet their judgments are often affected by judgment biases. Accurately evaluating these biases is essential for ensuring the reliability of LLM-based judges. However, existing studies typically investigate limited biases under a single judge formulation, either generative or discriminative, lacking a comprehensive evaluation. To bridge this gap, we propose JudgeBiasBench, a benchmark for systematically quantifying biases in LLM-based judges. JudgeBiasBench defines a taxonomy of judgment bias"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2603.08091","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2603.08091/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2603.08091","created_at":"2026-08-04T01:52:32.721361+00:00"},{"alias_kind":"arxiv_version","alias_value":"2603.08091v2","created_at":"2026-08-04T01:52:32.721361+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2603.08091","created_at":"2026-08-04T01:52:32.721361+00:00"},{"alias_kind":"pith_short_12","alias_value":"BJGSCNZKVEZ5","created_at":"2026-08-04T01:52:32.721361+00:00"},{"alias_kind":"pith_short_16","alias_value":"BJGSCNZKVEZ5Q7PB","created_at":"2026-08-04T01:52:32.721361+00:00"},{"alias_kind":"pith_short_8","alias_value":"BJGSCNZK","created_at":"2026-08-04T01:52:32.721361+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2606.17506","citing_title":"Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2606.04923","citing_title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM","json":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM.json","graph_json":"https://pith.science/api/pith-number/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/graph.json","events_json":"https://pith.science/api/pith-number/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/events.json","paper":"https://pith.science/paper/BJGSCNZK"},"agent_actions":{"view_html":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM","download_json":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM.json","view_paper":"https://pith.science/paper/BJGSCNZK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2603.08091&json=true","fetch_graph":"https://pith.science/api/pith-number/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/graph.json","fetch_events":"https://pith.science/api/pith-number/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/action/storage_attestation","attest_author":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/action/author_attestation","sign_citation":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/action/citation_signature","submit_replication":"https://pith.science/pith/BJGSCNZKVEZ5Q7PBPN7NPKIMYM/action/replication_record"}},"created_at":"2026-08-04T01:52:32.721361+00:00","updated_at":"2026-08-04T01:52:32.721361+00:00"}