{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:HKTIP25PPOCK7HP3UGINHHJ6TQ","short_pith_number":"pith:HKTIP25P","schema_version":"1.0","canonical_sha256":"3aa687ebaf7b84af9dfba190d39d3e9c16ab7e49b48a143e1979a79e100e7a14","source":{"kind":"arxiv","id":"2210.07197","version":1},"attestation_state":"computed","paper":{"title":"Towards a Unified Multi-Dimensional Evaluator for Text Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chenguang Zhu, Da Yin, Heng Ji, Jiawei Han, Ming Zhong, Pengfei Liu, Yang Liu, Yizhu Jiao, Yuning Mao","submitted_at":"2022-10-13T17:17:03Z","abstract_excerpt":"Multi-dimensional evaluation is the dominant paradigm for human evaluation in Natural Language Generation (NLG), i.e., evaluating the generated text from multiple explainable dimensions, such as coherence and fluency. However, automatic evaluation in NLG is still dominated by similarity-based metrics, and we lack a reliable framework for a more comprehensive evaluation of advanced models. In this paper, we propose a unified multi-dimensional evaluator UniEval for NLG. We re-frame NLG evaluation as a Boolean Question Answering (QA) task, and by guiding the model with different questions, we can"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2210.07197","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2022-10-13T17:17:03Z","cross_cats_sorted":[],"title_canon_sha256":"5d6dffc4648fe568fa1cc0c96062e507b3144fc67315e9e47f0a2cd03b78ebf7","abstract_canon_sha256":"262004ee0f141d84232b19fb4210e5578b6a2547861eedc989930d37e0befc47"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:06:25.551291Z","signature_b64":"1DRt7qUr8uZXHFl72i+hEKfePE1paNkWNNrJNWjVx4ELMgbxm2vfDxpWt1Tlin3MRl64bCcPjMexuJ1tEfc4Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3aa687ebaf7b84af9dfba190d39d3e9c16ab7e49b48a143e1979a79e100e7a14","last_reissued_at":"2026-07-05T05:06:25.550830Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:06:25.550830Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Towards a Unified Multi-Dimensional Evaluator for Text Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chenguang Zhu, Da Yin, Heng Ji, Jiawei Han, Ming Zhong, Pengfei Liu, Yang Liu, Yizhu Jiao, Yuning Mao","submitted_at":"2022-10-13T17:17:03Z","abstract_excerpt":"Multi-dimensional evaluation is the dominant paradigm for human evaluation in Natural Language Generation (NLG), i.e., evaluating the generated text from multiple explainable dimensions, such as coherence and fluency. However, automatic evaluation in NLG is still dominated by similarity-based metrics, and we lack a reliable framework for a more comprehensive evaluation of advanced models. In this paper, we propose a unified multi-dimensional evaluator UniEval for NLG. We re-frame NLG evaluation as a Boolean Question Answering (QA) task, and by guiding the model with different questions, we can"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2210.07197","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2210.07197/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2210.07197","created_at":"2026-07-05T05:06:25.550888+00:00"},{"alias_kind":"arxiv_version","alias_value":"2210.07197v1","created_at":"2026-07-05T05:06:25.550888+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2210.07197","created_at":"2026-07-05T05:06:25.550888+00:00"},{"alias_kind":"pith_short_12","alias_value":"HKTIP25PPOCK","created_at":"2026-07-05T05:06:25.550888+00:00"},{"alias_kind":"pith_short_16","alias_value":"HKTIP25PPOCK7HP3","created_at":"2026-07-05T05:06:25.550888+00:00"},{"alias_kind":"pith_short_8","alias_value":"HKTIP25P","created_at":"2026-07-05T05:06:25.550888+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25476","citing_title":"A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27446","citing_title":"Causal Connections: Leveraging Multilingual Fine-Tuning for Financial QA@FinCausal 2026","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27316","citing_title":"LLM-Based Examination of Eligibility Criteria from Securities Prospectuses at the German Central Bank","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2406.04244","citing_title":"Benchmark Data Contamination of Large Language Models: A Survey","ref_index":186,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19316","citing_title":"A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2506.04565","citing_title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","ref_index":230,"is_internal_anchor":false},{"citing_arxiv_id":"2509.11206","citing_title":"Evalet: Evaluating Large Language Models through Functional Fragmentation","ref_index":101,"is_internal_anchor":false},{"citing_arxiv_id":"2401.15391","citing_title":"MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2308.07201","citing_title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2303.16634","citing_title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17200","citing_title":"Calibrating Model-Based Evaluation Metrics for Summarization","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20131","citing_title":"Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives","ref_index":159,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04641","citing_title":"CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering","ref_index":82,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ","json":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ.json","graph_json":"https://pith.science/api/pith-number/HKTIP25PPOCK7HP3UGINHHJ6TQ/graph.json","events_json":"https://pith.science/api/pith-number/HKTIP25PPOCK7HP3UGINHHJ6TQ/events.json","paper":"https://pith.science/paper/HKTIP25P"},"agent_actions":{"view_html":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ","download_json":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ.json","view_paper":"https://pith.science/paper/HKTIP25P","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2210.07197&json=true","fetch_graph":"https://pith.science/api/pith-number/HKTIP25PPOCK7HP3UGINHHJ6TQ/graph.json","fetch_events":"https://pith.science/api/pith-number/HKTIP25PPOCK7HP3UGINHHJ6TQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ/action/storage_attestation","attest_author":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ/action/author_attestation","sign_citation":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ/action/citation_signature","submit_replication":"https://pith.science/pith/HKTIP25PPOCK7HP3UGINHHJ6TQ/action/replication_record"}},"created_at":"2026-07-05T05:06:25.550888+00:00","updated_at":"2026-07-05T05:06:25.550888+00:00"}