{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:UE4YIH5YBC2G5P7NUVMJA55PWD","short_pith_number":"pith:UE4YIH5Y","schema_version":"1.0","canonical_sha256":"a139841fb808b46ebfeda5589077afb0c8af1143335ca2982902594eb799e0b2","source":{"kind":"arxiv","id":"2104.08202","version":2},"attestation_state":"computed","paper":{"title":"$Q^{2}$: Evaluating Factual Consistency in Knowledge-Grounded Dialogues via Question Generation and Question Answering","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Ella Neeman, Idan Szpektor, Leshem Choshen, Omri Abend, Or Honovich, Roee Aharoni","submitted_at":"2021-04-16T16:21:16Z","abstract_excerpt":"Neural knowledge-grounded generative models for dialogue often produce content that is factually inconsistent with the knowledge they rely on, making them unreliable and limiting their applicability. Inspired by recent work on evaluating factual consistency in abstractive summarization, we propose an automatic evaluation metric for factual consistency in knowledge-grounded dialogue using automatic question generation and question answering. Our metric, denoted $Q^2$, compares answer spans using natural language inference (NLI), instead of token-based matching as done in previous work. To foste"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2104.08202","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"cs.CL","submitted_at":"2021-04-16T16:21:16Z","cross_cats_sorted":[],"title_canon_sha256":"8310654bfd0fa09f2926d91ee453e6f0fd574458b042c99cc953d54886e305fe","abstract_canon_sha256":"43a6f013ceea743fdea5419af12071a93da68bbcb122eb473f87154e6f1749d2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:12:48.262049Z","signature_b64":"eHp5YZBHs5bsiyZ5s3939EbtFRLx6m/GDVD5Qu9t4WBrryjfc2cl9teifokeazUqwFBko4RbcSTbg4DVIRA4DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a139841fb808b46ebfeda5589077afb0c8af1143335ca2982902594eb799e0b2","last_reissued_at":"2026-07-05T03:12:48.261583Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:12:48.261583Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"$Q^{2}$: Evaluating Factual Consistency in Knowledge-Grounded Dialogues via Question Generation and Question Answering","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Ella Neeman, Idan Szpektor, Leshem Choshen, Omri Abend, Or Honovich, Roee Aharoni","submitted_at":"2021-04-16T16:21:16Z","abstract_excerpt":"Neural knowledge-grounded generative models for dialogue often produce content that is factually inconsistent with the knowledge they rely on, making them unreliable and limiting their applicability. Inspired by recent work on evaluating factual consistency in abstractive summarization, we propose an automatic evaluation metric for factual consistency in knowledge-grounded dialogue using automatic question generation and question answering. Our metric, denoted $Q^2$, compares answer spans using natural language inference (NLI), instead of token-based matching as done in previous work. To foste"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2104.08202","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2104.08202/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2104.08202","created_at":"2026-07-05T03:12:48.261644+00:00"},{"alias_kind":"arxiv_version","alias_value":"2104.08202v2","created_at":"2026-07-05T03:12:48.261644+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2104.08202","created_at":"2026-07-05T03:12:48.261644+00:00"},{"alias_kind":"pith_short_12","alias_value":"UE4YIH5YBC2G","created_at":"2026-07-05T03:12:48.261644+00:00"},{"alias_kind":"pith_short_16","alias_value":"UE4YIH5YBC2G5P7N","created_at":"2026-07-05T03:12:48.261644+00:00"},{"alias_kind":"pith_short_8","alias_value":"UE4YIH5Y","created_at":"2026-07-05T03:12:48.261644+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27291","citing_title":"Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2308.05374","citing_title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2201.08239","citing_title":"LaMDA: Language Models for Dialog Applications","ref_index":89,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD","json":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD.json","graph_json":"https://pith.science/api/pith-number/UE4YIH5YBC2G5P7NUVMJA55PWD/graph.json","events_json":"https://pith.science/api/pith-number/UE4YIH5YBC2G5P7NUVMJA55PWD/events.json","paper":"https://pith.science/paper/UE4YIH5Y"},"agent_actions":{"view_html":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD","download_json":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD.json","view_paper":"https://pith.science/paper/UE4YIH5Y","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2104.08202&json=true","fetch_graph":"https://pith.science/api/pith-number/UE4YIH5YBC2G5P7NUVMJA55PWD/graph.json","fetch_events":"https://pith.science/api/pith-number/UE4YIH5YBC2G5P7NUVMJA55PWD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD/action/storage_attestation","attest_author":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD/action/author_attestation","sign_citation":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD/action/citation_signature","submit_replication":"https://pith.science/pith/UE4YIH5YBC2G5P7NUVMJA55PWD/action/replication_record"}},"created_at":"2026-07-05T03:12:48.261644+00:00","updated_at":"2026-07-05T03:12:48.261644+00:00"}