{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:MQFPBYMR4BP6YLBB6EE2ICCRVW","short_pith_number":"pith:MQFPBYMR","schema_version":"1.0","canonical_sha256":"640af0e191e05fec2c21f109a40851ad8705d60223cefec069dffaa80dac28d3","source":{"kind":"arxiv","id":"2307.06908","version":2},"attestation_state":"computed","paper":{"title":"Generating Benchmarks for Factuality Evaluation of Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Amnon Shashua, Dor Muhlgay, Inbal Magar, Kevin Leyton-Brown, Nir Ratner, Omri Abend, Ori Ram, Yoav Levine, Yoav Shoham, Yonatan Belinkov","submitted_at":"2023-07-13T17:14:38Z","abstract_excerpt":"Before deploying a language model (LM) within a given domain, it is important to measure its tendency to generate factually incorrect information in that domain. Existing methods for factuality evaluation of LLM generation focus on facts sampled from the LM itself, and thus do not control the set of evaluated facts and might under-represent domain specific or rare facts. We propose FACTOR: Factual Assessment via Corpus TransfORmation, a scalable approach for evaluating LM factuality. FACTOR automatically transforms a factual corpus of interest into a benchmark evaluating an LM's propensity to "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2307.06908","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-07-13T17:14:38Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"30bc199102133cd53a3cd6f808ddcb4343e0d99003356f58647aabc3448a1ff5","abstract_canon_sha256":"0bbc239d63bcb083b1347defd5409c616ad650390c4e670217f3a6b4bba31d14"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:40:55.065191Z","signature_b64":"j/a/5jlcqnJcWY+qmLZxyHWApXOlpMuDiqYlTGuGQY1xoGnpaMMXz4Zh5VFTOpp8bbtF5y5+D35lIefqO6aLAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"640af0e191e05fec2c21f109a40851ad8705d60223cefec069dffaa80dac28d3","last_reissued_at":"2026-07-05T07:40:55.064707Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:40:55.064707Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Generating Benchmarks for Factuality Evaluation of Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Amnon Shashua, Dor Muhlgay, Inbal Magar, Kevin Leyton-Brown, Nir Ratner, Omri Abend, Ori Ram, Yoav Levine, Yoav Shoham, Yonatan Belinkov","submitted_at":"2023-07-13T17:14:38Z","abstract_excerpt":"Before deploying a language model (LM) within a given domain, it is important to measure its tendency to generate factually incorrect information in that domain. Existing methods for factuality evaluation of LLM generation focus on facts sampled from the LM itself, and thus do not control the set of evaluated facts and might under-represent domain specific or rare facts. We propose FACTOR: Factual Assessment via Corpus TransfORmation, a scalable approach for evaluating LM factuality. FACTOR automatically transforms a factual corpus of interest into a benchmark evaluating an LM's propensity to "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2307.06908","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2307.06908/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2307.06908","created_at":"2026-07-05T07:40:55.064781+00:00"},{"alias_kind":"arxiv_version","alias_value":"2307.06908v2","created_at":"2026-07-05T07:40:55.064781+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2307.06908","created_at":"2026-07-05T07:40:55.064781+00:00"},{"alias_kind":"pith_short_12","alias_value":"MQFPBYMR4BP6","created_at":"2026-07-05T07:40:55.064781+00:00"},{"alias_kind":"pith_short_16","alias_value":"MQFPBYMR4BP6YLBB","created_at":"2026-07-05T07:40:55.064781+00:00"},{"alias_kind":"pith_short_8","alias_value":"MQFPBYMR","created_at":"2026-07-05T07:40:55.064781+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.00819","citing_title":"Mitigating Hallucinations in Large Language Models Via Decoder Layer Skipping","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2309.03883","citing_title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2311.05232","citing_title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","ref_index":234,"is_internal_anchor":false},{"citing_arxiv_id":"2401.15884","citing_title":"Corrective Retrieval Augmented Generation","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW","json":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW.json","graph_json":"https://pith.science/api/pith-number/MQFPBYMR4BP6YLBB6EE2ICCRVW/graph.json","events_json":"https://pith.science/api/pith-number/MQFPBYMR4BP6YLBB6EE2ICCRVW/events.json","paper":"https://pith.science/paper/MQFPBYMR"},"agent_actions":{"view_html":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW","download_json":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW.json","view_paper":"https://pith.science/paper/MQFPBYMR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2307.06908&json=true","fetch_graph":"https://pith.science/api/pith-number/MQFPBYMR4BP6YLBB6EE2ICCRVW/graph.json","fetch_events":"https://pith.science/api/pith-number/MQFPBYMR4BP6YLBB6EE2ICCRVW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW/action/storage_attestation","attest_author":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW/action/author_attestation","sign_citation":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW/action/citation_signature","submit_replication":"https://pith.science/pith/MQFPBYMR4BP6YLBB6EE2ICCRVW/action/replication_record"}},"created_at":"2026-07-05T07:40:55.064781+00:00","updated_at":"2026-07-05T07:40:55.064781+00:00"}