{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:XAF4P3CDJO6Q55QP2JP43VPWSX","short_pith_number":"pith:XAF4P3CD","schema_version":"1.0","canonical_sha256":"b80bc7ec434bbd0ef60fd25fcdd5f695c09b8e051dd379655b0728e1faa08b41","source":{"kind":"arxiv","id":"2410.18785","version":1},"attestation_state":"computed","paper":{"title":"Should We Really Edit Language Models? On the Evaluation of Edited Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Peijie Dong, Qi Li, Xiang Liu, Xiaowen Chu, Xinglin Pan, Zeyu Li, Zhenheng Tang","submitted_at":"2024-10-24T14:36:48Z","abstract_excerpt":"Model editing has become an increasingly popular alternative for efficiently updating knowledge within language models. Current methods mainly focus on reliability, generalization, and locality, with many methods excelling across these criteria. Some recent works disclose the pitfalls of these editing methods such as knowledge distortion or conflict. However, the general abilities of post-edited language models remain unexplored. In this paper, we perform a comprehensive evaluation on various editing methods and different language models, and have following findings. (1) Existing editing metho"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.18785","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-10-24T14:36:48Z","cross_cats_sorted":[],"title_canon_sha256":"884e2e5fc178fe9cd397b052846860fc1cf92c95c71fef4ee9e75e05ec93d32a","abstract_canon_sha256":"5b1f8e1dd11099875691a58f3a2b68e22a23c55760d23c2912eb960b673a458c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:25:13.648580Z","signature_b64":"AvNdP7vna7hh9OPljkJ8oNLpV4D1/gYxi1PyOMcu918gJy+o755Ua5VYHuBgtrXJScTORZsOuYDen5uCt8m3Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b80bc7ec434bbd0ef60fd25fcdd5f695c09b8e051dd379655b0728e1faa08b41","last_reissued_at":"2026-07-05T09:25:13.648095Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:25:13.648095Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Should We Really Edit Language Models? On the Evaluation of Edited Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Peijie Dong, Qi Li, Xiang Liu, Xiaowen Chu, Xinglin Pan, Zeyu Li, Zhenheng Tang","submitted_at":"2024-10-24T14:36:48Z","abstract_excerpt":"Model editing has become an increasingly popular alternative for efficiently updating knowledge within language models. Current methods mainly focus on reliability, generalization, and locality, with many methods excelling across these criteria. Some recent works disclose the pitfalls of these editing methods such as knowledge distortion or conflict. However, the general abilities of post-edited language models remain unexplored. In this paper, we perform a comprehensive evaluation on various editing methods and different language models, and have following findings. (1) Existing editing metho"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.18785","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.18785/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.18785","created_at":"2026-07-05T09:25:13.648151+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.18785v1","created_at":"2026-07-05T09:25:13.648151+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.18785","created_at":"2026-07-05T09:25:13.648151+00:00"},{"alias_kind":"pith_short_12","alias_value":"XAF4P3CDJO6Q","created_at":"2026-07-05T09:25:13.648151+00:00"},{"alias_kind":"pith_short_16","alias_value":"XAF4P3CDJO6Q55QP","created_at":"2026-07-05T09:25:13.648151+00:00"},{"alias_kind":"pith_short_8","alias_value":"XAF4P3CD","created_at":"2026-07-05T09:25:13.648151+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2502.01941","citing_title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","ref_index":78,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX","json":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX.json","graph_json":"https://pith.science/api/pith-number/XAF4P3CDJO6Q55QP2JP43VPWSX/graph.json","events_json":"https://pith.science/api/pith-number/XAF4P3CDJO6Q55QP2JP43VPWSX/events.json","paper":"https://pith.science/paper/XAF4P3CD"},"agent_actions":{"view_html":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX","download_json":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX.json","view_paper":"https://pith.science/paper/XAF4P3CD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.18785&json=true","fetch_graph":"https://pith.science/api/pith-number/XAF4P3CDJO6Q55QP2JP43VPWSX/graph.json","fetch_events":"https://pith.science/api/pith-number/XAF4P3CDJO6Q55QP2JP43VPWSX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX/action/storage_attestation","attest_author":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX/action/author_attestation","sign_citation":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX/action/citation_signature","submit_replication":"https://pith.science/pith/XAF4P3CDJO6Q55QP2JP43VPWSX/action/replication_record"}},"created_at":"2026-07-05T09:25:13.648151+00:00","updated_at":"2026-07-05T09:25:13.648151+00:00"}