{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:ODIAEHLK5OBMEKPYF36GFPJBG2","short_pith_number":"pith:ODIAEHLK","schema_version":"1.0","canonical_sha256":"70d0021d6aeb82c229f82efc62bd213696a44e843c2d97dd0abbdf0cbb3dbe44","source":{"kind":"arxiv","id":"2309.17410","version":1},"attestation_state":"computed","paper":{"title":"Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Mohit Bansal, Peter Hase, Vaidehi Patil","submitted_at":"2023-09-29T17:12:43Z","abstract_excerpt":"Pretrained language models sometimes possess knowledge that we do not wish them to, including memorized personal information and knowledge that could be used to harm people. They can also output toxic or harmful text. To mitigate these safety and informational issues, we propose an attack-and-defense framework for studying the task of deleting sensitive information directly from model weights. We study direct edits to model weights because (1) this approach should guarantee that particular deleted information is never extracted by future prompt attacks, and (2) it should protect against whiteb"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2309.17410","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-29T17:12:43Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"831951f97d6b121a93742af8c7873ad26ccdd7ca00bd138bd9306139f7f51aa3","abstract_canon_sha256":"3386420d27f6649c0a4d5fcf531562665091e38db0934ed5b79dcd2ff7758002"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:55:44.861205Z","signature_b64":"x5IN961/NHamryfFymlqQM6gRUXpderQY4nghitgELuDXMk+OQHj+CSAJOdGX7PrSD3hP23SPWjSwG+TuSsOAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"70d0021d6aeb82c229f82efc62bd213696a44e843c2d97dd0abbdf0cbb3dbe44","last_reissued_at":"2026-07-05T06:55:44.860772Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:55:44.860772Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Mohit Bansal, Peter Hase, Vaidehi Patil","submitted_at":"2023-09-29T17:12:43Z","abstract_excerpt":"Pretrained language models sometimes possess knowledge that we do not wish them to, including memorized personal information and knowledge that could be used to harm people. They can also output toxic or harmful text. To mitigate these safety and informational issues, we propose an attack-and-defense framework for studying the task of deleting sensitive information directly from model weights. We study direct edits to model weights because (1) this approach should guarantee that particular deleted information is never extracted by future prompt attacks, and (2) it should protect against whiteb"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.17410","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2309.17410/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2309.17410","created_at":"2026-07-05T06:55:44.860827+00:00"},{"alias_kind":"arxiv_version","alias_value":"2309.17410v1","created_at":"2026-07-05T06:55:44.860827+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.17410","created_at":"2026-07-05T06:55:44.860827+00:00"},{"alias_kind":"pith_short_12","alias_value":"ODIAEHLK5OBM","created_at":"2026-07-05T06:55:44.860827+00:00"},{"alias_kind":"pith_short_16","alias_value":"ODIAEHLK5OBMEKPY","created_at":"2026-07-05T06:55:44.860827+00:00"},{"alias_kind":"pith_short_8","alias_value":"ODIAEHLK","created_at":"2026-07-05T06:55:44.860827+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2409.18169","citing_title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","ref_index":114,"is_internal_anchor":false},{"citing_arxiv_id":"2404.05868","citing_title":"Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2310.12508","citing_title":"SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2401.06121","citing_title":"TOFU: A Task of Fictitious Unlearning for LLMs","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09530","citing_title":"MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09530","citing_title":"MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09530","citing_title":"MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00364","citing_title":"Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2","json":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2.json","graph_json":"https://pith.science/api/pith-number/ODIAEHLK5OBMEKPYF36GFPJBG2/graph.json","events_json":"https://pith.science/api/pith-number/ODIAEHLK5OBMEKPYF36GFPJBG2/events.json","paper":"https://pith.science/paper/ODIAEHLK"},"agent_actions":{"view_html":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2","download_json":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2.json","view_paper":"https://pith.science/paper/ODIAEHLK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2309.17410&json=true","fetch_graph":"https://pith.science/api/pith-number/ODIAEHLK5OBMEKPYF36GFPJBG2/graph.json","fetch_events":"https://pith.science/api/pith-number/ODIAEHLK5OBMEKPYF36GFPJBG2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2/action/storage_attestation","attest_author":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2/action/author_attestation","sign_citation":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2/action/citation_signature","submit_replication":"https://pith.science/pith/ODIAEHLK5OBMEKPYF36GFPJBG2/action/replication_record"}},"created_at":"2026-07-05T06:55:44.860827+00:00","updated_at":"2026-07-05T06:55:44.860827+00:00"}