{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:PF2CNVKOGSA5DCXV7WT6D7GQIV","short_pith_number":"pith:PF2CNVKO","schema_version":"1.0","canonical_sha256":"797426d54e3481d18af5fda7e1fcd0456167539b90d2c8e11d34f6ab7efdb96e","source":{"kind":"arxiv","id":"2104.08305","version":1},"attestation_state":"computed","paper":{"title":"Membership Inference Attack Susceptibility of Clinical Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Abhyuday Jagannatha, Bhanu Pratap Singh Rawat, Hong Yu","submitted_at":"2021-04-16T18:29:58Z","abstract_excerpt":"Deep Neural Network (DNN) models have been shown to have high empirical privacy leakages. Clinical language models (CLMs) trained on clinical data have been used to improve performance in biomedical natural language processing tasks. In this work, we investigate the risks of training-data leakage through white-box or black-box access to CLMs. We design and employ membership inference attacks to estimate the empirical privacy leaks for model architectures like BERT and GPT2. We show that membership inference attacks on CLMs lead to non-trivial privacy leakages of up to 7%. Our results show that"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2104.08305","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2021-04-16T18:29:58Z","cross_cats_sorted":[],"title_canon_sha256":"f4d206889108445ded4696583088a92bd53f40f32f67f0009983c65d3af202f0","abstract_canon_sha256":"d99295d5629a4ae0e77fe57ee67623c74b128a5850bed4da869531676508a161"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:32:50.560641Z","signature_b64":"G/EI+5e6T6H/JUz+Exfrx3i+3m/Y8YQWQeyfqxr8Fur0fz6TxdDK/vN+lVMDLw8TVCBo8tKpCqcDcStzWETWCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"797426d54e3481d18af5fda7e1fcd0456167539b90d2c8e11d34f6ab7efdb96e","last_reissued_at":"2026-07-05T02:32:50.560153Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:32:50.560153Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Membership Inference Attack Susceptibility of Clinical Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Abhyuday Jagannatha, Bhanu Pratap Singh Rawat, Hong Yu","submitted_at":"2021-04-16T18:29:58Z","abstract_excerpt":"Deep Neural Network (DNN) models have been shown to have high empirical privacy leakages. Clinical language models (CLMs) trained on clinical data have been used to improve performance in biomedical natural language processing tasks. In this work, we investigate the risks of training-data leakage through white-box or black-box access to CLMs. We design and employ membership inference attacks to estimate the empirical privacy leaks for model architectures like BERT and GPT2. We show that membership inference attacks on CLMs lead to non-trivial privacy leakages of up to 7%. Our results show that"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2104.08305","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2104.08305/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2104.08305","created_at":"2026-07-05T02:32:50.560214+00:00"},{"alias_kind":"arxiv_version","alias_value":"2104.08305v1","created_at":"2026-07-05T02:32:50.560214+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2104.08305","created_at":"2026-07-05T02:32:50.560214+00:00"},{"alias_kind":"pith_short_12","alias_value":"PF2CNVKOGSA5","created_at":"2026-07-05T02:32:50.560214+00:00"},{"alias_kind":"pith_short_16","alias_value":"PF2CNVKOGSA5DCXV","created_at":"2026-07-05T02:32:50.560214+00:00"},{"alias_kind":"pith_short_8","alias_value":"PF2CNVKO","created_at":"2026-07-05T02:32:50.560214+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07996","citing_title":"MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2501.02407","citing_title":"Towards the Anonymization of the Language Modeling","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2507.06056","citing_title":"Data Compressibility Quantifies LLM Memorization","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2310.16789","citing_title":"Detecting Pretraining Data from Large Language Models","ref_index":100,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV","json":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV.json","graph_json":"https://pith.science/api/pith-number/PF2CNVKOGSA5DCXV7WT6D7GQIV/graph.json","events_json":"https://pith.science/api/pith-number/PF2CNVKOGSA5DCXV7WT6D7GQIV/events.json","paper":"https://pith.science/paper/PF2CNVKO"},"agent_actions":{"view_html":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV","download_json":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV.json","view_paper":"https://pith.science/paper/PF2CNVKO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2104.08305&json=true","fetch_graph":"https://pith.science/api/pith-number/PF2CNVKOGSA5DCXV7WT6D7GQIV/graph.json","fetch_events":"https://pith.science/api/pith-number/PF2CNVKOGSA5DCXV7WT6D7GQIV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV/action/storage_attestation","attest_author":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV/action/author_attestation","sign_citation":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV/action/citation_signature","submit_replication":"https://pith.science/pith/PF2CNVKOGSA5DCXV7WT6D7GQIV/action/replication_record"}},"created_at":"2026-07-05T02:32:50.560214+00:00","updated_at":"2026-07-05T02:32:50.560214+00:00"}