{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ZHKDAZ2GCH3OZQGONC5364XHJK","short_pith_number":"pith:ZHKDAZ2G","schema_version":"1.0","canonical_sha256":"c9d430674611f6ecc0ce68bbbf72e74a83aa071edd18455e974361893f392e70","source":{"kind":"arxiv","id":"2406.06443","version":1},"attestation_state":"computed","paper":{"title":"LLM Dataset Inference: Did you train on my dataset?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CR"],"primary_cat":"cs.LG","authors_text":"Adam Dziedzic, Hengrui Jia, Nicolas Papernot, Pratyush Maini","submitted_at":"2024-06-10T16:34:43Z","abstract_excerpt":"The proliferation of large language models (LLMs) in the real world has come with a rise in copyright cases against companies for training their models on unlicensed data from the internet. Recent works have presented methods to identify if individual text sequences were members of the model's training data, known as membership inference attacks (MIAs). We demonstrate that the apparent success of these MIAs is confounded by selecting non-members (text sequences not used for training) belonging to a different distribution from the members (e.g., temporally shifted recent Wikipedia articles comp"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.06443","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-06-10T16:34:43Z","cross_cats_sorted":["cs.CL","cs.CR"],"title_canon_sha256":"b0409e3112f0d17285aaaf0737c9378aca27f714ee0f2dad29362a8d0918b48c","abstract_canon_sha256":"fa3a38d54be834c712af188a5ec0861b454a1eecaea3e763d8268d2f22b5bc4b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:29:42.339956Z","signature_b64":"9dMCEXQxZMezNE5hhWtoyGl3WXWcVLIlkAGeOt8mCeRQY7ti8cFzX7fNvABfcPBazkyFDkZEJTr2IbNE+QwhDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c9d430674611f6ecc0ce68bbbf72e74a83aa071edd18455e974361893f392e70","last_reissued_at":"2026-07-05T08:29:42.339544Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:29:42.339544Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LLM Dataset Inference: Did you train on my dataset?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CR"],"primary_cat":"cs.LG","authors_text":"Adam Dziedzic, Hengrui Jia, Nicolas Papernot, Pratyush Maini","submitted_at":"2024-06-10T16:34:43Z","abstract_excerpt":"The proliferation of large language models (LLMs) in the real world has come with a rise in copyright cases against companies for training their models on unlicensed data from the internet. Recent works have presented methods to identify if individual text sequences were members of the model's training data, known as membership inference attacks (MIAs). We demonstrate that the apparent success of these MIAs is confounded by selecting non-members (text sequences not used for training) belonging to a different distribution from the members (e.g., temporally shifted recent Wikipedia articles comp"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.06443","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.06443/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.06443","created_at":"2026-07-05T08:29:42.339600+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.06443v1","created_at":"2026-07-05T08:29:42.339600+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.06443","created_at":"2026-07-05T08:29:42.339600+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZHKDAZ2GCH3O","created_at":"2026-07-05T08:29:42.339600+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZHKDAZ2GCH3OZQGO","created_at":"2026-07-05T08:29:42.339600+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZHKDAZ2G","created_at":"2026-07-05T08:29:42.339600+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.03305","citing_title":"The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03305","citing_title":"The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31991","citing_title":"Amplifying Membership Signal Through Chained Regeneration","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30462","citing_title":"idSCD: Identifying Training Datasets through Semantic Correlation Descriptors","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2506.06057","citing_title":"Hey, That's My Data! Token-Only Dataset Inference in Large Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06865","citing_title":"Dataset Watermarking for Closed LLMs with Provable Detection","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07878","citing_title":"Black-box model classification under the discriminative factorization","ref_index":22,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK","json":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK.json","graph_json":"https://pith.science/api/pith-number/ZHKDAZ2GCH3OZQGONC5364XHJK/graph.json","events_json":"https://pith.science/api/pith-number/ZHKDAZ2GCH3OZQGONC5364XHJK/events.json","paper":"https://pith.science/paper/ZHKDAZ2G"},"agent_actions":{"view_html":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK","download_json":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK.json","view_paper":"https://pith.science/paper/ZHKDAZ2G","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.06443&json=true","fetch_graph":"https://pith.science/api/pith-number/ZHKDAZ2GCH3OZQGONC5364XHJK/graph.json","fetch_events":"https://pith.science/api/pith-number/ZHKDAZ2GCH3OZQGONC5364XHJK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK/action/storage_attestation","attest_author":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK/action/author_attestation","sign_citation":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK/action/citation_signature","submit_replication":"https://pith.science/pith/ZHKDAZ2GCH3OZQGONC5364XHJK/action/replication_record"}},"created_at":"2026-07-05T08:29:42.339600+00:00","updated_at":"2026-07-05T08:29:42.339600+00:00"}