{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:P7G6Q3USA6MFMWBT4KMNBHBCU5","short_pith_number":"pith:P7G6Q3US","schema_version":"1.0","canonical_sha256":"7fcde86e920798565833e298d09c22a75cea60502b3ceb12b43a9690ed97aeeb","source":{"kind":"arxiv","id":"2203.08242","version":1},"attestation_state":"computed","paper":{"title":"Data Contamination: From Memorization to Exploitation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Inbal Magar, Roy Schwartz","submitted_at":"2022-03-15T20:37:16Z","abstract_excerpt":"Pretrained language models are typically trained on massive web-based datasets, which are often \"contaminated\" with downstream test sets. It is not clear to what extent models exploit the contaminated data for downstream tasks. We present a principled method to study this question. We pretrain BERT models on joint corpora of Wikipedia and labeled downstream datasets, and fine-tune them on the relevant task. Comparing performance between samples seen and unseen during pretraining enables us to define and quantify levels of memorization and exploitation. Experiments with two models and three dow"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2203.08242","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2022-03-15T20:37:16Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"b2020e1bea11233784252e35207b03d6ef64758561d811a953d4decadb815aeb","abstract_canon_sha256":"e806d658f7c4ffe7053638ac2fc952dd945379cd2d7892b100da0130d59a61e9"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:05:41.484135Z","signature_b64":"8TwnbSehYooSByyuWqn/l/kDDVZgBHVG8e4M97LPTMpI3V9imdn0VSjqxGct1eLTC3PTZIZP5lhoNehmY6LAAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7fcde86e920798565833e298d09c22a75cea60502b3ceb12b43a9690ed97aeeb","last_reissued_at":"2026-07-05T04:05:41.483696Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:05:41.483696Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Data Contamination: From Memorization to Exploitation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Inbal Magar, Roy Schwartz","submitted_at":"2022-03-15T20:37:16Z","abstract_excerpt":"Pretrained language models are typically trained on massive web-based datasets, which are often \"contaminated\" with downstream test sets. It is not clear to what extent models exploit the contaminated data for downstream tasks. We present a principled method to study this question. We pretrain BERT models on joint corpora of Wikipedia and labeled downstream datasets, and fine-tune them on the relevant task. Comparing performance between samples seen and unseen during pretraining enables us to define and quantify levels of memorization and exploitation. Experiments with two models and three dow"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2203.08242","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2203.08242/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2203.08242","created_at":"2026-07-05T04:05:41.483748+00:00"},{"alias_kind":"arxiv_version","alias_value":"2203.08242v1","created_at":"2026-07-05T04:05:41.483748+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2203.08242","created_at":"2026-07-05T04:05:41.483748+00:00"},{"alias_kind":"pith_short_12","alias_value":"P7G6Q3USA6MF","created_at":"2026-07-05T04:05:41.483748+00:00"},{"alias_kind":"pith_short_16","alias_value":"P7G6Q3USA6MFMWBT","created_at":"2026-07-05T04:05:41.483748+00:00"},{"alias_kind":"pith_short_8","alias_value":"P7G6Q3US","created_at":"2026-07-05T04:05:41.483748+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26429","citing_title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17454","citing_title":"Dissecting model behavior through agent trajectories","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2310.16789","citing_title":"Detecting Pretraining Data from Large Language Models","ref_index":36,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5","json":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5.json","graph_json":"https://pith.science/api/pith-number/P7G6Q3USA6MFMWBT4KMNBHBCU5/graph.json","events_json":"https://pith.science/api/pith-number/P7G6Q3USA6MFMWBT4KMNBHBCU5/events.json","paper":"https://pith.science/paper/P7G6Q3US"},"agent_actions":{"view_html":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5","download_json":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5.json","view_paper":"https://pith.science/paper/P7G6Q3US","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2203.08242&json=true","fetch_graph":"https://pith.science/api/pith-number/P7G6Q3USA6MFMWBT4KMNBHBCU5/graph.json","fetch_events":"https://pith.science/api/pith-number/P7G6Q3USA6MFMWBT4KMNBHBCU5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5/action/storage_attestation","attest_author":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5/action/author_attestation","sign_citation":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5/action/citation_signature","submit_replication":"https://pith.science/pith/P7G6Q3USA6MFMWBT4KMNBHBCU5/action/replication_record"}},"created_at":"2026-07-05T04:05:41.483748+00:00","updated_at":"2026-07-05T04:05:41.483748+00:00"}