{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:VS6HEFFCCWQOZ6GIKP7BPZNKWD","short_pith_number":"pith:VS6HEFFC","schema_version":"1.0","canonical_sha256":"acbc7214a215a0ecf8c853fe17e5aab0c5c70618c12575fc766a2578ac978076","source":{"kind":"arxiv","id":"2506.15271","version":1},"attestation_state":"computed","paper":{"title":"Unlocking Post-hoc Dataset Inference with Synthetic Data","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Adam Dziedzic, Bihe Zhao, Franziska Boenisch, Pratyush Maini","submitted_at":"2025-06-18T08:46:59Z","abstract_excerpt":"The remarkable capabilities of Large Language Models (LLMs) can be mainly attributed to their massive training datasets, which are often scraped from the internet without respecting data owners' intellectual property rights. Dataset Inference (DI) offers a potential remedy by identifying whether a suspect dataset was used in training, thereby enabling data owners to verify unauthorized use. However, existing DI methods require a private set-known to be absent from training-that closely matches the compromised dataset's distribution. Such in-distribution, held-out data is rarely available in pr"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.15271","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-18T08:46:59Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"6ec96af31a2b475624d97ca07871d06b0d79b7cda9527fd3d1871a284aa9a0a1","abstract_canon_sha256":"bef6b85a755c8bb3c6614a85ad3bd9ec166c8cd68afff798df09fe1b46c441a2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:23:40.509799Z","signature_b64":"OuBYZTt+HZDcxA+ybk7rDb+Jk75A6t3TeBh4zsmiOg9nPOiAmBdrHyCkWX65LBLEIDaiqfxV9dJVflkMOTD5CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"acbc7214a215a0ecf8c853fe17e5aab0c5c70618c12575fc766a2578ac978076","last_reissued_at":"2026-07-05T11:23:40.509142Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:23:40.509142Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Unlocking Post-hoc Dataset Inference with Synthetic Data","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Adam Dziedzic, Bihe Zhao, Franziska Boenisch, Pratyush Maini","submitted_at":"2025-06-18T08:46:59Z","abstract_excerpt":"The remarkable capabilities of Large Language Models (LLMs) can be mainly attributed to their massive training datasets, which are often scraped from the internet without respecting data owners' intellectual property rights. Dataset Inference (DI) offers a potential remedy by identifying whether a suspect dataset was used in training, thereby enabling data owners to verify unauthorized use. However, existing DI methods require a private set-known to be absent from training-that closely matches the compromised dataset's distribution. Such in-distribution, held-out data is rarely available in pr"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.15271","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.15271/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.15271","created_at":"2026-07-05T11:23:40.509209+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.15271v1","created_at":"2026-07-05T11:23:40.509209+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.15271","created_at":"2026-07-05T11:23:40.509209+00:00"},{"alias_kind":"pith_short_12","alias_value":"VS6HEFFCCWQO","created_at":"2026-07-05T11:23:40.509209+00:00"},{"alias_kind":"pith_short_16","alias_value":"VS6HEFFCCWQOZ6GI","created_at":"2026-07-05T11:23:40.509209+00:00"},{"alias_kind":"pith_short_8","alias_value":"VS6HEFFC","created_at":"2026-07-05T11:23:40.509209+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.03305","citing_title":"The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03305","citing_title":"The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection","ref_index":28,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD","json":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD.json","graph_json":"https://pith.science/api/pith-number/VS6HEFFCCWQOZ6GIKP7BPZNKWD/graph.json","events_json":"https://pith.science/api/pith-number/VS6HEFFCCWQOZ6GIKP7BPZNKWD/events.json","paper":"https://pith.science/paper/VS6HEFFC"},"agent_actions":{"view_html":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD","download_json":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD.json","view_paper":"https://pith.science/paper/VS6HEFFC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.15271&json=true","fetch_graph":"https://pith.science/api/pith-number/VS6HEFFCCWQOZ6GIKP7BPZNKWD/graph.json","fetch_events":"https://pith.science/api/pith-number/VS6HEFFCCWQOZ6GIKP7BPZNKWD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD/action/storage_attestation","attest_author":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD/action/author_attestation","sign_citation":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD/action/citation_signature","submit_replication":"https://pith.science/pith/VS6HEFFCCWQOZ6GIKP7BPZNKWD/action/replication_record"}},"created_at":"2026-07-05T11:23:40.509209+00:00","updated_at":"2026-07-05T11:23:40.509209+00:00"}