{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NK7FOLEIVX7VB5FU6H734E6PQB","short_pith_number":"pith:NK7FOLEI","schema_version":"1.0","canonical_sha256":"6abe572c88adff50f4b4f1ffbe13cf80664ab2ae9fd523503b62bd866d5d3035","source":{"kind":"arxiv","id":"2509.08653","version":2},"attestation_state":"computed","paper":{"title":"Generative Data Refinement: Just Ask for Better Data","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Edward Grefenstette, Jo\\~ao G. M. Ara\\'ujo, Minqi Jiang, Sian Gooding, Will Ellsworth","submitted_at":"2025-09-10T14:49:12Z","abstract_excerpt":"For a fixed parameter size, the capabilities of large models are primarily determined by the quality and quantity of its training data. Consequently, training datasets now grow faster than the rate at which new data is indexed on the web, leading to projected data exhaustion over the next decade. Much more data exists as user-generated content that is not publicly indexed, but incorporating such data comes with considerable risks, such as leaking private information and other undesirable content. We introduce a framework, Generative Data Refinement (GDR), for using pretrained generative models"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.08653","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-09-10T14:49:12Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"2bb8275931b78c5c014b23dc60645d615b2a2cef885e1ff2088dbea9b7af3a15","abstract_canon_sha256":"aeacb96e37f390f701c0465785ae53a82be750e7a4c6905b0c76f29d59eb0ecd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:09:25.064347Z","signature_b64":"veqQpxZT8wEgQwPh+7c3YzP9ETgeeZShMTyXbtxpxbAuXe0aJfMM5alW0RMvLeWfDRVubo9yZhlb+d/7Lf0bAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6abe572c88adff50f4b4f1ffbe13cf80664ab2ae9fd523503b62bd866d5d3035","last_reissued_at":"2026-07-05T12:09:25.063818Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:09:25.063818Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Generative Data Refinement: Just Ask for Better Data","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Edward Grefenstette, Jo\\~ao G. M. Ara\\'ujo, Minqi Jiang, Sian Gooding, Will Ellsworth","submitted_at":"2025-09-10T14:49:12Z","abstract_excerpt":"For a fixed parameter size, the capabilities of large models are primarily determined by the quality and quantity of its training data. Consequently, training datasets now grow faster than the rate at which new data is indexed on the web, leading to projected data exhaustion over the next decade. Much more data exists as user-generated content that is not publicly indexed, but incorporating such data comes with considerable risks, such as leaking private information and other undesirable content. We introduce a framework, Generative Data Refinement (GDR), for using pretrained generative models"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.08653","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.08653/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.08653","created_at":"2026-07-05T12:09:25.063894+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.08653v2","created_at":"2026-07-05T12:09:25.063894+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.08653","created_at":"2026-07-05T12:09:25.063894+00:00"},{"alias_kind":"pith_short_12","alias_value":"NK7FOLEIVX7V","created_at":"2026-07-05T12:09:25.063894+00:00"},{"alias_kind":"pith_short_16","alias_value":"NK7FOLEIVX7VB5FU","created_at":"2026-07-05T12:09:25.063894+00:00"},{"alias_kind":"pith_short_8","alias_value":"NK7FOLEI","created_at":"2026-07-05T12:09:25.063894+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19168","citing_title":"Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection","ref_index":62,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB","json":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB.json","graph_json":"https://pith.science/api/pith-number/NK7FOLEIVX7VB5FU6H734E6PQB/graph.json","events_json":"https://pith.science/api/pith-number/NK7FOLEIVX7VB5FU6H734E6PQB/events.json","paper":"https://pith.science/paper/NK7FOLEI"},"agent_actions":{"view_html":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB","download_json":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB.json","view_paper":"https://pith.science/paper/NK7FOLEI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.08653&json=true","fetch_graph":"https://pith.science/api/pith-number/NK7FOLEIVX7VB5FU6H734E6PQB/graph.json","fetch_events":"https://pith.science/api/pith-number/NK7FOLEIVX7VB5FU6H734E6PQB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB/action/storage_attestation","attest_author":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB/action/author_attestation","sign_citation":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB/action/citation_signature","submit_replication":"https://pith.science/pith/NK7FOLEIVX7VB5FU6H734E6PQB/action/replication_record"}},"created_at":"2026-07-05T12:09:25.063894+00:00","updated_at":"2026-07-05T12:09:25.063894+00:00"}