{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:RPWGXZARVMYNBDEJ4GMWQ42HUB","short_pith_number":"pith:RPWGXZAR","schema_version":"1.0","canonical_sha256":"8bec6be411ab30d08c89e199687347a046f038e4c184c6ac3aa2eb702175e28c","source":{"kind":"arxiv","id":"2506.04566","version":1},"attestation_state":"computed","paper":{"title":"Clustering and Median Aggregation Improve Differentially Private Inference","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.CR"],"primary_cat":"cs.LG","authors_text":"Alex Bie, Kareem Amin, Natalia Ponomareva, Salman Avestimehr, Sara Babakniya, Umar Syed, Weiwei Kong","submitted_at":"2025-06-05T02:34:50Z","abstract_excerpt":"Differentially private (DP) language model inference is an approach for generating private synthetic text. A sensitive input example is used to prompt an off-the-shelf large language model (LLM) to produce a similar example. Multiple examples can be aggregated together to formally satisfy the DP guarantee.\n  Prior work creates inference batches by sampling sensitive inputs uniformly at random. We show that uniform sampling degrades the quality of privately generated text, especially when the sensitive examples concern heterogeneous topics.\n  We remedy this problem by clustering the input data "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.04566","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-05T02:34:50Z","cross_cats_sorted":["cs.AI","cs.CL","cs.CR"],"title_canon_sha256":"0deb25e15d1e72553f40faa3de9e3f5234679e91499ba0c9431784bef06784af","abstract_canon_sha256":"3208889079e8b604846e931dc50ecbcbd719238573fb7eb668bb93bbd89c27d4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:16:36.580691Z","signature_b64":"Kq/U9FfW7473zBOQNvF8WVnLKCxqMV0nqPN25VS5Hfz2JcJuwAKcCROn4ilFJst5asMtT2lqTMRUhKLBRtTzBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8bec6be411ab30d08c89e199687347a046f038e4c184c6ac3aa2eb702175e28c","last_reissued_at":"2026-07-05T11:16:36.580168Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:16:36.580168Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Clustering and Median Aggregation Improve Differentially Private Inference","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.CR"],"primary_cat":"cs.LG","authors_text":"Alex Bie, Kareem Amin, Natalia Ponomareva, Salman Avestimehr, Sara Babakniya, Umar Syed, Weiwei Kong","submitted_at":"2025-06-05T02:34:50Z","abstract_excerpt":"Differentially private (DP) language model inference is an approach for generating private synthetic text. A sensitive input example is used to prompt an off-the-shelf large language model (LLM) to produce a similar example. Multiple examples can be aggregated together to formally satisfy the DP guarantee.\n  Prior work creates inference batches by sampling sensitive inputs uniformly at random. We show that uniform sampling degrades the quality of privately generated text, especially when the sensitive examples concern heterogeneous topics.\n  We remedy this problem by clustering the input data "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.04566","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.04566/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.04566","created_at":"2026-07-05T11:16:36.580230+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.04566v1","created_at":"2026-07-05T11:16:36.580230+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.04566","created_at":"2026-07-05T11:16:36.580230+00:00"},{"alias_kind":"pith_short_12","alias_value":"RPWGXZARVMYN","created_at":"2026-07-05T11:16:36.580230+00:00"},{"alias_kind":"pith_short_16","alias_value":"RPWGXZARVMYNBDEJ","created_at":"2026-07-05T11:16:36.580230+00:00"},{"alias_kind":"pith_short_8","alias_value":"RPWGXZAR","created_at":"2026-07-05T11:16:36.580230+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2507.02974","citing_title":"InvisibleInk: High-Utility and Low-Cost Text Generation with Differential Privacy","ref_index":52,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB","json":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB.json","graph_json":"https://pith.science/api/pith-number/RPWGXZARVMYNBDEJ4GMWQ42HUB/graph.json","events_json":"https://pith.science/api/pith-number/RPWGXZARVMYNBDEJ4GMWQ42HUB/events.json","paper":"https://pith.science/paper/RPWGXZAR"},"agent_actions":{"view_html":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB","download_json":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB.json","view_paper":"https://pith.science/paper/RPWGXZAR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.04566&json=true","fetch_graph":"https://pith.science/api/pith-number/RPWGXZARVMYNBDEJ4GMWQ42HUB/graph.json","fetch_events":"https://pith.science/api/pith-number/RPWGXZARVMYNBDEJ4GMWQ42HUB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB/action/storage_attestation","attest_author":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB/action/author_attestation","sign_citation":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB/action/citation_signature","submit_replication":"https://pith.science/pith/RPWGXZARVMYNBDEJ4GMWQ42HUB/action/replication_record"}},"created_at":"2026-07-05T11:16:36.580230+00:00","updated_at":"2026-07-05T11:16:36.580230+00:00"}