{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:YIC7RSWIX6DOPRQG23AHMJGM6P","short_pith_number":"pith:YIC7RSWI","schema_version":"1.0","canonical_sha256":"c205f8cac8bf86e7c606d6c07624ccf3c54eba1ee835f7e131187223df47dc8a","source":{"kind":"arxiv","id":"2305.14888","version":1},"attestation_state":"computed","paper":{"title":"Privacy Implications of Retrieval-Based Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Danqi Chen, Kai Li, Samyak Gupta, Yangsibo Huang, Zexuan Zhong","submitted_at":"2023-05-24T08:37:27Z","abstract_excerpt":"Retrieval-based language models (LMs) have demonstrated improved interpretability, factuality, and adaptability compared to their parametric counterparts, by incorporating retrieved text from external datastores. While it is well known that parametric models are prone to leaking private data, it remains unclear how the addition of a retrieval datastore impacts model privacy. In this work, we present the first study of privacy risks in retrieval-based LMs, particularly $k$NN-LMs. Our goal is to explore the optimal design and training procedure in domains where privacy is of concern, aiming to s"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.14888","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-05-24T08:37:27Z","cross_cats_sorted":["cs.CR","cs.LG"],"title_canon_sha256":"50db910fd01ee3865bea89193c18964dc87d43e315c5049c9a78bea415056d07","abstract_canon_sha256":"2a25c73073e52b6dad4d6f1dfe220f7ffc6c82b222bffa5248290fc6e98368c8"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:13:28.981920Z","signature_b64":"ajxkzFinYjuiTK0s11gGDhn+LqVehIz23/Dv3KZXajhCzyFIBbQtPzkVfpKE7TWVGxm1PvZTxm8HihrBoEGtAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c205f8cac8bf86e7c606d6c07624ccf3c54eba1ee835f7e131187223df47dc8a","last_reissued_at":"2026-07-05T06:13:28.981575Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:13:28.981575Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Privacy Implications of Retrieval-Based Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Danqi Chen, Kai Li, Samyak Gupta, Yangsibo Huang, Zexuan Zhong","submitted_at":"2023-05-24T08:37:27Z","abstract_excerpt":"Retrieval-based language models (LMs) have demonstrated improved interpretability, factuality, and adaptability compared to their parametric counterparts, by incorporating retrieved text from external datastores. While it is well known that parametric models are prone to leaking private data, it remains unclear how the addition of a retrieval datastore impacts model privacy. In this work, we present the first study of privacy risks in retrieval-based LMs, particularly $k$NN-LMs. Our goal is to explore the optimal design and training procedure in domains where privacy is of concern, aiming to s"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.14888","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.14888/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.14888","created_at":"2026-07-05T06:13:28.981633+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.14888v1","created_at":"2026-07-05T06:13:28.981633+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.14888","created_at":"2026-07-05T06:13:28.981633+00:00"},{"alias_kind":"pith_short_12","alias_value":"YIC7RSWIX6DO","created_at":"2026-07-05T06:13:28.981633+00:00"},{"alias_kind":"pith_short_16","alias_value":"YIC7RSWIX6DOPRQG","created_at":"2026-07-05T06:13:28.981633+00:00"},{"alias_kind":"pith_short_8","alias_value":"YIC7RSWI","created_at":"2026-07-05T06:13:28.981633+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2502.06453","citing_title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","ref_index":9,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P","json":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P.json","graph_json":"https://pith.science/api/pith-number/YIC7RSWIX6DOPRQG23AHMJGM6P/graph.json","events_json":"https://pith.science/api/pith-number/YIC7RSWIX6DOPRQG23AHMJGM6P/events.json","paper":"https://pith.science/paper/YIC7RSWI"},"agent_actions":{"view_html":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P","download_json":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P.json","view_paper":"https://pith.science/paper/YIC7RSWI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.14888&json=true","fetch_graph":"https://pith.science/api/pith-number/YIC7RSWIX6DOPRQG23AHMJGM6P/graph.json","fetch_events":"https://pith.science/api/pith-number/YIC7RSWIX6DOPRQG23AHMJGM6P/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P/action/storage_attestation","attest_author":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P/action/author_attestation","sign_citation":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P/action/citation_signature","submit_replication":"https://pith.science/pith/YIC7RSWIX6DOPRQG23AHMJGM6P/action/replication_record"}},"created_at":"2026-07-05T06:13:28.981633+00:00","updated_at":"2026-07-05T06:13:28.981633+00:00"}