{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2RCNDXAD3Z5USTOMNOSUIE35BY","short_pith_number":"pith:2RCNDXAD","schema_version":"1.0","canonical_sha256":"d444d1dc03de7b494dcc6ba544137d0e02810275a29389da6f255ce5b538c4a0","source":{"kind":"arxiv","id":"2410.19937","version":1},"attestation_state":"computed","paper":{"title":"RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CR","authors_text":"Changjiang Li, Jiacheng Liang, Tanqiu Jiang, Ting Wang, Yuhui Wang, Zian Wang","submitted_at":"2024-10-25T19:18:22Z","abstract_excerpt":"Jailbreak attacks circumvent LLMs' built-in safeguards by concealing harmful queries within jailbreak prompts. While existing defenses primarily focus on mitigating the effects of jailbreak prompts, they often prove inadequate as jailbreak prompts can take arbitrary, adaptive forms. This paper presents RobustKV, a novel defense that adopts a fundamentally different approach by selectively removing critical tokens of harmful queries from key-value (KV) caches. Intuitively, for a jailbreak prompt to be effective, its tokens must achieve sufficient `importance' (as measured by attention scores), "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.19937","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2024-10-25T19:18:22Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"a53e893ef6c824f586206a65dd01f0fa69865b719f4ea70da193553400794b2e","abstract_canon_sha256":"a8bb9982e9d0b77876620d85a4227af7992e0620d18640110f5fc506fd392bdf"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:26:35.913966Z","signature_b64":"d54/v0lNTfIFvtmPBQDbW4YgF5iQRgmNgGdj+aMZNH0IrCfx2eK9W/cNele0lo7i4QHHMkRVhGKPodek9PrGBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d444d1dc03de7b494dcc6ba544137d0e02810275a29389da6f255ce5b538c4a0","last_reissued_at":"2026-07-05T09:26:35.913482Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:26:35.913482Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CR","authors_text":"Changjiang Li, Jiacheng Liang, Tanqiu Jiang, Ting Wang, Yuhui Wang, Zian Wang","submitted_at":"2024-10-25T19:18:22Z","abstract_excerpt":"Jailbreak attacks circumvent LLMs' built-in safeguards by concealing harmful queries within jailbreak prompts. While existing defenses primarily focus on mitigating the effects of jailbreak prompts, they often prove inadequate as jailbreak prompts can take arbitrary, adaptive forms. This paper presents RobustKV, a novel defense that adopts a fundamentally different approach by selectively removing critical tokens of harmful queries from key-value (KV) caches. Intuitively, for a jailbreak prompt to be effective, its tokens must achieve sufficient `importance' (as measured by attention scores), "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.19937","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.19937/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.19937","created_at":"2026-07-05T09:26:35.913540+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.19937v1","created_at":"2026-07-05T09:26:35.913540+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.19937","created_at":"2026-07-05T09:26:35.913540+00:00"},{"alias_kind":"pith_short_12","alias_value":"2RCNDXAD3Z5U","created_at":"2026-07-05T09:26:35.913540+00:00"},{"alias_kind":"pith_short_16","alias_value":"2RCNDXAD3Z5USTOM","created_at":"2026-07-05T09:26:35.913540+00:00"},{"alias_kind":"pith_short_8","alias_value":"2RCNDXAD","created_at":"2026-07-05T09:26:35.913540+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17872","citing_title":"AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17128","citing_title":"New Wide-Net-Casting Jailbreak Attacks Risk Large Models","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY","json":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY.json","graph_json":"https://pith.science/api/pith-number/2RCNDXAD3Z5USTOMNOSUIE35BY/graph.json","events_json":"https://pith.science/api/pith-number/2RCNDXAD3Z5USTOMNOSUIE35BY/events.json","paper":"https://pith.science/paper/2RCNDXAD"},"agent_actions":{"view_html":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY","download_json":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY.json","view_paper":"https://pith.science/paper/2RCNDXAD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.19937&json=true","fetch_graph":"https://pith.science/api/pith-number/2RCNDXAD3Z5USTOMNOSUIE35BY/graph.json","fetch_events":"https://pith.science/api/pith-number/2RCNDXAD3Z5USTOMNOSUIE35BY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY/action/storage_attestation","attest_author":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY/action/author_attestation","sign_citation":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY/action/citation_signature","submit_replication":"https://pith.science/pith/2RCNDXAD3Z5USTOMNOSUIE35BY/action/replication_record"}},"created_at":"2026-07-05T09:26:35.913540+00:00","updated_at":"2026-07-05T09:26:35.913540+00:00"}