{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:DQG2QJARJMR4O6WDQ5BNPE6GO6","short_pith_number":"pith:DQG2QJAR","schema_version":"1.0","canonical_sha256":"1c0da824114b23c77ac38742d793c6778647dc7d8d65e38b5ad91909434b0824","source":{"kind":"arxiv","id":"2402.13494","version":2},"attestation_state":"computed","paper":{"title":"GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR"],"primary_cat":"cs.CL","authors_text":"Minghong Fang, Neil Gong, Renjie Pi, Yueqi Xie","submitted_at":"2024-02-21T03:09:21Z","abstract_excerpt":"Large Language Models (LLMs) face threats from jailbreak prompts. Existing methods for detecting jailbreak prompts are primarily online moderation APIs or finetuned LLMs. These strategies, however, often require extensive and resource-intensive data collection and training processes. In this study, we propose GradSafe, which effectively detects jailbreak prompts by scrutinizing the gradients of safety-critical parameters in LLMs. Our method is grounded in a pivotal observation: the gradients of an LLM's loss for jailbreak prompts paired with compliance response exhibit similar patterns on cert"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.13494","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-02-21T03:09:21Z","cross_cats_sorted":["cs.CR"],"title_canon_sha256":"aeb8b5b07a5d06f7518340c4a3a74c8b29b7279769945240b7dfce8d8b4b983a","abstract_canon_sha256":"cd4941353ae3525e2712aaf8d7daa65551754ae164ee44d669852b153d6a2f01"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:25:00.823131Z","signature_b64":"/43wk4nlwaWaTWW6CWfPEntQfhQKIlYOqhdsx8ndsThmpTE5rbBfdDRqn2jWUwLfjt/1LsRVKAcEy/YQFBNmCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1c0da824114b23c77ac38742d793c6778647dc7d8d65e38b5ad91909434b0824","last_reissued_at":"2026-07-05T08:25:00.822692Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:25:00.822692Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR"],"primary_cat":"cs.CL","authors_text":"Minghong Fang, Neil Gong, Renjie Pi, Yueqi Xie","submitted_at":"2024-02-21T03:09:21Z","abstract_excerpt":"Large Language Models (LLMs) face threats from jailbreak prompts. Existing methods for detecting jailbreak prompts are primarily online moderation APIs or finetuned LLMs. These strategies, however, often require extensive and resource-intensive data collection and training processes. In this study, we propose GradSafe, which effectively detects jailbreak prompts by scrutinizing the gradients of safety-critical parameters in LLMs. Our method is grounded in a pivotal observation: the gradients of an LLM's loss for jailbreak prompts paired with compliance response exhibit similar patterns on cert"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.13494","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.13494/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.13494","created_at":"2026-07-05T08:25:00.822745+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.13494v2","created_at":"2026-07-05T08:25:00.822745+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.13494","created_at":"2026-07-05T08:25:00.822745+00:00"},{"alias_kind":"pith_short_12","alias_value":"DQG2QJARJMR4","created_at":"2026-07-05T08:25:00.822745+00:00"},{"alias_kind":"pith_short_16","alias_value":"DQG2QJARJMR4O6WD","created_at":"2026-07-05T08:25:00.822745+00:00"},{"alias_kind":"pith_short_8","alias_value":"DQG2QJAR","created_at":"2026-07-05T08:25:00.822745+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22237","citing_title":"Investigating The Security of Modern AI and Cloud Infrastructure","ref_index":142,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07335","citing_title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2407.04295","citing_title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","ref_index":101,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08577","citing_title":"Distributionally Robust Token Optimization in RLHF","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17562","citing_title":"SafeAgent: A Runtime Protection Architecture for Agentic Systems","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6","json":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6.json","graph_json":"https://pith.science/api/pith-number/DQG2QJARJMR4O6WDQ5BNPE6GO6/graph.json","events_json":"https://pith.science/api/pith-number/DQG2QJARJMR4O6WDQ5BNPE6GO6/events.json","paper":"https://pith.science/paper/DQG2QJAR"},"agent_actions":{"view_html":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6","download_json":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6.json","view_paper":"https://pith.science/paper/DQG2QJAR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.13494&json=true","fetch_graph":"https://pith.science/api/pith-number/DQG2QJARJMR4O6WDQ5BNPE6GO6/graph.json","fetch_events":"https://pith.science/api/pith-number/DQG2QJARJMR4O6WDQ5BNPE6GO6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6/action/storage_attestation","attest_author":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6/action/author_attestation","sign_citation":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6/action/citation_signature","submit_replication":"https://pith.science/pith/DQG2QJARJMR4O6WDQ5BNPE6GO6/action/replication_record"}},"created_at":"2026-07-05T08:25:00.822745+00:00","updated_at":"2026-07-05T08:25:00.822745+00:00"}