{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:CYMOPBFMX7LT5SCHCKR4BX52CX","short_pith_number":"pith:CYMOPBFM","schema_version":"1.0","canonical_sha256":"1618e784acbfd73ec84712a3c0dfba15da6dc160e52b4f3120d00e9de44127c8","source":{"kind":"arxiv","id":"2410.02298","version":4},"attestation_state":"computed","paper":{"title":"Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CR","authors_text":"Dongcheng Zhao, Guobin Shen, Xiang He, Yiting Dong, Yi Zeng","submitted_at":"2024-10-03T08:34:17Z","abstract_excerpt":"As large language models (LLMs) become integral to various applications, ensuring both their safety and utility is paramount. Jailbreak attacks, which manipulate LLMs into generating harmful content, pose significant challenges to this balance. Existing defenses, such as prompt engineering and safety fine-tuning, often introduce computational overhead, increase inference latency, and lack runtime flexibility. Moreover, overly restrictive safety measures can degrade model utility by causing refusals of benign queries. In this paper, we introduce Jailbreak Antidote, a method that enables real-ti"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.02298","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CR","submitted_at":"2024-10-03T08:34:17Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"a51c5856bffbf6f50f0950a0a4de66436b25e5d3f8fbef9e3c4b27f3ed15b0a7","abstract_canon_sha256":"68f19bfda2b0e0ee8aaee3d102545959a11c4c760088e76a7dd24d88a7876ab6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:10:44.674468Z","signature_b64":"L6pymYPq8902XWvu032wJ3rXxF0S6ispQSEZU91p2/3Cm5S7hWPNdg9tmGTqRqdPTIofCJcdaoIrqW3AJYx+CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1618e784acbfd73ec84712a3c0dfba15da6dc160e52b4f3120d00e9de44127c8","last_reissued_at":"2026-07-05T10:10:44.673981Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:10:44.673981Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CR","authors_text":"Dongcheng Zhao, Guobin Shen, Xiang He, Yiting Dong, Yi Zeng","submitted_at":"2024-10-03T08:34:17Z","abstract_excerpt":"As large language models (LLMs) become integral to various applications, ensuring both their safety and utility is paramount. Jailbreak attacks, which manipulate LLMs into generating harmful content, pose significant challenges to this balance. Existing defenses, such as prompt engineering and safety fine-tuning, often introduce computational overhead, increase inference latency, and lack runtime flexibility. Moreover, overly restrictive safety measures can degrade model utility by causing refusals of benign queries. In this paper, we introduce Jailbreak Antidote, a method that enables real-ti"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.02298","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.02298/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.02298","created_at":"2026-07-05T10:10:44.674048+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.02298v4","created_at":"2026-07-05T10:10:44.674048+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.02298","created_at":"2026-07-05T10:10:44.674048+00:00"},{"alias_kind":"pith_short_12","alias_value":"CYMOPBFMX7LT","created_at":"2026-07-05T10:10:44.674048+00:00"},{"alias_kind":"pith_short_16","alias_value":"CYMOPBFMX7LT5SCH","created_at":"2026-07-05T10:10:44.674048+00:00"},{"alias_kind":"pith_short_8","alias_value":"CYMOPBFM","created_at":"2026-07-05T10:10:44.674048+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07335","citing_title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24552","citing_title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18104","citing_title":"Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15488","citing_title":"FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX","json":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX.json","graph_json":"https://pith.science/api/pith-number/CYMOPBFMX7LT5SCHCKR4BX52CX/graph.json","events_json":"https://pith.science/api/pith-number/CYMOPBFMX7LT5SCHCKR4BX52CX/events.json","paper":"https://pith.science/paper/CYMOPBFM"},"agent_actions":{"view_html":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX","download_json":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX.json","view_paper":"https://pith.science/paper/CYMOPBFM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.02298&json=true","fetch_graph":"https://pith.science/api/pith-number/CYMOPBFMX7LT5SCHCKR4BX52CX/graph.json","fetch_events":"https://pith.science/api/pith-number/CYMOPBFMX7LT5SCHCKR4BX52CX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX/action/storage_attestation","attest_author":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX/action/author_attestation","sign_citation":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX/action/citation_signature","submit_replication":"https://pith.science/pith/CYMOPBFMX7LT5SCHCKR4BX52CX/action/replication_record"}},"created_at":"2026-07-05T10:10:44.674048+00:00","updated_at":"2026-07-05T10:10:44.674048+00:00"}