{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:DTE74SCAPW2EPOZXHSHHXUN4ZW","short_pith_number":"pith:DTE74SCA","schema_version":"1.0","canonical_sha256":"1cc9fe48407db447bb373c8e7bd1bccd8ccfac494b196ad403fbaded699f2945","source":{"kind":"arxiv","id":"2408.11313","version":2},"attestation_state":"computed","paper":{"title":"An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as Optimizer","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Chao Shen, Juan Zhai, Shiqing Ma, Weipeng Jiang, Zhengyu Zhao, Zhenting Wang","submitted_at":"2024-08-21T03:35:24Z","abstract_excerpt":"Despite prior safety alignment efforts, mainstream LLMs can still generate harmful and unethical content when subjected to jailbreaking attacks. Existing jailbreaking methods fall into two main categories: template-based and optimization-based methods. The former requires significant manual effort and domain knowledge, while the latter, exemplified by Greedy Coordinate Gradient (GCG), which seeks to maximize the likelihood of harmful LLM outputs through token-level optimization, also encounters several limitations: requiring white-box access, necessitating pre-constructed affirmative phrase, a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.11313","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2024-08-21T03:35:24Z","cross_cats_sorted":[],"title_canon_sha256":"65b4c9d031978fa161bc02d93c35486343b5aca04e49db73bfd4ce5074dd3b74","abstract_canon_sha256":"715d3bf55de67162ff2cda4900b2452b15bfca579671d53d457301e884a841df"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:43:00.893877Z","signature_b64":"zn7PpJt+IDaSCfVcb/bb4zqxBFMCsZeQoyXfk/JAGSOIncZfO64exnQk5sWyaMxfWDvbeQmmQ3r0WDbgEDegCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1cc9fe48407db447bb373c8e7bd1bccd8ccfac494b196ad403fbaded699f2945","last_reissued_at":"2026-07-05T10:43:00.893401Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:43:00.893401Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as Optimizer","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Chao Shen, Juan Zhai, Shiqing Ma, Weipeng Jiang, Zhengyu Zhao, Zhenting Wang","submitted_at":"2024-08-21T03:35:24Z","abstract_excerpt":"Despite prior safety alignment efforts, mainstream LLMs can still generate harmful and unethical content when subjected to jailbreaking attacks. Existing jailbreaking methods fall into two main categories: template-based and optimization-based methods. The former requires significant manual effort and domain knowledge, while the latter, exemplified by Greedy Coordinate Gradient (GCG), which seeks to maximize the likelihood of harmful LLM outputs through token-level optimization, also encounters several limitations: requiring white-box access, necessitating pre-constructed affirmative phrase, a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.11313","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.11313/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.11313","created_at":"2026-07-05T10:43:00.893459+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.11313v2","created_at":"2026-07-05T10:43:00.893459+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.11313","created_at":"2026-07-05T10:43:00.893459+00:00"},{"alias_kind":"pith_short_12","alias_value":"DTE74SCAPW2E","created_at":"2026-07-05T10:43:00.893459+00:00"},{"alias_kind":"pith_short_16","alias_value":"DTE74SCAPW2EPOZX","created_at":"2026-07-05T10:43:00.893459+00:00"},{"alias_kind":"pith_short_8","alias_value":"DTE74SCA","created_at":"2026-07-05T10:43:00.893459+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2502.05206","citing_title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","ref_index":98,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW","json":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW.json","graph_json":"https://pith.science/api/pith-number/DTE74SCAPW2EPOZXHSHHXUN4ZW/graph.json","events_json":"https://pith.science/api/pith-number/DTE74SCAPW2EPOZXHSHHXUN4ZW/events.json","paper":"https://pith.science/paper/DTE74SCA"},"agent_actions":{"view_html":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW","download_json":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW.json","view_paper":"https://pith.science/paper/DTE74SCA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.11313&json=true","fetch_graph":"https://pith.science/api/pith-number/DTE74SCAPW2EPOZXHSHHXUN4ZW/graph.json","fetch_events":"https://pith.science/api/pith-number/DTE74SCAPW2EPOZXHSHHXUN4ZW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW/action/storage_attestation","attest_author":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW/action/author_attestation","sign_citation":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW/action/citation_signature","submit_replication":"https://pith.science/pith/DTE74SCAPW2EPOZXHSHHXUN4ZW/action/replication_record"}},"created_at":"2026-07-05T10:43:00.893459+00:00","updated_at":"2026-07-05T10:43:00.893459+00:00"}