{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:6OQE7XTZ47W53WTPMIQOH2JBKQ","short_pith_number":"pith:6OQE7XTZ","schema_version":"1.0","canonical_sha256":"f3a04fde79e7edddda6f6220e3e921542f157a369a6def3808a94deb51e30b1d","source":{"kind":"arxiv","id":"2404.07921","version":3},"attestation_state":"computed","paper":{"title":"AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Huan Sun, Zeyi Liao","submitted_at":"2024-04-11T17:05:50Z","abstract_excerpt":"As large language models (LLMs) become increasingly prevalent and integrated into autonomous systems, ensuring their safety is imperative. Despite significant strides toward safety alignment, recent work GCG~\\citep{zou2023universal} proposes a discrete token optimization algorithm and selects the single suffix with the lowest loss to successfully jailbreak aligned LLMs. In this work, we first discuss the drawbacks of solely picking the suffix with the lowest loss during GCG optimization for jailbreaking and uncover the missed successful suffixes during the intermediate steps. Moreover, we util"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.07921","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-04-11T17:05:50Z","cross_cats_sorted":[],"title_canon_sha256":"7787cac7a713fc51e2b8b3b59d8d13519cd2ea333f692c47c1e99306c4b56ecb","abstract_canon_sha256":"d3bebf1f2ea495188d56a8e34cc371d7b0fe142b4e7d02fd3c90dca88b0a6b55"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:39:22.543629Z","signature_b64":"mSAd93bCAHaMoUSc/yAa4Um7p+qXnZZ7zirUicERhS85DlwE8MSI3VnFVtl76TBgrKE5QUCpti890uMsWbtPDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f3a04fde79e7edddda6f6220e3e921542f157a369a6def3808a94deb51e30b1d","last_reissued_at":"2026-07-05T09:39:22.542998Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:39:22.542998Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Huan Sun, Zeyi Liao","submitted_at":"2024-04-11T17:05:50Z","abstract_excerpt":"As large language models (LLMs) become increasingly prevalent and integrated into autonomous systems, ensuring their safety is imperative. Despite significant strides toward safety alignment, recent work GCG~\\citep{zou2023universal} proposes a discrete token optimization algorithm and selects the single suffix with the lowest loss to successfully jailbreak aligned LLMs. In this work, we first discuss the drawbacks of solely picking the suffix with the lowest loss during GCG optimization for jailbreaking and uncover the missed successful suffixes during the intermediate steps. Moreover, we util"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.07921","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.07921/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.07921","created_at":"2026-07-05T09:39:22.543071+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.07921v3","created_at":"2026-07-05T09:39:22.543071+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.07921","created_at":"2026-07-05T09:39:22.543071+00:00"},{"alias_kind":"pith_short_12","alias_value":"6OQE7XTZ47W5","created_at":"2026-07-05T09:39:22.543071+00:00"},{"alias_kind":"pith_short_16","alias_value":"6OQE7XTZ47W53WTP","created_at":"2026-07-05T09:39:22.543071+00:00"},{"alias_kind":"pith_short_8","alias_value":"6OQE7XTZ","created_at":"2026-07-05T09:39:22.543071+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.05609","citing_title":"SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03647","citing_title":"Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2410.15362","citing_title":"Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2503.02574","citing_title":"LLM-Safety Evaluations Lack Robustness","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21362","citing_title":"LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20286","citing_title":"Adaptive Probe-based Steering for Robust LLM Jailbreaking","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17128","citing_title":"New Wide-Net-Casting Jailbreak Attacks Risk Large Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19485","citing_title":"Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2603.24935","citing_title":"SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2310.03684","citing_title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2406.11717","citing_title":"Refusal in Language Models Is Mediated by a Single Direction","ref_index":150,"is_internal_anchor":false},{"citing_arxiv_id":"2604.28157","citing_title":"FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02946","citing_title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00236","citing_title":"Attention Is Where You Attack","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18976","citing_title":"STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10326","citing_title":"Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion","ref_index":16,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ","json":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ.json","graph_json":"https://pith.science/api/pith-number/6OQE7XTZ47W53WTPMIQOH2JBKQ/graph.json","events_json":"https://pith.science/api/pith-number/6OQE7XTZ47W53WTPMIQOH2JBKQ/events.json","paper":"https://pith.science/paper/6OQE7XTZ"},"agent_actions":{"view_html":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ","download_json":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ.json","view_paper":"https://pith.science/paper/6OQE7XTZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.07921&json=true","fetch_graph":"https://pith.science/api/pith-number/6OQE7XTZ47W53WTPMIQOH2JBKQ/graph.json","fetch_events":"https://pith.science/api/pith-number/6OQE7XTZ47W53WTPMIQOH2JBKQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ/action/storage_attestation","attest_author":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ/action/author_attestation","sign_citation":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ/action/citation_signature","submit_replication":"https://pith.science/pith/6OQE7XTZ47W53WTPMIQOH2JBKQ/action/replication_record"}},"created_at":"2026-07-05T09:39:22.543071+00:00","updated_at":"2026-07-05T09:39:22.543071+00:00"}