{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:27WJKKTCNWBWI4BQMZRDZJEG3I","short_pith_number":"pith:27WJKKTC","schema_version":"1.0","canonical_sha256":"d7ec952a626d8364703066623ca486da24ca2a70958d743ded30d80757511e2f","source":{"kind":"arxiv","id":"2310.12505","version":1},"attestation_state":"computed","paper":{"title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Boyi Deng, Fuli Feng, Qifan Wang, Wenjie Wang, Xiangnan He, Yang Deng","submitted_at":"2023-10-19T06:15:05Z","abstract_excerpt":"Large language models (LLMs) are susceptible to red teaming attacks, which can induce LLMs to generate harmful content. Previous research constructs attack prompts via manual or automatic methods, which have their own limitations on construction cost and quality. To address these issues, we propose an integrated approach that combines manual and automatic methods to economically generate high-quality attack prompts. Specifically, considering the impressive capabilities of newly emerged LLMs, we propose an attack framework to instruct LLMs to mimic human-generated prompts through in-context lea"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.12505","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-10-19T06:15:05Z","cross_cats_sorted":["cs.CR","cs.LG"],"title_canon_sha256":"2f6b9f8413b22a4226e5f0b9182b68432b4c63fe4e4b4c3a7f36917edfc2c421","abstract_canon_sha256":"3d0f46a6cf956b26ff472d1d5a6aea8228bfef58ee077c674dc4c2d834381034"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:02:39.151708Z","signature_b64":"gKePkdi14u27fQ0AFszTdgWpJOcnPMEpMsd2exzBoBl43XZQCSp6vHYiAOTWvEYLD74qaLw2bQScIZvarfRIDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d7ec952a626d8364703066623ca486da24ca2a70958d743ded30d80757511e2f","last_reissued_at":"2026-07-05T07:02:39.151241Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:02:39.151241Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Boyi Deng, Fuli Feng, Qifan Wang, Wenjie Wang, Xiangnan He, Yang Deng","submitted_at":"2023-10-19T06:15:05Z","abstract_excerpt":"Large language models (LLMs) are susceptible to red teaming attacks, which can induce LLMs to generate harmful content. Previous research constructs attack prompts via manual or automatic methods, which have their own limitations on construction cost and quality. To address these issues, we propose an integrated approach that combines manual and automatic methods to economically generate high-quality attack prompts. Specifically, considering the impressive capabilities of newly emerged LLMs, we propose an attack framework to instruct LLMs to mimic human-generated prompts through in-context lea"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.12505","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.12505/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.12505","created_at":"2026-07-05T07:02:39.151298+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.12505v1","created_at":"2026-07-05T07:02:39.151298+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.12505","created_at":"2026-07-05T07:02:39.151298+00:00"},{"alias_kind":"pith_short_12","alias_value":"27WJKKTCNWBW","created_at":"2026-07-05T07:02:39.151298+00:00"},{"alias_kind":"pith_short_16","alias_value":"27WJKKTCNWBWI4BQ","created_at":"2026-07-05T07:02:39.151298+00:00"},{"alias_kind":"pith_short_8","alias_value":"27WJKKTC","created_at":"2026-07-05T07:02:39.151298+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2510.20129","citing_title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2512.21110","citing_title":"Beyond Context: Large Language Models' Failure to Grasp Users' Intent","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21159","citing_title":"Adaptive Instruction Composition for Automated LLM Red-Teaming","ref_index":22,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I","json":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I.json","graph_json":"https://pith.science/api/pith-number/27WJKKTCNWBWI4BQMZRDZJEG3I/graph.json","events_json":"https://pith.science/api/pith-number/27WJKKTCNWBWI4BQMZRDZJEG3I/events.json","paper":"https://pith.science/paper/27WJKKTC"},"agent_actions":{"view_html":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I","download_json":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I.json","view_paper":"https://pith.science/paper/27WJKKTC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.12505&json=true","fetch_graph":"https://pith.science/api/pith-number/27WJKKTCNWBWI4BQMZRDZJEG3I/graph.json","fetch_events":"https://pith.science/api/pith-number/27WJKKTCNWBWI4BQMZRDZJEG3I/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I/action/timestamp_anchor","attest_storage":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I/action/storage_attestation","attest_author":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I/action/author_attestation","sign_citation":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I/action/citation_signature","submit_replication":"https://pith.science/pith/27WJKKTCNWBWI4BQMZRDZJEG3I/action/replication_record"}},"created_at":"2026-07-05T07:02:39.151298+00:00","updated_at":"2026-07-05T07:02:39.151298+00:00"}