{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:6WGXXNDE5R7WEOABOLNSCSMMF5","short_pith_number":"pith:6WGXXNDE","schema_version":"1.0","canonical_sha256":"f58d7bb464ec7f62380172db21498c2f5ac13598345fd90ed00f08a7e5a1f03d","source":{"kind":"arxiv","id":"2402.16822","version":3},"attestation_state":"computed","paper":{"title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Andrei Lupu, Aram H. Markosyan, Eric Hambro, Jack Parker-Holder, Jakob Foerster, Manish Bhatt, Mikayel Samvelyan, Minqi Jiang, Roberta Raileanu, Sharath Chandra Raparthy, Tim Rockt\\\"aschel, Yuning Mao","submitted_at":"2024-02-26T18:47:27Z","abstract_excerpt":"As large language models (LLMs) become increasingly prevalent across many real-world applications, understanding and enhancing their robustness to adversarial attacks is of paramount importance. Existing methods for identifying adversarial prompts tend to focus on specific domains, lack diversity, or require extensive human annotations. To address these limitations, we present Rainbow Teaming, a novel black-box approach for producing a diverse collection of adversarial prompts. Rainbow Teaming casts adversarial prompt generation as a quality-diversity problem and uses open-ended search to gene"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.16822","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-02-26T18:47:27Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"820dd24efbce261967ac7a01d45ec8d84682747afdaa527a2c14bc1dbb55faeb","abstract_canon_sha256":"a81abd07220dc599ea14733126b380f31477189bb3370bd92dff41be8c9176a4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:47:28.623900Z","signature_b64":"DJHUKbTi3HCTTtIa1BNHFxlQabpGJepx6tFXNIsWCgFT6NRu+1+Mu4Jhq6c/+x4dgpnmwJfwdSPdbBPlt0KCCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f58d7bb464ec7f62380172db21498c2f5ac13598345fd90ed00f08a7e5a1f03d","last_reissued_at":"2026-07-05T09:47:28.623403Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:47:28.623403Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Andrei Lupu, Aram H. Markosyan, Eric Hambro, Jack Parker-Holder, Jakob Foerster, Manish Bhatt, Mikayel Samvelyan, Minqi Jiang, Roberta Raileanu, Sharath Chandra Raparthy, Tim Rockt\\\"aschel, Yuning Mao","submitted_at":"2024-02-26T18:47:27Z","abstract_excerpt":"As large language models (LLMs) become increasingly prevalent across many real-world applications, understanding and enhancing their robustness to adversarial attacks is of paramount importance. Existing methods for identifying adversarial prompts tend to focus on specific domains, lack diversity, or require extensive human annotations. To address these limitations, we present Rainbow Teaming, a novel black-box approach for producing a diverse collection of adversarial prompts. Rainbow Teaming casts adversarial prompt generation as a quality-diversity problem and uses open-ended search to gene"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.16822","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.16822/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.16822","created_at":"2026-07-05T09:47:28.623464+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.16822v3","created_at":"2026-07-05T09:47:28.623464+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.16822","created_at":"2026-07-05T09:47:28.623464+00:00"},{"alias_kind":"pith_short_12","alias_value":"6WGXXNDE5R7W","created_at":"2026-07-05T09:47:28.623464+00:00"},{"alias_kind":"pith_short_16","alias_value":"6WGXXNDE5R7WEOAB","created_at":"2026-07-05T09:47:28.623464+00:00"},{"alias_kind":"pith_short_8","alias_value":"6WGXXNDE","created_at":"2026-07-05T09:47:28.623464+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07918","citing_title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","ref_index":38,"is_internal_anchor":true},{"citing_arxiv_id":"2606.07535","citing_title":"Multilingual Refusal Alignment for Safer Large Language Models","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01441","citing_title":"Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00801","citing_title":"Quality-Diversity Evolution for Discovering Diverse Vulnerabilities in LLM Safety","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2601.19562","citing_title":"Tournament Informed Adversarial Quality Diversity","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15721","citing_title":"Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2507.06261","citing_title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2501.18837","citing_title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04019","citing_title":"Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24983","citing_title":"Adaptive Prompt Embedding Optimization for LLM Jailbreaking","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02647","citing_title":"ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06213","citing_title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5","json":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5.json","graph_json":"https://pith.science/api/pith-number/6WGXXNDE5R7WEOABOLNSCSMMF5/graph.json","events_json":"https://pith.science/api/pith-number/6WGXXNDE5R7WEOABOLNSCSMMF5/events.json","paper":"https://pith.science/paper/6WGXXNDE"},"agent_actions":{"view_html":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5","download_json":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5.json","view_paper":"https://pith.science/paper/6WGXXNDE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.16822&json=true","fetch_graph":"https://pith.science/api/pith-number/6WGXXNDE5R7WEOABOLNSCSMMF5/graph.json","fetch_events":"https://pith.science/api/pith-number/6WGXXNDE5R7WEOABOLNSCSMMF5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5/action/storage_attestation","attest_author":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5/action/author_attestation","sign_citation":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5/action/citation_signature","submit_replication":"https://pith.science/pith/6WGXXNDE5R7WEOABOLNSCSMMF5/action/replication_record"}},"created_at":"2026-07-05T09:47:28.623464+00:00","updated_at":"2026-07-05T09:47:28.623464+00:00"}