{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ODGMW5XYGPZMUVMBKQQLVPNH4Q","short_pith_number":"pith:ODGMW5XY","schema_version":"1.0","canonical_sha256":"70cccb76f833f2ca55815420babda7e40761b87ca7dda098cd778323e940d366","source":{"kind":"arxiv","id":"2408.10701","version":1},"attestation_state":"computed","paper":{"title":"Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Rishabh Bhardwaj, Soujanya Poria, Tej Deep Pala, Vernon Y.H. Toh","submitted_at":"2024-08-20T09:58:01Z","abstract_excerpt":"In today's era, where large language models (LLMs) are integrated into numerous real-world applications, ensuring their safety and robustness is crucial for responsible AI usage. Automated red-teaming methods play a key role in this process by generating adversarial attacks to identify and mitigate potential vulnerabilities in these models. However, existing methods often struggle with slow performance, limited categorical diversity, and high resource demands. While Rainbow Teaming, a recent approach, addresses the diversity challenge by framing adversarial prompt generation as a quality-diver"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.10701","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2024-08-20T09:58:01Z","cross_cats_sorted":[],"title_canon_sha256":"9243d396c4eef5970f0ad9d25388669a9e0da31fec46036cebdf824235f1d620","abstract_canon_sha256":"8728a6720a4d30907c6150dfb8446cb1d84d5b5a4afc4e28df3760c05484bac7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:57:16.149510Z","signature_b64":"tcbDnLMcGswGmerCSDz1rEMC/11ED05JHo42H39u/Fc+eSjKdSYkhGNY9biYdW+zLgpPt30uuNWVTNu3GhTgDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"70cccb76f833f2ca55815420babda7e40761b87ca7dda098cd778323e940d366","last_reissued_at":"2026-07-05T08:57:16.149024Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:57:16.149024Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Rishabh Bhardwaj, Soujanya Poria, Tej Deep Pala, Vernon Y.H. Toh","submitted_at":"2024-08-20T09:58:01Z","abstract_excerpt":"In today's era, where large language models (LLMs) are integrated into numerous real-world applications, ensuring their safety and robustness is crucial for responsible AI usage. Automated red-teaming methods play a key role in this process by generating adversarial attacks to identify and mitigate potential vulnerabilities in these models. However, existing methods often struggle with slow performance, limited categorical diversity, and high resource demands. While Rainbow Teaming, a recent approach, addresses the diversity challenge by framing adversarial prompt generation as a quality-diver"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.10701","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.10701/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.10701","created_at":"2026-07-05T08:57:16.149078+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.10701v1","created_at":"2026-07-05T08:57:16.149078+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.10701","created_at":"2026-07-05T08:57:16.149078+00:00"},{"alias_kind":"pith_short_12","alias_value":"ODGMW5XYGPZM","created_at":"2026-07-05T08:57:16.149078+00:00"},{"alias_kind":"pith_short_16","alias_value":"ODGMW5XYGPZMUVMB","created_at":"2026-07-05T08:57:16.149078+00:00"},{"alias_kind":"pith_short_8","alias_value":"ODGMW5XY","created_at":"2026-07-05T08:57:16.149078+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.05630","citing_title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05682","citing_title":"PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05682","citing_title":"PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05630","citing_title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q","json":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q.json","graph_json":"https://pith.science/api/pith-number/ODGMW5XYGPZMUVMBKQQLVPNH4Q/graph.json","events_json":"https://pith.science/api/pith-number/ODGMW5XYGPZMUVMBKQQLVPNH4Q/events.json","paper":"https://pith.science/paper/ODGMW5XY"},"agent_actions":{"view_html":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q","download_json":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q.json","view_paper":"https://pith.science/paper/ODGMW5XY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.10701&json=true","fetch_graph":"https://pith.science/api/pith-number/ODGMW5XYGPZMUVMBKQQLVPNH4Q/graph.json","fetch_events":"https://pith.science/api/pith-number/ODGMW5XYGPZMUVMBKQQLVPNH4Q/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q/action/storage_attestation","attest_author":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q/action/author_attestation","sign_citation":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q/action/citation_signature","submit_replication":"https://pith.science/pith/ODGMW5XYGPZMUVMBKQQLVPNH4Q/action/replication_record"}},"created_at":"2026-07-05T08:57:16.149078+00:00","updated_at":"2026-07-05T08:57:16.149078+00:00"}