{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:WE255U7DH2S4LQK5YNQRU35JCW","short_pith_number":"pith:WE255U7D","schema_version":"1.0","canonical_sha256":"b135ded3e33ea5c5c15dc3611a6fa9158914189f2014d5520ad7323d830dd9b6","source":{"kind":"arxiv","id":"2403.05030","version":6},"attestation_state":"computed","paper":{"title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CR","authors_text":"Dylan Hadfield-Menell, Lennart Schulze, Oam Patel, Stephen Casper","submitted_at":"2024-03-08T04:22:48Z","abstract_excerpt":"Despite extensive diagnostics and debugging by developers, AI systems sometimes exhibit harmful unintended behaviors. Finding and fixing these is challenging because the attack surface is so large -- it is not tractable to exhaustively search for inputs that may elicit harmful behaviors. Red-teaming and adversarial training (AT) are commonly used to improve robustness, however, they empirically struggle to fix failure modes that differ from the attacks used during training. In this work, we utilize latent adversarial training (LAT) to defend against vulnerabilities without leveraging knowledge"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.05030","kind":"arxiv","version":6},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2024-03-08T04:22:48Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"05b742624a3ef983212a95a79c25989f97c44bca8ad6fef9a0305cd1a993f5e3","abstract_canon_sha256":"4756a843d52927526eb8c6576076d0767705bd292998e587273e55b633913a6d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:44:39.107088Z","signature_b64":"KUdI1456Yz5D4+n5IIUM7PxXAdPwxSnf8mk/5RHHemTQ9bWvOYypmzhTjstF5YAe4IndIKyTlLsgfoWISZHgAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b135ded3e33ea5c5c15dc3611a6fa9158914189f2014d5520ad7323d830dd9b6","last_reissued_at":"2026-07-05T11:44:39.106619Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:44:39.106619Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CR","authors_text":"Dylan Hadfield-Menell, Lennart Schulze, Oam Patel, Stephen Casper","submitted_at":"2024-03-08T04:22:48Z","abstract_excerpt":"Despite extensive diagnostics and debugging by developers, AI systems sometimes exhibit harmful unintended behaviors. Finding and fixing these is challenging because the attack surface is so large -- it is not tractable to exhaustively search for inputs that may elicit harmful behaviors. Red-teaming and adversarial training (AT) are commonly used to improve robustness, however, they empirically struggle to fix failure modes that differ from the attacks used during training. In this work, we utilize latent adversarial training (LAT) to defend against vulnerabilities without leveraging knowledge"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.05030","kind":"arxiv","version":6},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.05030/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.05030","created_at":"2026-07-05T11:44:39.106675+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.05030v6","created_at":"2026-07-05T11:44:39.106675+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.05030","created_at":"2026-07-05T11:44:39.106675+00:00"},{"alias_kind":"pith_short_12","alias_value":"WE255U7DH2S4","created_at":"2026-07-05T11:44:39.106675+00:00"},{"alias_kind":"pith_short_16","alias_value":"WE255U7DH2S4LQK5","created_at":"2026-07-05T11:44:39.106675+00:00"},{"alias_kind":"pith_short_8","alias_value":"WE255U7D","created_at":"2026-07-05T11:44:39.106675+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07918","citing_title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01239","citing_title":"Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2409.07985","citing_title":"Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2409.18169","citing_title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2511.05914","citing_title":"Designing Incident Reporting Systems for Harms from General-Purpose AI","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12813","citing_title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08496","citing_title":"Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24332","citing_title":"Mitigating Error Amplification in Fast Adversarial Training","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24350","citing_title":"Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12817","citing_title":"Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10403","citing_title":"Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW","json":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW.json","graph_json":"https://pith.science/api/pith-number/WE255U7DH2S4LQK5YNQRU35JCW/graph.json","events_json":"https://pith.science/api/pith-number/WE255U7DH2S4LQK5YNQRU35JCW/events.json","paper":"https://pith.science/paper/WE255U7D"},"agent_actions":{"view_html":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW","download_json":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW.json","view_paper":"https://pith.science/paper/WE255U7D","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.05030&json=true","fetch_graph":"https://pith.science/api/pith-number/WE255U7DH2S4LQK5YNQRU35JCW/graph.json","fetch_events":"https://pith.science/api/pith-number/WE255U7DH2S4LQK5YNQRU35JCW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW/action/storage_attestation","attest_author":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW/action/author_attestation","sign_citation":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW/action/citation_signature","submit_replication":"https://pith.science/pith/WE255U7DH2S4LQK5YNQRU35JCW/action/replication_record"}},"created_at":"2026-07-05T11:44:39.106675+00:00","updated_at":"2026-07-05T11:44:39.106675+00:00"}