{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:4RGVVSUBNEI2KMXCRGACOMYPI6","short_pith_number":"pith:4RGVVSUB","schema_version":"1.0","canonical_sha256":"e44d5aca816911a532e2898027330f4791f7a990bc6fcf0debff889b7a082d3d","source":{"kind":"arxiv","id":"2502.00718","version":2},"attestation_state":"computed","paper":{"title":"\"I am bad\": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.LG","authors_text":"David Khachaturov, Isha Gupta, Robert Mullins","submitted_at":"2025-02-02T08:36:23Z","abstract_excerpt":"The rise of multimodal large language models has introduced innovative human-machine interaction paradigms but also significant challenges in machine learning safety. Audio-Language Models (ALMs) are especially relevant due to the intuitive nature of spoken communication, yet little is known about their failure modes. This paper explores audio jailbreaks targeting ALMs, focusing on their ability to bypass alignment mechanisms. We construct adversarial perturbations that generalize across prompts, tasks, and even base audio samples, demonstrating the first universal jailbreaks in the audio moda"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.00718","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-02T08:36:23Z","cross_cats_sorted":["cs.SD","eess.AS"],"title_canon_sha256":"373c6ae9243abc3ccdccd36ebd3801f6a6682e360a7957d85648b0060135ac12","abstract_canon_sha256":"1b0774b464fb08de456cbca64f557b7eedaab5a99c33faf7f056d1ee9e17ed57"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:34:46.973717Z","signature_b64":"BSw2PnJH8qZ9GOtm10a0tx41RexeB9glbPtUvtOthSzP2zoikvkKaStSnbBOaFMzr2FBIKt33kAKhdrU2GzYAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e44d5aca816911a532e2898027330f4791f7a990bc6fcf0debff889b7a082d3d","last_reissued_at":"2026-07-05T11:34:46.973223Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:34:46.973223Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"\"I am bad\": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.LG","authors_text":"David Khachaturov, Isha Gupta, Robert Mullins","submitted_at":"2025-02-02T08:36:23Z","abstract_excerpt":"The rise of multimodal large language models has introduced innovative human-machine interaction paradigms but also significant challenges in machine learning safety. Audio-Language Models (ALMs) are especially relevant due to the intuitive nature of spoken communication, yet little is known about their failure modes. This paper explores audio jailbreaks targeting ALMs, focusing on their ability to bypass alignment mechanisms. We construct adversarial perturbations that generalize across prompts, tasks, and even base audio samples, demonstrating the first universal jailbreaks in the audio moda"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.00718","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.00718/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.00718","created_at":"2026-07-05T11:34:46.973282+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.00718v2","created_at":"2026-07-05T11:34:46.973282+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.00718","created_at":"2026-07-05T11:34:46.973282+00:00"},{"alias_kind":"pith_short_12","alias_value":"4RGVVSUBNEI2","created_at":"2026-07-05T11:34:46.973282+00:00"},{"alias_kind":"pith_short_16","alias_value":"4RGVVSUBNEI2KMXC","created_at":"2026-07-05T11:34:46.973282+00:00"},{"alias_kind":"pith_short_8","alias_value":"4RGVVSUB","created_at":"2026-07-05T11:34:46.973282+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.30031","citing_title":"Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2505.15957","citing_title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20266","citing_title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","ref_index":166,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16659","citing_title":"Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6","json":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6.json","graph_json":"https://pith.science/api/pith-number/4RGVVSUBNEI2KMXCRGACOMYPI6/graph.json","events_json":"https://pith.science/api/pith-number/4RGVVSUBNEI2KMXCRGACOMYPI6/events.json","paper":"https://pith.science/paper/4RGVVSUB"},"agent_actions":{"view_html":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6","download_json":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6.json","view_paper":"https://pith.science/paper/4RGVVSUB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.00718&json=true","fetch_graph":"https://pith.science/api/pith-number/4RGVVSUBNEI2KMXCRGACOMYPI6/graph.json","fetch_events":"https://pith.science/api/pith-number/4RGVVSUBNEI2KMXCRGACOMYPI6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6/action/storage_attestation","attest_author":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6/action/author_attestation","sign_citation":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6/action/citation_signature","submit_replication":"https://pith.science/pith/4RGVVSUBNEI2KMXCRGACOMYPI6/action/replication_record"}},"created_at":"2026-07-05T11:34:46.973282+00:00","updated_at":"2026-07-05T11:34:46.973282+00:00"}