{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:N7RKEAMC55AL5ZFLVGXGP5P5J3","short_pith_number":"pith:N7RKEAMC","schema_version":"1.0","canonical_sha256":"6fe2a20182ef40bee4aba9ae67f5fd4eec32c97857356c14ca58f5ab974016b2","source":{"kind":"arxiv","id":"2311.05608","version":3},"attestation_state":"computed","paper":{"title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CR","authors_text":"Anyu Wang, Conglei Wang, Delong Ran, Jinyuan Liu, SiSi Duan, Tianshuo Cong, Xiaoyun Wang, Yichen Gong","submitted_at":"2023-11-09T18:59:11Z","abstract_excerpt":"Large Vision-Language Models (LVLMs) signify a groundbreaking paradigm shift within the Artificial Intelligence (AI) community, extending beyond the capabilities of Large Language Models (LLMs) by assimilating additional modalities (e.g., images). Despite this advancement, the safety of LVLMs remains adequately underexplored, with a potential overreliance on the safety assurances purported by their underlying LLMs. In this paper, we propose FigStep, a straightforward yet effective black-box jailbreak algorithm against LVLMs. Instead of feeding textual harmful instructions directly, FigStep con"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.05608","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2023-11-09T18:59:11Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"4ec9b2ec1fe0b2a0fa8e7cf9cb2dbe36fd72e63d417c79582a4c8ef7e29d709a","abstract_canon_sha256":"48e395afe9b1dab09f4d6f88069fffdcb11e5b607045ecf57f7c3bdf4793729f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:02:42.173606Z","signature_b64":"8M/LDj1RFCXKBB10Yzu7qYIMrVsAdAWJ9FAntwTXCsEDswUewuyFa1qYFLmUHGQ/dtvrDT0clDYbvtq0eHF2BA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6fe2a20182ef40bee4aba9ae67f5fd4eec32c97857356c14ca58f5ab974016b2","last_reissued_at":"2026-07-05T10:02:42.172895Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:02:42.172895Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CR","authors_text":"Anyu Wang, Conglei Wang, Delong Ran, Jinyuan Liu, SiSi Duan, Tianshuo Cong, Xiaoyun Wang, Yichen Gong","submitted_at":"2023-11-09T18:59:11Z","abstract_excerpt":"Large Vision-Language Models (LVLMs) signify a groundbreaking paradigm shift within the Artificial Intelligence (AI) community, extending beyond the capabilities of Large Language Models (LLMs) by assimilating additional modalities (e.g., images). Despite this advancement, the safety of LVLMs remains adequately underexplored, with a potential overreliance on the safety assurances purported by their underlying LLMs. In this paper, we propose FigStep, a straightforward yet effective black-box jailbreak algorithm against LVLMs. Instead of feeding textual harmful instructions directly, FigStep con"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.05608","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.05608/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.05608","created_at":"2026-07-05T10:02:42.173198+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.05608v3","created_at":"2026-07-05T10:02:42.173198+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.05608","created_at":"2026-07-05T10:02:42.173198+00:00"},{"alias_kind":"pith_short_12","alias_value":"N7RKEAMC55AL","created_at":"2026-07-05T10:02:42.173198+00:00"},{"alias_kind":"pith_short_16","alias_value":"N7RKEAMC55AL5ZFL","created_at":"2026-07-05T10:02:42.173198+00:00"},{"alias_kind":"pith_short_8","alias_value":"N7RKEAMC","created_at":"2026-07-05T10:02:42.173198+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09125","citing_title":"Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26566","citing_title":"Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2408.12935","citing_title":"AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions","ref_index":261,"is_internal_anchor":false},{"citing_arxiv_id":"2502.01241","citing_title":"Peering Behind the Shield: Guardrail Identification in Large Language Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2503.06223","citing_title":"RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2407.04295","citing_title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10582","citing_title":"Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25102","citing_title":"One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01449","citing_title":"VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07754","citing_title":"The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3","json":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3.json","graph_json":"https://pith.science/api/pith-number/N7RKEAMC55AL5ZFLVGXGP5P5J3/graph.json","events_json":"https://pith.science/api/pith-number/N7RKEAMC55AL5ZFLVGXGP5P5J3/events.json","paper":"https://pith.science/paper/N7RKEAMC"},"agent_actions":{"view_html":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3","download_json":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3.json","view_paper":"https://pith.science/paper/N7RKEAMC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.05608&json=true","fetch_graph":"https://pith.science/api/pith-number/N7RKEAMC55AL5ZFLVGXGP5P5J3/graph.json","fetch_events":"https://pith.science/api/pith-number/N7RKEAMC55AL5ZFLVGXGP5P5J3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3/action/storage_attestation","attest_author":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3/action/author_attestation","sign_citation":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3/action/citation_signature","submit_replication":"https://pith.science/pith/N7RKEAMC55AL5ZFLVGXGP5P5J3/action/replication_record"}},"created_at":"2026-07-05T10:02:42.173198+00:00","updated_at":"2026-07-05T10:02:42.173198+00:00"}