{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:B52IEHECSQZUIM3P76WIT6EF3G","short_pith_number":"pith:B52IEHEC","schema_version":"1.0","canonical_sha256":"0f74821c82943344336fffac89f885d9bf5b0d22a6122c5b31a120586eb6cdab","source":{"kind":"arxiv","id":"2407.02534","version":2},"attestation_state":"computed","paper":{"title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.CR","authors_text":"Ke Li, Xiaotian Zou, Yongkang Chen","submitted_at":"2024-07-01T16:58:55Z","abstract_excerpt":"Large Visual Language Model\\textbfs (VLMs) such as GPT-4V have achieved remarkable success in generating comprehensive and nuanced responses. Researchers have proposed various benchmarks for evaluating the capabilities of VLMs. With the integration of visual and text inputs in VLMs, new security issues emerge, as malicious attackers can exploit multiple modalities to achieve their objectives. This has led to increasing attention on the vulnerabilities of VLMs to jailbreak. Most existing research focuses on generating adversarial images or nonsensical image to jailbreak these models. However, n"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.02534","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CR","submitted_at":"2024-07-01T16:58:55Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"068555d0fd344cc48026318917791798ecb69aab3258160955f865583c8384c6","abstract_canon_sha256":"efd8cb9217e0cea421f4dd7852b23c8ff2ecd87ed193e0f835247fc347007017"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:59:31.352878Z","signature_b64":"Q7E2y6OIsC7sPRvxaT3QSqXBNFRNKAxBCvpZtU9R7QAmqd94P8qTX0lXdWI8Y3UvTfht4A6noble5lr6C38tBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0f74821c82943344336fffac89f885d9bf5b0d22a6122c5b31a120586eb6cdab","last_reissued_at":"2026-07-05T08:59:31.352436Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:59:31.352436Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.CR","authors_text":"Ke Li, Xiaotian Zou, Yongkang Chen","submitted_at":"2024-07-01T16:58:55Z","abstract_excerpt":"Large Visual Language Model\\textbfs (VLMs) such as GPT-4V have achieved remarkable success in generating comprehensive and nuanced responses. Researchers have proposed various benchmarks for evaluating the capabilities of VLMs. With the integration of visual and text inputs in VLMs, new security issues emerge, as malicious attackers can exploit multiple modalities to achieve their objectives. This has led to increasing attention on the vulnerabilities of VLMs to jailbreak. Most existing research focuses on generating adversarial images or nonsensical image to jailbreak these models. However, n"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.02534","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.02534/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.02534","created_at":"2026-07-05T08:59:31.352491+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.02534v2","created_at":"2026-07-05T08:59:31.352491+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.02534","created_at":"2026-07-05T08:59:31.352491+00:00"},{"alias_kind":"pith_short_12","alias_value":"B52IEHECSQZU","created_at":"2026-07-05T08:59:31.352491+00:00"},{"alias_kind":"pith_short_16","alias_value":"B52IEHECSQZUIM3P","created_at":"2026-07-05T08:59:31.352491+00:00"},{"alias_kind":"pith_short_8","alias_value":"B52IEHEC","created_at":"2026-07-05T08:59:31.352491+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.13213","citing_title":"Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning","ref_index":49,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G","json":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G.json","graph_json":"https://pith.science/api/pith-number/B52IEHECSQZUIM3P76WIT6EF3G/graph.json","events_json":"https://pith.science/api/pith-number/B52IEHECSQZUIM3P76WIT6EF3G/events.json","paper":"https://pith.science/paper/B52IEHEC"},"agent_actions":{"view_html":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G","download_json":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G.json","view_paper":"https://pith.science/paper/B52IEHEC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.02534&json=true","fetch_graph":"https://pith.science/api/pith-number/B52IEHECSQZUIM3P76WIT6EF3G/graph.json","fetch_events":"https://pith.science/api/pith-number/B52IEHECSQZUIM3P76WIT6EF3G/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G/action/timestamp_anchor","attest_storage":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G/action/storage_attestation","attest_author":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G/action/author_attestation","sign_citation":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G/action/citation_signature","submit_replication":"https://pith.science/pith/B52IEHECSQZUIM3P76WIT6EF3G/action/replication_record"}},"created_at":"2026-07-05T08:59:31.352491+00:00","updated_at":"2026-07-05T08:59:31.352491+00:00"}