{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:YAPS373RSXNGCFULBW6BA6QYWU","short_pith_number":"pith:YAPS373R","schema_version":"1.0","canonical_sha256":"c01f2dff7195da61168b0dbc107a18b53106812df7242f98efbe9ffab4a27082","source":{"kind":"arxiv","id":"2404.19287","version":3},"attestation_state":"computed","paper":{"title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Badong Chen, Danilo P. Mandic, Qibin Zhao, Shuanghao Bai, Wanqi Zhou","submitted_at":"2024-04-30T06:34:21Z","abstract_excerpt":"Pretrained vision-language models (VLMs) like CLIP exhibit exceptional generalization across diverse downstream tasks. While recent studies reveal their vulnerability to adversarial attacks, research to date has primarily focused on enhancing the robustness of image encoders against image-based attacks, with defenses against text-based and multimodal attacks remaining largely unexplored. To this end, this work presents the first comprehensive study on improving the adversarial robustness of VLMs against attacks targeting image, text, and multimodal inputs. This is achieved by proposing multimo"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.19287","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-04-30T06:34:21Z","cross_cats_sorted":[],"title_canon_sha256":"7c893851de00fc9fb2007be823d52d8e683a07e310f666d6ebd209473dbab47c","abstract_canon_sha256":"cdc131bf332d2eb4aaa1e113f2e62441e3b448dbdb7e6875073408c20b4129ae"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:34:13.337661Z","signature_b64":"0qXA6KyraP1tVwsYx7yrYsebS2oKwuP7guyuUWLR78cxgoFrhRs5Pponw8T0mcz6AjKxr20d1VSKLTZYsjd/DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c01f2dff7195da61168b0dbc107a18b53106812df7242f98efbe9ffab4a27082","last_reissued_at":"2026-07-05T09:34:13.337182Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:34:13.337182Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Badong Chen, Danilo P. Mandic, Qibin Zhao, Shuanghao Bai, Wanqi Zhou","submitted_at":"2024-04-30T06:34:21Z","abstract_excerpt":"Pretrained vision-language models (VLMs) like CLIP exhibit exceptional generalization across diverse downstream tasks. While recent studies reveal their vulnerability to adversarial attacks, research to date has primarily focused on enhancing the robustness of image encoders against image-based attacks, with defenses against text-based and multimodal attacks remaining largely unexplored. To this end, this work presents the first comprehensive study on improving the adversarial robustness of VLMs against attacks targeting image, text, and multimodal inputs. This is achieved by proposing multimo"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.19287","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.19287/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.19287","created_at":"2026-07-05T09:34:13.337245+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.19287v3","created_at":"2026-07-05T09:34:13.337245+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.19287","created_at":"2026-07-05T09:34:13.337245+00:00"},{"alias_kind":"pith_short_12","alias_value":"YAPS373RSXNG","created_at":"2026-07-05T09:34:13.337245+00:00"},{"alias_kind":"pith_short_16","alias_value":"YAPS373RSXNGCFUL","created_at":"2026-07-05T09:34:13.337245+00:00"},{"alias_kind":"pith_short_8","alias_value":"YAPS373R","created_at":"2026-07-05T09:34:13.337245+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.28609","citing_title":"JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2502.05206","citing_title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","ref_index":243,"is_internal_anchor":false},{"citing_arxiv_id":"2509.15435","citing_title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17577","citing_title":"TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2509.15435","citing_title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13213","citing_title":"Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03117","citing_title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","ref_index":16,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU","json":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU.json","graph_json":"https://pith.science/api/pith-number/YAPS373RSXNGCFULBW6BA6QYWU/graph.json","events_json":"https://pith.science/api/pith-number/YAPS373RSXNGCFULBW6BA6QYWU/events.json","paper":"https://pith.science/paper/YAPS373R"},"agent_actions":{"view_html":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU","download_json":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU.json","view_paper":"https://pith.science/paper/YAPS373R","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.19287&json=true","fetch_graph":"https://pith.science/api/pith-number/YAPS373RSXNGCFULBW6BA6QYWU/graph.json","fetch_events":"https://pith.science/api/pith-number/YAPS373RSXNGCFULBW6BA6QYWU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU/action/storage_attestation","attest_author":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU/action/author_attestation","sign_citation":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU/action/citation_signature","submit_replication":"https://pith.science/pith/YAPS373RSXNGCFULBW6BA6QYWU/action/replication_record"}},"created_at":"2026-07-05T09:34:13.337245+00:00","updated_at":"2026-07-05T09:34:13.337245+00:00"}