{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:RLZ7SN24P64GIS75SH7VNN2PXK","short_pith_number":"pith:RLZ7SN24","schema_version":"1.0","canonical_sha256":"8af3f9375c7fb8644bfd91ff56b74fbabef070b41d3273c0485bda648cfc399e","source":{"kind":"arxiv","id":"2410.01264","version":2},"attestation_state":"computed","paper":{"title":"Backdooring Vision-Language Models with Out-Of-Distribution Data","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chao Chen, Haibin Ling, Jiachen Yao, Lijie Hu, Lingjie Yi, Lu Pang, Saumya Gupta, Tao Sun, Weimin Lyu","submitted_at":"2024-10-02T06:21:00Z","abstract_excerpt":"The emergence of Vision-Language Models (VLMs) represents a significant advancement in integrating computer vision with Large Language Models (LLMs) to generate detailed text descriptions from visual inputs. Despite their growing importance, the security of VLMs, particularly against backdoor attacks, is under explored. Moreover, prior works often assume attackers have access to the original training data, which is often unrealistic. In this paper, we address a more practical and challenging scenario where attackers must rely solely on Out-Of-Distribution (OOD) data. We introduce VLOOD (Backdo"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.01264","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-02T06:21:00Z","cross_cats_sorted":[],"title_canon_sha256":"d9792e31a8e74644d816115aec329f9d2aaa3b1962267872d859e9e8a0ae4716","abstract_canon_sha256":"593fdc0aa35bdc9badbb9c4c96f8ab4d62c5d27dd7341659d7cc780b7a374784"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:21:23.608211Z","signature_b64":"Shx4NPEsc/Z0ZJzmw5ZaER/lI1iolCoWIHpZTtK5dl6qa+ZdvuxP3qS4ZLnvNlUvWaBcFPVQbIFLzHbrUEsJDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8af3f9375c7fb8644bfd91ff56b74fbabef070b41d3273c0485bda648cfc399e","last_reissued_at":"2026-07-05T10:21:23.607688Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:21:23.607688Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Backdooring Vision-Language Models with Out-Of-Distribution Data","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chao Chen, Haibin Ling, Jiachen Yao, Lijie Hu, Lingjie Yi, Lu Pang, Saumya Gupta, Tao Sun, Weimin Lyu","submitted_at":"2024-10-02T06:21:00Z","abstract_excerpt":"The emergence of Vision-Language Models (VLMs) represents a significant advancement in integrating computer vision with Large Language Models (LLMs) to generate detailed text descriptions from visual inputs. Despite their growing importance, the security of VLMs, particularly against backdoor attacks, is under explored. Moreover, prior works often assume attackers have access to the original training data, which is often unrealistic. In this paper, we address a more practical and challenging scenario where attackers must rely solely on Out-Of-Distribution (OOD) data. We introduce VLOOD (Backdo"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.01264","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.01264/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.01264","created_at":"2026-07-05T10:21:23.607746+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.01264v2","created_at":"2026-07-05T10:21:23.607746+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.01264","created_at":"2026-07-05T10:21:23.607746+00:00"},{"alias_kind":"pith_short_12","alias_value":"RLZ7SN24P64G","created_at":"2026-07-05T10:21:23.607746+00:00"},{"alias_kind":"pith_short_16","alias_value":"RLZ7SN24P64GIS75","created_at":"2026-07-05T10:21:23.607746+00:00"},{"alias_kind":"pith_short_8","alias_value":"RLZ7SN24","created_at":"2026-07-05T10:21:23.607746+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.19083","citing_title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","ref_index":165,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04488","citing_title":"A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK","json":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK.json","graph_json":"https://pith.science/api/pith-number/RLZ7SN24P64GIS75SH7VNN2PXK/graph.json","events_json":"https://pith.science/api/pith-number/RLZ7SN24P64GIS75SH7VNN2PXK/events.json","paper":"https://pith.science/paper/RLZ7SN24"},"agent_actions":{"view_html":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK","download_json":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK.json","view_paper":"https://pith.science/paper/RLZ7SN24","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.01264&json=true","fetch_graph":"https://pith.science/api/pith-number/RLZ7SN24P64GIS75SH7VNN2PXK/graph.json","fetch_events":"https://pith.science/api/pith-number/RLZ7SN24P64GIS75SH7VNN2PXK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK/action/storage_attestation","attest_author":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK/action/author_attestation","sign_citation":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK/action/citation_signature","submit_replication":"https://pith.science/pith/RLZ7SN24P64GIS75SH7VNN2PXK/action/replication_record"}},"created_at":"2026-07-05T10:21:23.607746+00:00","updated_at":"2026-07-05T10:21:23.607746+00:00"}