Typographic attacks achieve 67.8% success in causing household robots to execute wrong manipulations via poisoned semantic maps in Habitat simulation.
SceneTAP: Scene-coherent typographic adversarial planner against vision-language models in real-world environments
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
years
2026 2verdicts
UNVERDICTED 2representative citing papers
Multimodal embedding distance predicts typographic attack success rate across VLMs, and optimizing it under bounded perturbations on surrogates exposes two co-occurring failure modes of lost readability and reduced safety refusals.
citing papers explorer
-
Not What You Asked For: Typographic Attacks in Household Robot Manipulation
Typographic attacks achieve 67.8% success in causing household robots to execute wrong manipulations via poisoned semantic maps in Habitat simulation.
-
One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations
Multimodal embedding distance predicts typographic attack success rate across VLMs, and optimizing it under bounded perturbations on surrogates exposes two co-occurring failure modes of lost readability and reduced safety refusals.