← back to paper
arxiv: 2506.18985 · 2 revisions
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models