A Swin-Transformer + multi-scale conditional diffusion model with a frozen LLM layer predicts driver visual attention from single RGB frames and reports SOTA metrics on four public datasets.
Pre-trained llm is a semantic-aware and generalizable segmentation booster
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
DiffAttn: Diffusion-Based Drivers' Visual Attention Prediction with LLM-Enhanced Semantic Reasoning
A Swin-Transformer + multi-scale conditional diffusion model with a frozen LLM layer predicts driver visual attention from single RGB frames and reports SOTA metrics on four public datasets.