A fine-tuned BLIP model with hierarchical question skipping achieves 423 ms average inference for driving scene description, with GPT-evaluated scores of 65 to 79, near GPT-4o's 77.
Rea- son2drive: Towards interpretable and chain-based reasoning for au- tonomous driving,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
A fine-tuned BLIP model with hierarchical question skipping achieves 423 ms average inference for driving scene description, with GPT-evaluated scores of 65 to 79, near GPT-4o's 77.