A fine-tuned BLIP model with hierarchical question skipping achieves 423 ms average inference for driving scene description, with GPT-evaluated scores of 65 to 79, near GPT-4o's 77.
Spherical transformer for lidar-based 3d recognition,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
A fine-tuned BLIP model with hierarchical question skipping achieves 423 ms average inference for driving scene description, with GPT-evaluated scores of 65 to 79, near GPT-4o's 77.