The authors build a multi-view 3D QA benchmark and a 1M-triplet 2D-3D-text pretraining corpus, and show a model trained on them achieves state-of-the-art results on several 3D vision-language benchmarks.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset
The authors build a multi-view 3D QA benchmark and a 1M-triplet 2D-3D-text pretraining corpus, and show a model trained on them achieves state-of-the-art results on several 3D vision-language benchmarks.