SpatialPrompting shows that keyframe selection plus camera-pose prompting can make a pre-trained multimodal LLM competitive on 3D question answering without 3D-specific fine-tuning.
Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
SpatialPrompting shows that keyframe selection plus camera-pose prompting can make a pre-trained multimodal LLM competitive on 3D question answering without 3D-specific fine-tuning.