A bidirectional vision-language-depth fusion model, OGRG, outperforms prior baselines in grounding and grasping objects described by spatial language, including with duplicate objects and weak grasp labels.
Visually grounding language instruction for history-dependent manipulation,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
contradiction 1
citation-polarity summary
fields
cs.RO 1years
2025 1verdicts
CONDITIONAL 1roles
contradiction 1polarities
contest 1representative citing papers
citing papers explorer
-
Attribute-based Object Grounding and Robot Grasp Detection with Spatial Reasoning
A bidirectional vision-language-depth fusion model, OGRG, outperforms prior baselines in grounding and grasping objects described by spatial language, including with duplicate objects and weak grasp labels.