VLN-R1 shows that a Qwen2-VL model trained with supervised fine-tuning plus GRPO-based reinforcement fine-tuning can navigate continuous indoor environments from egocentric video, improving success rate on VLN-CE R2R and RxR benchmarks over its own SFT baselines.
Mapgpt: Map-guided prompting for unified vision-and-language navigation
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
VLN-R1 shows that a Qwen2-VL model trained with supervised fine-tuning plus GRPO-based reinforcement fine-tuning can navigate continuous indoor environments from egocentric video, improving success rate on VLN-CE R2R and RxR benchmarks over its own SFT baselines.