A reinforcement learning fine-tuning method with dynamic reward thresholding lets diffusion motion planners directly optimize non-differentiable safety and goal-reaching metrics, improving collision rate and success rate on CrowdNav and ETH-UCY.
St-p3: End- to-end vision-based autonomous driving via spatial-temporal feature learning,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.RO 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
Non-differentiable Reward Optimization for Diffusion-based Autonomous Motion Planning
A reinforcement learning fine-tuning method with dynamic reward thresholding lets diffusion motion planners directly optimize non-differentiable safety and goal-reaching metrics, improving collision rate and success rate on CrowdNav and ETH-UCY.