VERGSA trains a process reward model on MCTS-labeled subtask outcomes and uses it to select scene configurations and subtask supervisions, improving simulated task success rates.
A survey on large language models for recommendation,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.RO 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Real-Time Verification of Embodied Reasoning for Generative Skill Acquisition
VERGSA trains a process reward model on MCTS-labeled subtask outcomes and uses it to select scene configurations and subtask supervisions, improving simulated task success rates.