A weak-to-strong training pipeline using MCTS-collected experiences and behavior-ratio distillation improves large LM planning on VirtualHome, with a 405B inference-time variant scoring 74.34 versus GPT-4o's 70.89.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Growing Through Experience: Scaling Episodic Grounding in Language Models
A weak-to-strong training pipeline using MCTS-collected experiences and behavior-ratio distillation improves large LM planning on VirtualHome, with a 405B inference-time variant scoring 74.34 versus GPT-4o's 70.89.