A new benchmark shows that IPPO, a standard MARL algorithm, cannot reliably infer a partner's changing goal from its actions alone.
Basis for intentions: Efficient inverse reinforcement learning using past experience, 2022
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.AI 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
ColorGrid: A Multi-Agent Non-Stationary Environment for Goal Inference and Assistance
A new benchmark shows that IPPO, a standard MARL algorithm, cannot reliably infer a partner's changing goal from its actions alone.