A hierarchical teaching algorithm selects complementary environments and feedback modalities to learn reward functions that generalize across unseen MDPs, proving that single-environment teaching leaves structural reward ambiguity.
Title resolution pending
1 Pith paper cite this work, alongside 40 external citations. Polarity classification is still indexing.
1
Pith paper citing it
40
external citations · OpenAlex
fields
cs.LG 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning
A hierarchical teaching algorithm selects complementary environments and feedback modalities to learn reward functions that generalize across unseen MDPs, proving that single-environment teaching leaves structural reward ambiguity.