DARAIL transfers a DARC-trained policy from a source domain to a target domain via importance-weighted imitation learning from observation, with a reward-augmented estimator.
Sim-to-real interactive recommendation via off-dynamics reinforcement learning
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2024 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation
DARAIL transfers a DARC-trained policy from a source domain to a target domain via importance-weighted imitation learning from observation, with a reward-augmented estimator.