The paper proposes an off-policy adversarial IRL method on augmented delayed states and claims, via a Lipschitz bound and MuJoCo experiments, that this outperforms IRL on raw delayed observations.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2024 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Inverse Delayed Reinforcement Learning
The paper proposes an off-policy adversarial IRL method on augmented delayed states and claims, via a Lipschitz bound and MuJoCo experiments, that this outperforms IRL on raw delayed observations.