A reward-penalized TD3 policy generates counterfactual action sequences for continuous-action RL, evaluated on diabetes and Lunar Lander simulators.
Explaining reinforcement learning agents through counterfactual action outcomes
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Counterfactual Explanations for Continuous Action Reinforcement Learning
A reward-penalized TD3 policy generates counterfactual action sequences for continuous-action RL, evaluated on diabetes and Lunar Lander simulators.