A reward-penalized TD3 policy generates counterfactual action sequences for continuous-action RL, evaluated on diabetes and Lunar Lander simulators.
Counterfactual explanations and algorithmic recourses for machine learning: A review.ACM Computing Surveys, 56(12):1–42,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Counterfactual Explanations for Continuous Action Reinforcement Learning
A reward-penalized TD3 policy generates counterfactual action sequences for continuous-action RL, evaluated on diabetes and Lunar Lander simulators.