New Bellman equations produce composable option kernels that track goal-success and constraint-failure events, enabling reward-free planning.
[29] We start by defining the block matrix for the policy dynamics as an absorbing Markov chain
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
A Unified Theory of Compositionality, Modularity, and Interpretability in Markov Decision Processes
New Bellman equations produce composable option kernels that track goal-success and constraint-failure events, enabling reward-free planning.