A policy-gradient method for POMDPs that jointly maximizes temporal-logic task satisfaction and minimizes conditional entropy about a secret automaton state, using observable operators for gradient computation.
Counterexample-Guided Strategy Improvement for POMDPs Using Recurrent Neural Networks,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
eess.SY 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Integrated Control and Active Perception in POMDPs for Temporal Logic Tasks and Information Acquisition
A policy-gradient method for POMDPs that jointly maximizes temporal-logic task satisfaction and minimizes conditional entropy about a secret automaton state, using observable operators for gradient computation.