TraCeS factorizes a learned trajectory safety probability into per-timestep multiplicative scores and uses their log-sum as a constraint in PPO-Lagrangian, producing safe continuous-control policies without known costs or budgets.
Constrained policy optimization
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels
TraCeS factorizes a learned trajectory safety probability into per-timestep multiplicative scores and uses their log-sum as a constraint in PPO-Lagrangian, producing safe continuous-control policies without known costs or budgets.