Pith. sign in

hub

Soft actor-critic for discrete action settings

11 Pith papers cite this work. Polarity classification is still indexing.

11 Pith papers citing it

hub tools

citation-role summary

background 1

citation-polarity summary

years

2026 7 2025 4

roles

background 1

polarities

background 1

representative citing papers

R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability

cs.LG · 2025-11-21 · unverdicted · novelty 7.0

R2PS combines a proof that dynamic programming remains optimal under asynchronous evader moves, a belief preservation mechanism for partial observability, and integration into equilibrium policy generalization to produce real-time pursuer policies that zero-shot generalize to unseen graphs.

Retry Policy Gradients in Continuous Action Spaces

cs.AI · 2026-06-04 · unverdicted · novelty 6.0

ReMAC applies pathwise estimators to retry objectives in continuous RL, reshaping gradients to increase policy entropy and matching SAC performance without explicit regularization.

Relative Entropy Pathwise Policy Optimization

cs.LG · 2025-07-15 · unverdicted · novelty 5.0

REPPO is an on-policy RL method that combines pathwise policy gradients with relative entropy constraints to achieve stable training and high sample efficiency without replay buffers.

citing papers explorer

Showing 11 of 11 citing papers.