NFDRL models return distributions via continuous normalizing flows paired with a geometry-aware Cramér surrogate distance, delivering fixed-size parameters, a sqrt(gamma) contraction, unbiased gradients, and competitive Atari-5 performance.
Title resolution pending
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
verdicts
UNVERDICTED 2representative citing papers
The paper introduces ANPS and SV-PPO to enable larger target policy updates in deep RL by approximating the next policy's visitation distribution during value function training.
citing papers explorer
-
Parameter-Efficient Distributional RL via Normalizing Flows and a Geometry-Aware Cram\'er Surrogate
NFDRL models return distributions via continuous normalizing flows paired with a geometry-aware Cramér surrogate distance, delivering fixed-size parameters, a sqrt(gamma) contraction, unbiased gradients, and competitive Atari-5 performance.
-
Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL
The paper introduces ANPS and SV-PPO to enable larger target policy updates in deep RL by approximating the next policy's visitation distribution during value function training.