For diffusion model fine-tuning, RL value estimation reduces to a variational inequality whose solution satisfies a supervised-learning oracle inequality with self-mitigating statistical error.
A tail inequality for suprema of unbounded empirical processes with applications to markov chains
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Is RL fine-tuning harder than regression? A PDE learning approach for diffusion models
For diffusion model fine-tuning, RL value estimation reduces to a variational inequality whose solution satisfies a supervised-learning oracle inequality with self-mitigating statistical error.