For the training dataset, we utilize dapo-math-17kacross all main experiments

framework · 2072 · arXiv 8689.5940

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it

representative citing papers

One-Way Policy Optimization for Self-Evolving LLMs

cs.LG · 2026-05-21 · unverdicted · novelty 5.0

OWPO decouples optimization direction from magnitude via asymmetric reweighting (Accelerated Alignment for inferior deviations, Gain Locking for superior) plus iterative references to create a ratchet effect for continuous LLM improvement.

citing papers explorer

Showing 1 of 1 citing paper.

One-Way Policy Optimization for Self-Evolving LLMs cs.LG · 2026-05-21 · unverdicted · none · ref 21
OWPO decouples optimization direction from magnitude via asymmetric reweighting (Accelerated Alignment for inferior deviations, Gain Locking for superior) plus iterative references to create a ratchet effect for continuous LLM improvement.

For the training dataset, we utilize dapo-math-17kacross all main experiments

fields

years

verdicts

representative citing papers

citing papers explorer