Pith. sign in

Klear-reasoner: Advancing reasoning capability via gradient-preserving clipping policy optimization.arXiv preprint arXiv:2508.07629

13 Pith papers cite this work, alongside 1 external citations. Polarity classification is still indexing.

13 Pith papers citing it
1 external citations · external index

citation-role summary

background 1 method 1

citation-polarity summary

years

2026 10 2025 3

polarities

background 2

representative citing papers

APPO: Agentic Procedural Policy Optimization

cs.LG · 2026-06-10 · conditional · novelty 5.0

APPO improves LLM agent training by branching at tokens selected for both uncertainty and future impact, then scaling credit for consequential reasoning procedures.

Ratio-Variance Regularized Policy Optimization

cs.LG · 2026-05-26 · unverdicted · novelty 5.0

R²VPO uses ratio-variance regularization as a distributional soft brake on policy updates, claiming better performance than PPO on math reasoning and robotic control without hard clipping.

OneRec-V2 Technical Report

cs.IR · 2025-08-28 · unverdicted · novelty 5.0

OneRec-V2 scales generative recommendation to 8B parameters via decoder-only design and real-world preference alignment, improving user engagement metrics in production A/B tests.

citing papers explorer

Showing 13 of 13 citing papers.