RASLIK uses randomized antipodal search on linearized influence kernels to achieve data Pareto improvement in LLM unlearning, outperforming baselines with sublinear complexity and double gains in quality and efficiency.
Simpo: Simple preference optimization with a reference-free reward
4 Pith papers cite this work. Polarity classification is still indexing.
verdicts
UNVERDICTED 4representative citing papers
HAPO is a new token-level policy optimization method for LLMs that continuously adapts four optimization stages using entropy, claiming consistent gains over DAPO on math, code, and logic tasks.
The authors extend generative quantum eigensolver to produce circuits with upper-bounded quantum circuit-cutting overhead for molecular ground-state search, tested via transformer decoder on BeH2 with a new loss function and hybrid training strategy.
A survey deriving a unified policy gradient framework for LLM post-training methods and providing technical comparisons of PPO, GRPO, DPO variants.
citing papers explorer
-
Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning
RASLIK uses randomized antipodal search on linearized influence kernels to achieve data Pareto improvement in LLM unlearning, outperforming baselines with sublinear complexity and double gains in quality and efficiency.
-
Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature
HAPO is a new token-level policy optimization method for LLMs that continuously adapts four optimization stages using entropy, claiming consistent gains over DAPO on math, code, and logic tasks.
-
Generative quantum eigensolver with constrained circuit-cutting overhead
The authors extend generative quantum eigensolver to produce circuits with upper-bounded quantum circuit-cutting overhead for molecular ground-state search, tested via transformer decoder on BeH2 with a new loss function and hybrid training strategy.
-
Reinforcement Learning for LLM Post-Training: A Survey
A survey deriving a unified policy gradient framework for LLM post-training methods and providing technical comparisons of PPO, GRPO, DPO variants.