HSIR improves self-improvement for LRMs via verify-then-exit sampling and intrinsic diversity scoring, delivering up to 10.9% performance gains and 42.4% lower inference overhead across post-training methods including H-GRPO.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
HSIR improves self-improvement for LRMs via verify-then-exit sampling and intrinsic diversity scoring, delivering up to 10.9% performance gains and 42.4% lower inference overhead across post-training methods including H-GRPO.