Pith. sign in

Mixed citations

Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675

Mixed citation behavior. Most common role is background (50%).

9 Pith papers citing it
Background 50% of classified citations

citation-role summary

background 4 baseline 1 other 1

citation-polarity summary

years

2026 9

verdicts

UNVERDICTED 9

representative citing papers

Epistemic Uncertainty for Test-Time Discovery

cs.LG · 2026-05-11 · unverdicted · novelty 6.0

UG-TTT adds epistemic uncertainty measured by adapter disagreement as an exploration bonus in RL for LLMs, raising maximum reward and diversity on scientific discovery benchmarks.

Calibration-Aware Policy Optimization for Reasoning LLMs

cs.LG · 2026-04-14 · unverdicted · novelty 6.0

CAPO improves LLM calibration by up to 15% while matching or exceeding GRPO accuracy through logistic AUC loss and noise masking, enabling better abstention and scaling performance.

citing papers explorer

Showing 9 of 9 citing papers.