ReLAR uses reinforcement-guided latent refinement with adaptive controllers to improve LLM reasoning accuracy and stability at lower inference cost than explicit reasoning methods.
Reasoning with latent thoughts.arXiv preprint arXiv:2305.17007,
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
verdicts
UNVERDICTED 2representative citing papers
Dual-head knowledge distillation partitions the linear classifier into separate heads for logit and probability losses to exploit logits without causing classification head collapse.
citing papers explorer
-
Learning to Refine Hidden States for Reliable LLM Reasoning
ReLAR uses reinforcement-guided latent refinement with adaptive controllers to improve LLM reasoning accuracy and stability at lower inference cost than explicit reasoning methods.
-
Dual-Head Knowledge Distillation: Enhancing Logits Utilization with an Auxiliary Head
Dual-head knowledge distillation partitions the linear classifier into separate heads for logit and probability losses to exploit logits without causing classification head collapse.