Pith. sign in

Scaling laws for downstream task performance of large language models

4 Pith papers cite this work, alongside 3 external citations. Polarity classification is still indexing.

4 Pith papers citing it
3 external citations · external index

citation-role summary

background 1

citation-polarity summary

verdicts

UNVERDICTED 4

roles

background 1

polarities

background 1

representative citing papers

Optimization Hyper-parameter Laws for Large Language Models

cs.LG · 2024-09-07 · unverdicted · novelty 6.0

Opt-Laws predicts LLM final training loss from LR schedules via SDE-derived convergence and escape features, with 94% Top-2 hit rate on held-out schedules and F1=0.92 for divergence detection.

citing papers explorer

Showing 4 of 4 citing papers.