Pith. sign in

Autoscale: Scale-aware data mixing for pre-training llms.arXiv preprint arXiv:2407.20177

6 Pith papers cite this work. Polarity classification is still indexing.

6 Pith papers citing it

fields

cs.LG 5 cs.CV 1

years

2026 6

representative citing papers

Capacity-Aware Mixture Law Enables Efficient LLM Data Optimization

cs.LG · 2026-03-09 · unverdicted · novelty 6.0

CAMEL is a scaling law capturing nonlinear model-size and mixture interactions to extrapolate optimal data mixtures for large LLMs from small-model experiments, reducing optimization cost by 50% and improving benchmarks by up to 3%.

TANDEM: Bi-Level Data Mixture Optimization with Twin Networks

cs.LG · 2026-06-03 · unverdicted · novelty 5.0

TANDEM solves bi-level data mixture optimization for LLMs via twin proxy and reference networks that measure domain efficacy by model difference and up-weight beneficial domains, with claimed theoretical guarantees and gains in restricted-data and SFT settings.

citing papers explorer

Showing 6 of 6 citing papers.