Pith. sign in

← back to paper

Review history

arxiv: 2602.00747 · 2 revisions

Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training

  1. 2026-08-03 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    205408 ms 19897 in 19768 out 2026-08-03T05:54:22.903058+00:00
  2. 2026-05-21 UNVERDICTED LOW v0.9.0 novelty 6.0
    40700 ms 5775 in 1372 out 2026-05-21T13:37:30.582635+00:00