Pith. sign in

Lessons on parameter sharing across layers in transformers

4 Pith papers cite this work, alongside 24 external citations. Polarity classification is still indexing.

4 Pith papers citing it
24 external citations · external index

years

2026 2 2025 2

representative citing papers

Scaling Latent Reasoning via Looped Language Models

cs.CL · 2025-10-29 · conditional · novelty 5.0

A 1.4B and a 2.6B looped (weight-tied, recurrent-depth) language model trained on 7.7T tokens match or exceed several 4B–8B transformer baselines on selected reasoning benchmarks.

citing papers explorer

Showing 4 of 4 citing papers.