Pith. sign in

A convergence analysis of gradient descent for deep linear neural networks

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it

fields

cs.LG 1

years

2025 1

verdicts

CONDITIONAL 1

representative citing papers

Training Dynamics of In-Context Learning in Linear Attention

cs.LG · 2025-01-27 · conditional · novelty 7.0

For in-context linear regression, merged key/query linear attention learns via one abrupt loss drop, while separate key/query attention learns via multiple drops, with each stage adding one principal component of the input distribution.

citing papers explorer

Showing 1 of 1 citing paper.

  • Training Dynamics of In-Context Learning in Linear Attention cs.LG · 2025-01-27 · conditional · none · ref 8

    For in-context linear regression, merged key/query linear attention learns via one abrupt loss drop, while separate key/query attention learns via multiple drops, with each stage adding one principal component of the input distribution.