{"as_of":"2026-08-07T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33835b6e4c0fe27633c891f0e63aae2167fcb7d3ac74a0df724bcef89ca994c4","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:39:03.472216Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:13:36.440752Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T20:15:04.536047Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"cited_work":{"arxiv_id":"2510.03164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03164","snapshot_observed_at":"2026-06-30T20:15:04.536047Z","title":"Why do we need warm-up? a theoretical perspective","venue":"cs.LG","work_id":"1ee00bc4-4dda-4393-ac9d-1789d488c93f","year":2025},"citing_paper":{"arxiv_id":"2605.07977","last_updated":"2026-05-08T16:35:42Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T16:35:42Z","title":"Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning with Real-Time Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:15:57.763495Z"},"links":{"cited_paper":"/paper/2510.03164","citing_paper":"/paper/2605.07977"},"observation_digest":"sha256:0bdfc8980db39e560dbfe4afb411a46e2a574d03f0fb499d0641ec9371e3acf1","observation_id":"91e5ed69-2867-42ed-bbba-e29abcf80be0","resolution":{"observed_at":"2026-06-30T02:16:10.224205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"cited_work":{"arxiv_id":"2510.03164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03164","snapshot_observed_at":"2026-06-30T20:15:04.536047Z","title":"Why do we need warm-up? a theoretical perspective","venue":"cs.LG","work_id":"1ee00bc4-4dda-4393-ac9d-1789d488c93f","year":2025},"citing_paper":{"arxiv_id":"2605.14800","last_updated":"2026-05-26T16:52:56Z","snapshot_observed_at":"2026-08-02T08:25:06.796177Z","submitted_at":"2026-05-14T13:09:48Z","title":"Avoiding Bias in Clipped SGD for Overparameterized Models under Generalized Smoothness","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-30T20:13:36.440752Z"},"links":{"cited_paper":"/paper/2510.03164","citing_paper":"/paper/2605.14800"},"observation_digest":"sha256:6160664b2607fe4a5b1627bc33f968b633afd640781004b0ffe7bc1a77058d58","observation_id":"c2ce85ae-8831-4397-8cca-f6e072d2affe","resolution":{"observed_at":"2026-06-30T20:15:04.538172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.03164/citation-record","integrity":"/paper/2510.03164/integrity","json":"/paper/2510.03164/citation-record.json","paper":"/paper/2510.03164"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:52.774743Z","title":"plainlm: Language model pretraining in pytorch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:52.774743Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:fc5babfd6ae76186e68e003d5aaf6ccc4522614a8e702712757575eaa75ef2f4","observation_id":"728eded1-397e-4d7f-8e45-3cc1e04f527b","resolution":{"observed_at":"2026-08-04T12:38:52.774743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:52.939248Z","title":"vision: Vision model pretraining in pytorch","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:52.939248Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:1181d9c4c5cfa13248b28e020c1252df8c8a5c63776d4172bf72325ba152a371","observation_id":"62a51332-e1c6-4389-b70f-fc7e06fd687a","resolution":{"observed_at":"2026-08-04T12:38:52.939248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:53.057902Z","title":"Benefits of learning rate annealing for tuning-robustness in stochastic optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.057902Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:f735aabf3fdfea2d44dc5f3841626efa507415afa9da759764e745f5cf206eba","observation_id":"431fc2e4-8aa5-48a6-ad74-3cd69f9691da","resolution":{"observed_at":"2026-08-04T12:38:53.057902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T12:38:53.264531Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.264531Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:45a5846c8014978b6dd88c81915ad255904854579fcce62fbdca7de7d94583d1","observation_id":"149fb9d5-ab9c-4174-9e23-7fbde6b68020","resolution":{"observed_at":"2026-08-04T12:38:53.264531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08819","last_updated":"2017-08-23T16:06:20Z","snapshot_observed_at":"2026-07-06T05:52:59.445968Z","submitted_at":"2017-07-27T11:22:22Z","title":"A Downsampled Variant of ImageNet as an Alternative to the CIFAR datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08819","snapshot_observed_at":"2026-08-04T12:38:53.411038Z","title":"A downsampled variant of imagenet as an alternative to the cifar datasets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.411038Z"},"links":{"cited_paper":"/paper/1707.08819","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:d575cd095abd4b56ed40dec5a6b2ff3aba19ea5196785a6c2fb05a8d2b3239e8","observation_id":"a889a417-0937-40e6-a32c-1016652dc328","resolution":{"observed_at":"2026-08-04T12:38:53.411038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00181","last_updated":"2026-05-22T19:40:10Z","snapshot_observed_at":"2026-08-07T12:08:26.635752Z","submitted_at":"2025-05-30T19:35:15Z","title":"On the Interaction of Batch Noise, Adaptivity, and Compression, under $(L_0,L_1)$-Smoothness: An SDE Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00181","snapshot_observed_at":"2026-08-04T12:38:53.610360Z","title":"On the interaction of noise, compression role, and adaptivity under (l\\_0, l\\_1) -smoothness: An sde-based approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.610360Z"},"links":{"cited_paper":"/paper/2506.00181","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:81d8b12cf78d5f24490c98a2f841ca5bc8d62d722a2c6744736dea4bef88cce3","observation_id":"e74688c1-4fe4-4611-9377-81ff0ab82c92","resolution":{"observed_at":"2026-08-04T12:38:53.610360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-07T11:24:41.113349Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-04T12:38:53.777630Z","title":"Why gradients rapidly increase near the end of training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.777630Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:e32cb2eee88850fa20a3cdae0863f775d15854d398e5b55125153b77d3e99bb2","observation_id":"57c806d0-96f4-4a92-99f6-aedbce155fcc","resolution":{"observed_at":"2026-08-04T12:38:53.777630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07831","last_updated":"2024-10-29T22:57:44Z","snapshot_observed_at":"2026-08-04T12:23:38.852681Z","submitted_at":"2023-10-11T19:16:35Z","title":"Optimal Linear Decay Learning Rate Schedules and Further Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07831","snapshot_observed_at":"2026-08-04T12:38:53.947945Z","title":"Optimal linear decay learning rate schedules and further refinements","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.947945Z"},"links":{"cited_paper":"/paper/2310.07831","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:9de83b4960c2fec7cf6a1cd328a0d269f4fda18af54a19f6ffd5568555478fbc","observation_id":"e1bde069-6bd4-47e7-9f02-85ea680d3b84","resolution":{"observed_at":"2026-08-04T12:38:53.947945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T12:38:54.083987Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:54.083987Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:db996d2f11ae6a0cef36b25c3156c8e99537691399a366fc761aa5c44780d84f","observation_id":"184c32fa-1ef5-4c17-a20f-3776cb854a4e","resolution":{"observed_at":"2026-08-04T12:38:54.083987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01483","last_updated":"2025-08-02T20:36:52Z","snapshot_observed_at":"2026-08-06T05:51:21.591740Z","submitted_at":"2025-08-02T20:36:52Z","title":"Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01483","snapshot_observed_at":"2026-08-04T12:38:54.214964Z","title":"Training dynamics of the cooldown stage in warmup-stable-decay learning rate scheduler","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:54.214964Z"},"links":{"cited_paper":"/paper/2508.01483","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:8f8b983edf17835c6790e625939cc0aaf401829084e3ff4842dee56e249c80d3","observation_id":"a5ed8a55-fe3a-47d2-8dbc-4f922557ea2f","resolution":{"observed_at":"2026-08-04T12:38:54.214964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:54.348591Z","title":"Algorithmic regularization in learning deep homogeneous models: Layers are automatically balanced","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:54.348591Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:47c30adc4d3461501a6f58f3ee3918c698742c55f48777f332095e9e15729165","observation_id":"70b39ca0-925c-4eb8-8faa-2bdc87902b32","resolution":{"observed_at":"2026-08-04T12:38:54.348591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:54.532210Z","title":"Beyond uniform smoothness: A stopped analysis of adaptive sgd","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:54.532210Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:3b1d71a05ed100403da40a6c1f7148092773bcff3811de7c61682b4cbb98947a","observation_id":"7d1f73df-10a9-4d79-b227-7833a31e70a4","resolution":{"observed_at":"2026-08-04T12:38:54.532210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:54.667724Z","title":"Accelerated stochastic optimization methods under quasar-convexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:54.667724Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:8eb7926b9c0ab610a7ef790c28855dfd04445b9c45616144e8ffa3f249e8d696","observation_id":"9e70ac17-cdb1-4ac4-b931-0c8ea7a2d36d","resolution":{"observed_at":"2026-08-04T12:38:54.667724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16492","last_updated":"2025-06-03T10:31:26Z","snapshot_observed_at":"2026-07-06T20:41:10.605469Z","submitted_at":"2025-02-23T08:09:42Z","title":"Convergence of Clipped SGD on Convex $(L_0,L_1)$-Smooth Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16492","snapshot_observed_at":"2026-08-04T12:38:54.874128Z","title":"Convergence of clipped sgd on convex (l\\_0, l\\_1) -smooth functions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:54.874128Z"},"links":{"cited_paper":"/paper/2502.16492","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:ca833377810bd6ca43bc4899821a5beb0044e2082b55ffaa2d60b1958fac18b0","observation_id":"491f06aa-614d-407b-b324-f5fd86136d8c","resolution":{"observed_at":"2026-08-04T12:38:54.874128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04369","last_updated":"2021-10-08T20:25:48Z","snapshot_observed_at":"2026-07-06T11:56:00.533330Z","submitted_at":"2021-10-08T20:25:48Z","title":"A Loss Curvature Perspective on Training Instability in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04369","snapshot_observed_at":"2026-08-04T12:38:55.058339Z","title":"A loss curvature perspective on training instability in deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.058339Z"},"links":{"cited_paper":"/paper/2110.04369","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:29a23e719e3f161e071e2f26ce8a3f33e8c77542d989e21a2f8c99ec08e84e6b","observation_id":"f3373c31-9333-445c-982e-05503cf50e41","resolution":{"observed_at":"2026-08-04T12:38:55.058339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14989","last_updated":"2024-12-25T15:02:32Z","snapshot_observed_at":"2026-08-01T19:23:09.616554Z","submitted_at":"2024-09-23T13:11:37Z","title":"Methods for Convex $(L_0,L_1)$-Smooth Optimization: Clipping, Acceleration, and Adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14989","snapshot_observed_at":"2026-08-04T12:38:55.256221Z","title":"Methods for convex (l\\_0, l\\_1) -smooth optimization: Clipping, acceleration, and adaptivity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.256221Z"},"links":{"cited_paper":"/paper/2409.14989","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:6156adeff7e3978439e7d77c09f54737032448d54b5de1867a59c90a9eac43a8","observation_id":"72115b05-738f-407a-ae44-a5cd7453e73a","resolution":{"observed_at":"2026-08-04T12:38:55.256221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.13243","last_updated":"2018-10-29T19:36:07Z","snapshot_observed_at":"2026-08-06T23:53:31.723792Z","submitted_at":"2018-10-29T19:36:07Z","title":"A Closer Look at Deep Learning Heuristics: Learning rate restarts, Warmup and Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.13243","snapshot_observed_at":"2026-08-04T12:38:55.371093Z","title":"A closer look at deep learning heuristics: Learning rate restarts, warmup and distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.371093Z"},"links":{"cited_paper":"/paper/1810.13243","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:9351a15c7be8490c1529b9d2629595d1a58924286dc370c4fdfa2e45358a02bf","observation_id":"eee57c98-a2a0-4b37-b089-570b82feb3a2","resolution":{"observed_at":"2026-08-04T12:38:55.371093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:55.510663Z","title":"Sgd for structured nonconvex functions: Learning rates, minibatching and interpolation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.510663Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:dfba7e05a3508945970478362eba6c219c3a8a5663a1e0017e8002ff73d6f6e7","observation_id":"a24f7417-8014-4bcd-af6c-ac5c3a40258a","resolution":{"observed_at":"2026-08-04T12:38:55.510663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-04T12:38:55.605650Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.605650Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:65aeb07a8a205636e88bca6c09288c6cb186e2bf698a3cd0b4ab48344f561140","observation_id":"cdc5061f-6659-4cd0-8063-56f34f4ec4bc","resolution":{"observed_at":"2026-08-04T12:38:55.605650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11922","last_updated":"2023-06-20T22:10:40Z","snapshot_observed_at":"2026-07-06T15:44:53.919539Z","submitted_at":"2023-06-20T22:10:40Z","title":"No Wrong Turns: The Simple Geometry Of Neural Networks Optimization Paths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11922","snapshot_observed_at":"2026-08-04T12:38:55.710545Z","title":"No wrong turns: The simple geometry of neural networks optimization paths","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.710545Z"},"links":{"cited_paper":"/paper/2306.11922","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:91ee2545789de32058a9b81e883e4eb8432d72deacef742e506231c3804a63a4","observation_id":"f633f650-1203-4683-aafd-08491a57fc17","resolution":{"observed_at":"2026-08-04T12:38:55.710545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:55.886801Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:55.886801Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:94f546060d08c8f7a32edfcc6701648e13307939fbb2922d215d14c172ace601","observation_id":"590dcdf8-1c8f-4e78-a4f7-8312681dabf5","resolution":{"observed_at":"2026-08-04T12:38:55.886801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.010775Z","title":"Gradient descent learns linear dynamical systems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.010775Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:3930e5e526d6f65f2c2081bf49a292c613f555e63e76903c030a04ab0522877d","observation_id":"eec30366-a3cc-4b14-a855-8cd81cc3c4a4","resolution":{"observed_at":"2026-08-04T12:38:56.010775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.108598Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.108598Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:ab40b98c374f3f3d4282fb6c07b578befd222b6ae23eee84fe60c2979db7f2dc","observation_id":"9da8f203-1a1f-49b6-9256-473c352cb250","resolution":{"observed_at":"2026-08-04T12:38:56.108598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-04T12:38:56.263519Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.263519Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:8a44edc26a6a227ccbe3d100a544754ef1418fc38ef28a73f08819efc21c3151","observation_id":"b75d76bc-65a8-42f5-b00a-7d9f6a864020","resolution":{"observed_at":"2026-08-04T12:38:56.263519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.359484Z","title":"Near-optimal methods for minimizing star-convex functions and beyond","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.359484Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:74475e29533346d21b314edf40ff21310f8746ef8b8da926dea7a31f7fe194ef","observation_id":"383d99fb-5cdd-4ed3-a254-cb89e9b486d4","resolution":{"observed_at":"2026-08-04T12:38:56.359484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-04T12:38:56.463192Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.463192Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:1dafae8022fc8b38521a229bf9b0193b44f586e4b4ba1d91f0e4ad37da962cd0","observation_id":"d9a7c06d-9155-4ed8-87d9-c3264157ab62","resolution":{"observed_at":"2026-08-04T12:38:56.463192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.629540Z","title":"An empirical analysis of compute-optimal large language model training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.629540Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:23517030ecb4ab37be932c66d4e241480e6f40ea710c0a8b60c539b0ef14d799","observation_id":"6269db09-27c3-495f-9c95-86dc0e42ccac","resolution":{"observed_at":"2026-08-04T12:38:56.629540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-04T12:38:56.790434Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.790434Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:88a0a37292727a1bfce01f16ddcfc9869901dd0ed37cbcb4ab898a39064f4cff","observation_id":"4fb71426-0151-48e3-ba08-f7b28326a805","resolution":{"observed_at":"2026-08-04T12:38:56.790434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.930852Z","title":"Improving transformer optimization through better initialization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:56.930852Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:5db5214802383517aad9c439096f63d25fdaaa5fdb47c446e946e8fd1351d95b","observation_id":"036ce580-74e4-433c-a011-634ce01a186c","resolution":{"observed_at":"2026-08-04T12:38:56.930852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.081181Z","title":"Loss landscape characterization of neural networks without over-parametrization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.081181Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:7afb45e8299fe6acd7f3f512a9bfbfb642e524f8c74e7cc7560d0993060e4d5c","observation_id":"00671aad-5bd1-43cb-95ec-42f36a89434a","resolution":{"observed_at":"2026-08-04T12:38:57.081181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.244841Z","title":"Why warmup the learning rate? underlying mechanisms and improvements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.244841Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:1611c92a40651d857da865d7616f98e8381a8bd8d975db475aa6a03df7c4bee9","observation_id":"3d011ce7-8726-40bc-91bb-7a331b5e3f86","resolution":{"observed_at":"2026-08-04T12:38:57.244841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.374428Z","title":"Linear convergence of gradient and proximal-gradient methods under the polyak- ojasiewicz condition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.374428Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:07440d13d858fbdc6b397a1d011d78461f33d126fd4d5341f0394652f543183d","observation_id":"aef0ebda-5f64-4efa-aed9-2b6e38e4f6ad","resolution":{"observed_at":"2026-08-04T12:38:57.374428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.507142Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.507142Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:00747b43a551d1aa92ff3895fae91275f5e1e67011d35cfa07b617b842feaf78","observation_id":"2b36a278-8f3b-4563-8896-c93683abe061","resolution":{"observed_at":"2026-08-04T12:38:57.507142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.609783Z","title":"Deep learning without poor local minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.609783Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:2f6c7f289990c29a8bb8d9ab9191cdacef1e25825c13c01aef86e9522c3b077d","observation_id":"99514f4e-22b3-4f30-957e-afc94d8b474f","resolution":{"observed_at":"2026-08-04T12:38:57.609783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-04T12:38:57.721743Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.721743Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:b1bdc6aac9f052aa0b8ff37527626981d97ab2de185ded38280f611551f6edae","observation_id":"116cd242-7c43-4402-9b22-ea8c50783d42","resolution":{"observed_at":"2026-08-04T12:38:57.721743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.819361Z","title":"An alternative view: When does sgd escape local minima? In International conference on machine learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.819361Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:b1b515a03bca58a1ba5af97903a7de3534706c988889f9ebf804de3401513a04","observation_id":"706da65f-d409-42cf-bd5b-c7c9ea81f64f","resolution":{"observed_at":"2026-08-04T12:38:57.819361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03105","last_updated":"2026-07-30T05:46:37Z","snapshot_observed_at":"2026-08-07T07:00:35.214074Z","submitted_at":"2025-08-05T05:32:36Z","title":"Accelerating SGDM via Learning Rate and Batch Size Schedules: A Lyapunov-Based Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03105","snapshot_observed_at":"2026-08-04T12:38:57.947144Z","title":"Accelerating sgdm via learning rate and batch size schedules: A lyapunov-based analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:57.947144Z"},"links":{"cited_paper":"/paper/2508.03105","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:cfc98722e396ff4b4805022f3c750812af3012ac2919137dbd4105160712b642","observation_id":"b1228a4f-78df-4eb7-9f23-4784716f46cf","resolution":{"observed_at":"2026-08-04T12:38:57.947144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:58.133345Z","title":"Analyzing & reducing the need for learning rate warmup in gpt training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.133345Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:95d0f0d04f89cd289c8a39571a3190ca8308fe2c9f4521af4a30d57c21f12620","observation_id":"a0c02409-bb40-46c1-b44c-3037fcfe5985","resolution":{"observed_at":"2026-08-04T12:38:58.133345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:58.310721Z","title":"Convex and non-convex optimization under generalized smoothness","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.310721Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:94cdd4e35de9b9b3929a4402aee24da9a93ce3b8b08378719dd417e3aa0a5b24","observation_id":"b53decd7-bd22-4517-b052-90244089927c","resolution":{"observed_at":"2026-08-04T12:38:58.310721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:58.449756Z","title":"Loss landscapes and optimization in over-parameterized non-linear systems and neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.449756Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:2bfe92cc1a9812b72e5d3a2f0a1eec504a3c4b136aaf5588116bb8b6976cd54c","observation_id":"719634b7-1aa9-4edb-895a-08254fc9d44c","resolution":{"observed_at":"2026-08-04T12:38:58.449756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:58.650623Z","title":"Aiming towards the minimizers: fast convergence of sgd for overparametrized problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.650623Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:ac2798f700a80078f32a13364526ab2b97877407a10c9405af2e2baeb0e9beb3","observation_id":"21efe338-a1bc-4817-b4e5-3e35f32d45ad","resolution":{"observed_at":"2026-08-04T12:38:58.650623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-06T16:48:51.552941Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-04T12:38:58.819676Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.819676Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:c4f82e8eeedaae7a0bfc8e8d348218d6ef56919e930240402cd8caf0da3631d2","observation_id":"4a969c6c-cba2-4130-8c93-7308ff18d135","resolution":{"observed_at":"2026-08-04T12:38:58.819676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07972","snapshot_observed_at":"2026-08-04T12:38:58.891916Z","title":"Theoretical analysis on how learning rate warmup accelerates convergence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.891916Z"},"links":{"cited_paper":"/paper/2509.07972","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:7188a8127121f0db023d7b8b4b442cbadc49e96a5bb7ae70e0fc0c5716e51724","observation_id":"89caaa2e-7bee-452a-9079-db1bb129da9e","resolution":{"observed_at":"2026-08-04T12:38:58.891916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-04T12:38:59.029439Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.029439Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:b5e55c1280d796a49f71858ee3c012b4dd67b8da6a6847cb381c46c6308ac16b","observation_id":"648c8223-3bce-474f-ad61-e981523edfb9","resolution":{"observed_at":"2026-08-04T12:38:59.029439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T12:38:59.193626Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.193626Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:46f4f5bc346f6884e8f0740b0233c4c625630ad899e77476c4fefdf271f02ae5","observation_id":"88d91fec-cb0e-47cd-adb3-84a865af0838","resolution":{"observed_at":"2026-08-04T12:38:59.193626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.249809Z","title":"The power of interpolation: Understanding the effectiveness of sgd in modern over-parametrized learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.249809Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:2a7b15d09453ff15693def126a193642491aacd5b2787432b9576b99302a70cb","observation_id":"a1bac448-bfbd-4ba4-b4da-9731b4c89095","resolution":{"observed_at":"2026-08-04T12:38:59.249809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.350720Z","title":"Matrix differential calculus with applications to simple, hadamard, and kronecker products","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.350720Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:84ac56004b002446949e93472658ccd618a402a74546c8a9609206caf1d33635","observation_id":"ffa64622-a0a7-40a3-a49a-eeea6c54b6bd","resolution":{"observed_at":"2026-08-04T12:38:59.350720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-04T12:38:59.426040Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.426040Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:0bc5e8abf12c5a88a2420fc57d50c126d0f21a10143738aeb0e3232997a0587f","observation_id":"ed497575-5314-43e2-91da-05d9b6c4f757","resolution":{"observed_at":"2026-08-04T12:38:59.426040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.495969Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.495969Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:56a928ca7ad3494b2265418285e3f3cdd9ab3bb0343c9a33c83298d9c1416cb5","observation_id":"dcbb8440-442b-4c34-9222-c176b5e1dabb","resolution":{"observed_at":"2026-08-04T12:38:59.495969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.578629Z","title":"Gradient methods for minimizing functionals","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.578629Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:5a3686160f434d2a3b2a94391c1c77ace438728283408c2da5045e529cd3b7df","observation_id":"75c04dd8-88c7-448a-bd6c-7b29f0a42f71","resolution":{"observed_at":"2026-08-04T12:38:59.578629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.674564Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.674564Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:c679a7c9ac7142481077501dd19acdee5ec96bc6eb065ddae4aa7d046696eda7","observation_id":"5b7c22af-6cb4-40cd-b65c-e90f2ac141be","resolution":{"observed_at":"2026-08-04T12:38:59.674564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13416","last_updated":"2025-05-19T17:50:45Z","snapshot_observed_at":"2026-08-07T15:42:59.825410Z","submitted_at":"2025-05-19T17:50:45Z","title":"Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13416","snapshot_observed_at":"2026-08-04T12:38:59.776219Z","title":"Gluon: Making muon & scion great again!(bridging theory and practice of lmo-based optimizers for llms)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.776219Z"},"links":{"cited_paper":"/paper/2505.13416","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:ab97854f51f01a9c5c4a22cfcbdc87e8f8ee43e061f3a70267d8e2009c83c3c0","observation_id":"95a62f5f-478d-46fb-89b6-07d1f2248832","resolution":{"observed_at":"2026-08-04T12:38:59.776219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.901620Z","title":"Stepping on the edge: Curvature aware learning rate tuners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.901620Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:46bf698b065c4682b94678263cb00665c360862bf3490f57a6121063aa7b71b4","observation_id":"05b0d5fe-f2e7-4478-b1b0-2521860b2175","resolution":{"observed_at":"2026-08-04T12:38:59.901620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18965","last_updated":"2025-07-23T13:03:41Z","snapshot_observed_at":"2026-07-06T20:28:52.880548Z","submitted_at":"2025-01-31T08:55:56Z","title":"The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18965","snapshot_observed_at":"2026-08-04T12:38:59.978009Z","title":"The surprising agreement between convex optimization theory and learning-rate scheduling for large model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:59.978009Z"},"links":{"cited_paper":"/paper/2501.18965","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:ad51e87059f2d4d1a8ea17da3570ace53dffb3ebafab616c686cf013085142b0","observation_id":"ce80e345-2c2a-46c4-b820-4fbd67f88085","resolution":{"observed_at":"2026-08-04T12:38:59.978009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-04T12:39:00.127984Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:00.127984Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:1e25d72b6e873cd34d4dd87e97a7db3d94c461aea150f4bcda87cde1632a1a3d","observation_id":"e558cf7f-ddfc-4c8a-a555-a88298d98e2f","resolution":{"observed_at":"2026-08-04T12:39:00.127984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:00.284259Z","title":"On the generalization benefit of noise in stochastic gradient descent","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:00.284259Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:13b18ac573564466c4c3c09774c7ea18c4bc40bf60a6eeb765cf040d2c342556","observation_id":"7d5a15b6-fd2b-4aba-8e62-141cba87251f","resolution":{"observed_at":"2026-08-04T12:39:00.284259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:00.425116Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:00.425116Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:56590da41b911e147039ca48ff736bc92513e0045f9dc8aec98d10f132345630","observation_id":"2ba07a3e-b380-47db-96df-167002843834","resolution":{"observed_at":"2026-08-04T12:39:00.425116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:00.578854Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:00.578854Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:a067d1dc4570b5de1f564ab3ea010b1cf24df368e1a9ea62aba30c6a18f07fff","observation_id":"217d4747-d2a8-4904-a697-80d9c57895c1","resolution":{"observed_at":"2026-08-04T12:39:00.578854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:00.714356Z","title":"Fast convergence in learning two-layer neural networks with separable data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:00.714356Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:2fdbd9a40380063f2dda5aa56fcc2f69c3c39c663ef44e4b224c231a941a4120","observation_id":"4b7c4293-5cfe-4b91-af61-bbeaacf0670a","resolution":{"observed_at":"2026-08-04T12:39:00.714356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T12:39:00.861463Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:00.861463Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:f3332bb21b9f3693f90f80d933d961f39e40c106a62048773d07c56eabd30fce","observation_id":"adeb38bf-a005-40ec-8257-9ae372c03ed9","resolution":{"observed_at":"2026-08-04T12:39:00.861463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:01.030025Z","title":"Empirical tests of optimization assumptions in deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:01.030025Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:cd5f467888b40fe6b8e1bf1fbc9fa24f95de44eff17478fd0b4560609fdb2fb2","observation_id":"84f68236-ec75-4826-868b-f8c0866214bc","resolution":{"observed_at":"2026-08-04T12:39:01.030025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10800","last_updated":"2025-03-07T20:23:27Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:57:33Z","title":"Optimizing $(L_0, L_1)$-Smooth Functions by Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10800","snapshot_observed_at":"2026-08-04T12:39:01.193581Z","title":"Optimizing (l\\_0, l\\_1) -smooth functions by gradient methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:01.193581Z"},"links":{"cited_paper":"/paper/2410.10800","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:a777a1caa20ef592b9b7398932ec69e95dbc0e6299c70f70b4e23d34f6e1375c","observation_id":"a80581cf-2114-4a12-88fb-cf5e581d546b","resolution":{"observed_at":"2026-08-04T12:39:01.193581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:01.314115Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:01.314115Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:cfc275494694b163f1722b6a207805f00f6e4bb3b8a173519e7156f7a1f03174","observation_id":"a1650146-ef7d-4966-b190-4e8aa5da6398","resolution":{"observed_at":"2026-08-04T12:39:01.314115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:01.594610Z","title":"Convergence of adagrad for non-convex objectives: Simple proofs and relaxed assumptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:01.594610Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:40d9cc6a1ec496255fbe4fa6e1575145cdebc9787fb29d830d1e98136fa6a9a0","observation_id":"5f300618-eb15-4eee-8bcf-2c4bf1534160","resolution":{"observed_at":"2026-08-04T12:39:01.594610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-04T12:39:01.733820Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:01.733820Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:7402cd86ce6fd724d646dd113d35d6774c8c0f2b1dae5518614b21ef5267e178","observation_id":"bc431704-a053-41e8-993a-0db5dd316058","resolution":{"observed_at":"2026-08-04T12:39:01.733820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-04T12:39:01.892794Z","title":"Small-scale proxies for large-scale transformer training instabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:01.892794Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:6b466e32e50b68f6cda237b0f7bd279769b820a4a623f50b98fdf1695b0902b7","observation_id":"125f1764-fac9-4207-85eb-4803f87867a0","resolution":{"observed_at":"2026-08-04T12:39:01.892794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:02.101607Z","title":"On the overlooked pitfalls of weight decay and how to mitigate them: A gradient-norm perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.101607Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:35a7d0228cdb380f01fb56687e5cf066b40176c98671805d8e7a393443479584","observation_id":"a98b8919-b85a-4f15-abff-ca0412f2a3df","resolution":{"observed_at":"2026-08-04T12:39:02.101607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:02.305117Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.305117Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:264f22f2b0e3efae899570695237c99e661658659d7e0ddfc53530d830fc3dea","observation_id":"9abf9a17-3192-4b9a-abf4-93183a4fca72","resolution":{"observed_at":"2026-08-04T12:39:02.305117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:02.459232Z","title":"Dive into deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.459232Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:6db8a80358eea85acc0ca1e3d5d3eb4069b4376a6922d3eda84ae39b93014ffe","observation_id":"1e455ef0-d364-4d76-a416-edcf5f517509","resolution":{"observed_at":"2026-08-04T12:39:02.459232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:02.605680Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.605680Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:55d3ea416a6807f78a312d40f902aa166ba6ecc76b42219c79bc8be7b0da4e32","observation_id":"a2fe7e7d-00db-4cad-840f-f698d4c32a39","resolution":{"observed_at":"2026-08-04T12:39:02.605680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:02.697714Z","title":"Improved analysis of clipping algorithms for non-convex optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.697714Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:aff5fc3209adf63325f7c096575107280feb066359d2eeb14d591a87277498b0","observation_id":"dcdfc5bf-6ca6-49af-94f2-6e3622e0ceda","resolution":{"observed_at":"2026-08-04T12:39:02.697714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-01T07:17:17.608304Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-04T12:39:02.842307Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.842307Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:cefb9fde1efb749f575adf041002c5e8ea46aaf95519946ef8d4cc1e2ca0ffc1","observation_id":"b8c02199-f48d-4b06-a70f-52f3feac5a49","resolution":{"observed_at":"2026-08-04T12:39:02.842307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:02.990431Z","title":"On the convergence and improvement of stochastic normalized gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.990431Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:03b51a8d5b40268d0a30c0fc539feab81f861be6c4c1807f6660e6890ac4a8eb","observation_id":"d90af45d-98dc-4e8a-9d6f-b03a9e6d6e45","resolution":{"observed_at":"2026-08-04T12:39:02.990431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:03.122139Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:03.122139Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:ce11f5a3c25822709e1c21456b037c14b1204bc658c62458fca804d1010560dd","observation_id":"ba8c39b4-7f2b-47c8-aa2b-6a096121e6db","resolution":{"observed_at":"2026-08-04T12:39:03.122139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:03.316608Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:03.316608Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:3f4b48c69de0dc82517d704eca9297980833c3b974b1be56cef4e737d6f27f35","observation_id":"28aafa4e-8ded-42f3-a3f4-0ad38030173d","resolution":{"observed_at":"2026-08-04T12:39:03.316608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:03.472216Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:03.472216Z"},"links":{"citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:8228fefb5c0049285c661a1f6fc6411b7df17b7489ed0168c5e41f00d0863843","observation_id":"c689fca2-05c8-4d5c-bb73-37bdf0933cbd","resolution":{"observed_at":"2026-08-04T12:39:03.472216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 2 inbound Pith citation observations for arXiv:2510.03164."}