{"as_of":"2026-08-10T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:580b7e37df7ceda6ec8ed71a2cdb1e6b35086e6e956c5bdae50c3c665a1f60ee","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:32:36.011814Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:38:58.891916Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T20:15:04.523466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07972","snapshot_observed_at":"2026-08-04T12:38:58.891916Z","title":"Theoretical analysis on how learning rate warmup accelerates convergence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-04T12:38:48.240318Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.891916Z"},"links":{"cited_paper":"/paper/2509.07972","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:7188a8127121f0db023d7b8b4b442cbadc49e96a5bb7ae70e0fc0c5716e51724","observation_id":"89caaa2e-7bee-452a-9079-db1bb129da9e","resolution":{"observed_at":"2026-08-04T12:38:58.891916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"cited_work":{"arxiv_id":"2509.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07972","snapshot_observed_at":"2026-06-30T20:15:04.523466Z","title":"Theoretical analysis on how learning rate warmup accel- erates convergence","venue":null,"work_id":"64b70b9b-0788-40af-8fa5-d6ed1fc21120","year":2025},"citing_paper":{"arxiv_id":"2604.26481","last_updated":"2026-04-29T09:47:21Z","snapshot_observed_at":"2026-07-06T23:12:06.349884Z","submitted_at":"2026-04-29T09:47:21Z","title":"A Provably Robust Multi-Jet Framework applied to Active Flow Control of an Airfoil in Weakly Compressible Flow","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T10:57:04.360455Z"},"links":{"cited_paper":"/paper/2509.07972","citing_paper":"/paper/2604.26481"},"observation_digest":"sha256:f5d75ede5fdbe014095abbe82de156f5c6f4fdfdd9cb460bcf127cbfacd8d17a","observation_id":"1a80413b-21af-4eee-9d4f-a1b31709a47f","resolution":{"observed_at":"2026-05-12T09:26:25.972480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"cited_work":{"arxiv_id":"2509.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07972","snapshot_observed_at":"2026-06-30T20:15:04.523466Z","title":"Theoretical analysis on how learning rate warmup accel- erates convergence","venue":null,"work_id":"64b70b9b-0788-40af-8fa5-d6ed1fc21120","year":2025},"citing_paper":{"arxiv_id":"2605.14800","last_updated":"2026-05-26T16:52:56Z","snapshot_observed_at":"2026-08-07T17:02:01.604438Z","submitted_at":"2026-05-14T13:09:48Z","title":"Avoiding Bias in Clipped SGD for Overparameterized Models under Generalized Smoothness","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-30T20:13:36.440752Z"},"links":{"cited_paper":"/paper/2509.07972","citing_paper":"/paper/2605.14800"},"observation_digest":"sha256:df7bbf9070700f313853a1c4a5a5bdf30d4cab3a606c5f0b66f885a5d936eb64","observation_id":"9c487ebe-6959-4395-86ea-d46ccef35102","resolution":{"observed_at":"2026-06-30T20:15:04.525674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.07972/citation-record","integrity":"/paper/2509.07972/integrity","json":"/paper/2509.07972/citation-record.json","paper":"/paper/2509.07972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:41.182544Z","title":"Qsgd: Communication- Efficient SGD via Gradient Quantization and Encoding","venue":null,"work_id":"35e9aac8-0457-4d13-a46c-cf23931b2e83","year":2017},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:32.871158Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:58105948cdd7950635765ee04233e5b6ac6166c2cb587164edb391e2cf33bcc1","observation_id":"d4718808-baa3-4b27-ac4b-061ff6581a49","resolution":{"observed_at":"2026-08-04T21:32:41.308989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:40.896989Z","title":"Duchi, Dylan J","venue":null,"work_id":"c6fe0ed9-e218-4e8b-a27d-ba446f0d9498","year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:32.970569Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:b493a1c5dc8cb73f1b6acbf66a53763ffd9ec045ded930f8a7e576e913033bba","observation_id":"dc6aff50-060d-44e7-9c7a-b86e3e5caf38","resolution":{"observed_at":"2026-08-04T21:32:40.966682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:40.653434Z","title":"Curtis, and Jorge Nocedal","venue":null,"work_id":"1bc3b3a5-02e5-4b51-b70f-ff6439815e70","year":2018},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.084868Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:a90a8dd86822e7d0b6a3f147792b4b2b7d264bc69dc3592572e71a15c33a2770","observation_id":"ca417af7-faa8-406f-bd36-1b52e48d41ac","resolution":{"observed_at":"2026-08-04T21:32:40.749870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:33.151389Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.151389Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:b0a88f5c23d8f6a58bbcd2283a34e1399cccbe797b32c2dc8aa26e592b37091b","observation_id":"ec9e8a2e-59b2-4cf0-993b-e3cbc9711f6b","resolution":{"observed_at":"2026-08-04T21:32:33.151389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:40.303071Z","title":"Gradient descent on neural networks typically occurs at the edge of stability","venue":null,"work_id":"5d3e69a3-3dfe-4745-a6f8-cdd823b5a27f","year":2021},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.230781Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:52bd905e92b2c33bb292a7ff3f72f2d16bfc555572f887a9153b0c4c71beba64","observation_id":"9b97a3c6-abf5-4c56-9ca9-c68d227c8443","resolution":{"observed_at":"2026-08-04T21:32:40.409316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:40.054366Z","title":"Robustness to unbounded smoothness of generalized signsgd","venue":null,"work_id":"1636744d-69e4-418e-a9a3-8b035639c63a","year":2022},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.317211Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:87dab6565f0e30ed6a9f315257da3b3f30c7ed8e3688c71ea8b7507fb0938575","observation_id":"4ee23d18-6703-4cd9-ac07-1b29ba8e725c","resolution":{"observed_at":"2026-08-04T21:32:40.183963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:39.807656Z","title":"A loss curvature perspective on training instabilities of deep learning models","venue":null,"work_id":"d7bc293e-6a2e-45de-acf1-7ba78599f747","year":2022},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.412706Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:a595581039bb32d4a97f43384220d1ee27ad56b627233846568657e274d9b848","observation_id":"ff52d472-7ba2-4df3-b8ab-a87f8c73c2f9","resolution":{"observed_at":"2026-08-04T21:32:39.910840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.13243","last_updated":"2018-10-29T19:36:07Z","snapshot_observed_at":"2026-08-06T23:53:31.723792Z","submitted_at":"2018-10-29T19:36:07Z","title":"A Closer Look at Deep Learning Heuristics: Learning rate restarts, Warmup and Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.13243","snapshot_observed_at":"2026-08-04T21:32:33.488985Z","title":"A closer look at deep learning heuristics: Learning rate restarts, warmup and distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.488985Z"},"links":{"cited_paper":"/paper/1810.13243","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:33f621940483f5a9a958e5b71c9a3999de8de57c2773377b30884639c4f34bcc","observation_id":"6ebaf8dc-8753-4f3b-817b-50221d9502ab","resolution":{"observed_at":"2026-08-04T21:32:33.488985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:39.584020Z","title":"A closer look at deep learning heuristics: Learning rate restarts, warmup and distillation","venue":null,"work_id":"61bb5fb2-a217-4328-aa96-6d5fd3528d40","year":2019},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.601486Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:c7f779cbc7848c1174586e69e3db2b4ab32f7dadde907203970a6455f8aa80b4","observation_id":"ff8a23f2-32d0-4b8f-b34d-cdcf5d9b0fcd","resolution":{"observed_at":"2026-08-04T21:32:39.688153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09401","last_updated":"2019-05-01T11:14:57Z","snapshot_observed_at":"2026-07-06T07:29:17.877464Z","submitted_at":"2019-01-27T16:34:02Z","title":"SGD: General Analysis and Improved Rates","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09401","snapshot_observed_at":"2026-08-04T21:32:33.743464Z","title":"Sgd: General Analysis and Improved Rates","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.743464Z"},"links":{"cited_paper":"/paper/1901.09401","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:86ce8e4b3da4d46022a38b44b7c68e5f015539435da321a71acf22e24dea76c1","observation_id":"cbcc7641-dd17-465f-87d8-f237f7ed0fbc","resolution":{"observed_at":"2026-08-04T21:32:33.743464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-04T21:32:33.855290Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.855290Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:94e22fd886ca44238c33244b30cfa43bc43168dfeaf7bbf932b82234e9408f29","observation_id":"d984b7e2-2db1-4594-be0e-ee657e728883","resolution":{"observed_at":"2026-08-04T21:32:33.855290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:33.998114Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:33.998114Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:33df4f0050b3f1e9dc45875f1422ab016717d05c1ade65fb13d6e7019e12804b","observation_id":"7474a037-c114-41b5-a4b6-1033745c136a","resolution":{"observed_at":"2026-08-04T21:32:33.998114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:39.198474Z","title":"Three factors influencing minima in SGD , 2018","venue":null,"work_id":"c012d95e-a72f-4f67-a890-029757300a9e","year":2018},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.144952Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:f535b7571d989fe9470b1c3c164d4b4dcc66b23b7836202697fe232597e45395","observation_id":"98a5cef4-ef28-45f2-9dd9-f922df3f1c56","resolution":{"observed_at":"2026-08-04T21:32:39.329972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:38.948940Z","title":"Why warmup the learning rate? underlying mechanisms and improvements","venue":null,"work_id":"b86ca1e2-344f-4f63-b333-72b1335ef958","year":2024},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.271114Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:663f5e2b3172f4b25def518485e99725062062a504092d2327a8edc4c005ca21","observation_id":"b47f25e8-7dcc-479d-8228-28461a978702","resolution":{"observed_at":"2026-08-04T21:32:39.070350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:38.708276Z","title":"Better Theory for SGD in the Nonconvex World","venue":null,"work_id":"b2c32476-55df-4c9e-b7d1-085f2118e707","year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.414677Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:69af8308845fc1c3ba54d1e74e1910f786754717f5933be0ffff442b01749434","observation_id":"b7c5919c-8153-4c8a-b900-931a12fdc66c","resolution":{"observed_at":"2026-08-04T21:32:38.824116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06573","last_updated":"2018-11-29T14:57:17Z","snapshot_observed_at":"2026-08-08T04:46:42.496552Z","submitted_at":"2018-06-18T09:37:39Z","title":"Distributed learning with compressed gradients","version":2},"cited_work":{"arxiv_id":"1806.06573","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.06573","snapshot_observed_at":"2026-08-04T21:32:36.169607Z","title":"Distributed learning with compressed gradients","venue":"math.OC","work_id":"0c7958d5-f4c9-44ee-b3f7-793fea26f20a","year":2018},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.555629Z"},"links":{"cited_paper":"/paper/1806.06573","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:cac8d761bd05cb1dd25505a01b15553b5d06ae973e545899985641b9ddd9c520","observation_id":"afccdaec-29b4-4ae4-b533-bbf112fe3a6f","resolution":{"observed_at":"2026-08-04T21:32:36.237186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-04T21:32:34.617678Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.617678Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:9f1a9c46353be16fe940d6ccb65a300d5dc3f0217ce511672a2e2e7d02bc1fbe","observation_id":"d3180bf2-e1fc-4b2d-82f1-9378c2df9ebb","resolution":{"observed_at":"2026-08-04T21:32:34.617678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:38.502085Z","title":"Analyzing & reducing the need for learning rate warmup in gpt training","venue":null,"work_id":"41f993c9-df57-4511-8970-897857b280a7","year":2024},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.680021Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:84c9bafd92d78700833837554d4510e4629c2665ad7e4a90c2bae811a3e73194","observation_id":"07c72ed4-452d-47d7-8528-37717622a62c","resolution":{"observed_at":"2026-08-04T21:32:38.616868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:38.252571Z","title":"Convex and Non -convex Optimization Under Generalized Smoothness","venue":null,"work_id":"5b10eebd-6d23-4608-a867-a241066328b7","year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.742379Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:c44587187a0daec07ee22fe56c8dce42004e4854ff2ae3891143949aa83b0e9e","observation_id":"314450eb-82f1-4de0-9886-746ee0df8559","resolution":{"observed_at":"2026-08-04T21:32:38.378429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:38.000889Z","title":"Convergence of Adam Under Relaxed Assumptions","venue":null,"work_id":"3ed2a8c4-100e-43c2-9210-74ed33fe9696","year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.805621Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:efeb25cd044977a3d10de6e47bd6a47675192f7a28c536dcf6a26dc029424a6b","observation_id":"4ef6a172-b240-4d5d-8efd-4f75da586e6b","resolution":{"observed_at":"2026-08-04T21:32:38.127455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:37.761387Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","venue":null,"work_id":"b234a76f-d958-487c-b565-08c719b10b24","year":2020},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.892504Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:ccbef250027228a08fa9815314adb94a7fa4193ef921a8c0245db9b7ca48653a","observation_id":"8f0ad54b-13d1-488d-9177-1fb185bedf73","resolution":{"observed_at":"2026-08-04T21:32:37.879480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15244","last_updated":"2024-10-14T03:44:54Z","snapshot_observed_at":"2026-08-07T21:16:54.024222Z","submitted_at":"2024-06-21T15:29:31Z","title":"AdaGrad under Anisotropic Smoothness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15244","snapshot_observed_at":"2026-08-04T21:32:34.950133Z","title":"Adagrad under anisotropic smoothness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:34.950133Z"},"links":{"cited_paper":"/paper/2406.15244","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:716429de94c634eb4b0923a7ed23f8b004b71e2fb563efcf96a7e45104e55d19","observation_id":"95096954-aea3-4c7a-9389-6f4fe541cb3c","resolution":{"observed_at":"2026-08-04T21:32:34.950133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:35.018805Z","title":"Revisiting the last-iterate convergence of stochastic gradient methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.018805Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:2b70ecef23874cbec8d616a22a2a3da9bca1d5739e820402bb6efcd2e6e33e43","observation_id":"5c9a1aa6-d925-4778-a765-04781f2f3c79","resolution":{"observed_at":"2026-08-04T21:32:35.018805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:35.082983Z","title":"SGDR : Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.082983Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:94f63507e00afc4c398d57ab2afea9893e8ac7b7f163c804ce255883f4f0b439","observation_id":"fc032b57-383b-4fde-906c-ae001ac6363c","resolution":{"observed_at":"2026-08-04T21:32:35.082983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:37.495473Z","title":"Adaptive Gradient Descent without Descent","venue":null,"work_id":"d6d9003f-6308-4b66-9c9a-a990d47ecf9c","year":2020},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.141570Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:40d4685265ad4a31e26463311c6aa4fafa188581907e49f01e8bc0754f15e2b4","observation_id":"06ea6c50-4a2e-49d3-b6bc-fbbec7f9a9ad","resolution":{"observed_at":"2026-08-04T21:32:37.598245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:35.205786Z","title":"Lectures on convex optimization, volume 137","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.205786Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:5eaf3dcc9658854c87a19ef125c10ab7ff7bc53cc42a21e9029a1467f9077dc6","observation_id":"0d3c2c69-fdca-4b8f-afcf-3954453339b0","resolution":{"observed_at":"2026-08-04T21:32:35.205786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:37.263519Z","title":"Global Convergence and Stability of Stochastic Gradient Descent","venue":null,"work_id":"f65d502b-f8d9-4bf8-90f6-517dfa77f3de","year":2022},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.260121Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:c180a6ed117432ecddad87327ab7455bf65703ff8270cfcb6cc1138eeba196c5","observation_id":"d1d7617d-4e8b-4f70-bdbf-b8be3886a8d8","resolution":{"observed_at":"2026-08-04T21:32:37.355620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:37.129316Z","title":"Understanding Gradient Clipping In Incremental Gradient Methods","venue":null,"work_id":"bcb37e29-8b27-4697-b5fe-a1456865d406","year":2021},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.337374Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:92ff48209550e45e5d27cd66d8a82fb5c16553d606bed5730cc632472c52677b","observation_id":"2604dd10-241a-420a-9448-984bf0d78c36","resolution":{"observed_at":"2026-08-04T21:32:37.177582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:37.005071Z","title":"Smith, Pieter-Jan Kindermans, and Quoc V","venue":null,"work_id":"e228fb2f-afc5-4413-b1e6-c49b3dff46d7","year":2018},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.416029Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:ae2d623924a541f627fca093f1542f247067d1b9df0fc52439540dfde7727413","observation_id":"a48916cd-bc8a-49db-94b1-08c7f8f83388","resolution":{"observed_at":"2026-08-04T21:32:37.062095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:36.896382Z","title":"An elementary approach to tight worst case complexity analysis of gradient based methods","venue":null,"work_id":"18b3d8e9-d1cf-4742-a5ce-8cf7b450f887","year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.483322Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:04b9e5e6e723e4054a875f1d3433edc109aaeb0d53bf5264faccf9ca6840976d","observation_id":"cbb4a111-831c-45db-83f1-ce519472d5c2","resolution":{"observed_at":"2026-08-04T21:32:36.979005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T21:32:35.560961Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.560961Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:6dc6b9637238c2d26894151d66b33f8aca42b8cf542330ddd2c9a1c3d0b009ea","observation_id":"b6f8f43b-f42d-48b6-99c4-75379aa3e0fd","resolution":{"observed_at":"2026-08-04T21:32:35.560961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:36.722106Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","venue":null,"work_id":"a0e435b8-62ab-4f9e-9e63-dd20817bc4c0","year":2025},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.645274Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:98eaad4c4f5c60bac548b60600bcceafedf3b33f9f720ad17a0907758c3ef01b","observation_id":"3b624295-8e1f-4767-99bf-3ffbf28c1104","resolution":{"observed_at":"2026-08-04T21:32:36.794213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:35.738963Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.738963Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:51ef7d70d14d6ab52cd18c76944ee749f2a28f03c7ad2109614951176bd98713","observation_id":"55ec8de5-bbd5-4992-8004-caac4d780bb8","resolution":{"observed_at":"2026-08-04T21:32:35.738963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-04T21:32:35.801321Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.801321Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:fd6d259fc03e02ebb18727444b1458aac3b0c6354fb83c887006ed959fa123c6","observation_id":"3e405299-3eb1-4fca-9f5b-0bc3331cc7b8","resolution":{"observed_at":"2026-08-04T21:32:35.801321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:35.878410Z","title":"Improved analysis of clipping algorithms for non-convex optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.878410Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:2dd382954c5e7ffa1f18ae17eeb08f5ff8c519716ff6ebb25373687fde5a7f5e","observation_id":"099ab271-6b10-4276-9f52-cfbd1bd47165","resolution":{"observed_at":"2026-08-04T21:32:35.878410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:36.497950Z","title":"Why Gradient Clipping Accelerates Training : A Theoretical Justification for Adaptivity","venue":null,"work_id":"6fe7a6e0-5ace-4e13-92ea-aade20f72a3d","year":2020},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:35.927559Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:d6f57b9ba96afc125f1352e54bfdf85c9cf38f70bc950324c7a08a8d283eaf77","observation_id":"34286f8d-6728-41e9-8beb-e90599e97273","resolution":{"observed_at":"2026-08-04T21:32:36.561393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:32:36.347253Z","title":"On the convergence and improvement of stochastic normalized gradient descent","venue":null,"work_id":"985f147c-b117-4443-a369-8f672d1051e4","year":2021},"citing_paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T21:32:36.011814Z"},"links":{"citing_paper":"/paper/2509.07972"},"observation_digest":"sha256:863ccb2cbe82e16877f02e7bd86b1d968dbc02f3c5fd0328fc5d03c611f382f8","observation_id":"4b4e9247-268c-4084-a859-25ca2fecfb87","resolution":{"observed_at":"2026-08-04T21:32:36.404112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.07972","last_updated":"2025-09-09T17:56:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T21:32:29.559391Z","submitted_at":"2025-09-09T17:56:03Z","title":"Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 3 inbound Pith citation observations for arXiv:2509.07972."}