{"as_of":"2026-08-17T18:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca56ac73360c5c8b933ed382980caa63c939221aa32a753b7d8ff07d5a9790e0","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:47:31.432012Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.10525/citation-record","integrity":"/paper/1908.10525/integrity","json":"/paper/1908.10525/citation-record.json","paper":"/paper/1908.10525"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:31.742313Z","title":"(2018): F (xk0−1) ≤ F (x0) + η2L 2 (1 + log( b2 k0−1 b2 0 ))","venue":null,"work_id":"602cad34-dd1c-47a4-8cc1-6404a1a524f8","year":2018},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.421243Z"},"links":{"citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:ef6c5aedc51bd312d7ad7059aa3ca89dd136c71b016e655b3aa30ea0cf228cf0","observation_id":"6ab720da-0006-41a2-8b13-bdf23c017ba5","resolution":{"observed_at":"2026-08-14T10:47:31.747751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:31.726629Z","title":"However, after tuning η = 10000 in stochastic setting and η = 100 in batch setting, the convergence rate of AdaGrad-Norm is better again","venue":null,"work_id":"e8d73603-71c9-42be-8529-8991f92d8bb5","year":2019},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.426103Z"},"links":{"citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:474f85472bfd6f2e5a87cddd5d277f85418171f346b18b7759ecc76b98b121b1","observation_id":"8eb866e5-a1fe-4b43-9a4c-f99af31a8853","resolution":{"observed_at":"2026-08-14T10:47:31.731828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:31.709927Z","title":null,"venue":null,"work_id":"65b58efd-95f8-4404-8dc1-b2f1a81c8625","year":2000},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.432012Z"},"links":{"citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:854f2cf4013531546d73760e492d5f00d26f54fda35cd105b547057bff8c95c6","observation_id":"4b273839-6338-4422-83f8-afdb1f0a4925","resolution":{"observed_at":"2026-08-14T10:47:31.715509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09358","last_updated":"2019-06-25T03:39:53Z","snapshot_observed_at":"2026-08-16T10:57:50.245987Z","submitted_at":"2018-11-23T04:26:47Z","title":"A Sufficient Condition for Convergences of Adam and RMSProp","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.09358","snapshot_observed_at":"2026-08-14T10:47:31.375228Z","title":"A suﬃcient condition for con- vergences of adam and rmsprop","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.375228Z"},"links":{"cited_paper":"/paper/1811.09358","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:68c07c9b448bf3a588af49606351541da5e0ec0a5f7c0158fe003def478cda3f","observation_id":"4c03a4da-f398-43b0-a21e-c62c94452a9d","resolution":{"observed_at":"2026-08-14T10:47:31.375228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01811","last_updated":"2021-04-19T02:15:24Z","snapshot_observed_at":"2026-08-17T00:04:09.127682Z","submitted_at":"2018-06-05T16:59:08Z","title":"AdaGrad stepsizes: Sharp convergence over nonconvex landscapes","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01811","snapshot_observed_at":"2026-08-14T10:47:31.380155Z","title":"Ada- grad stepsizes: Sharp convergence over nonconvex landscapes, from any initialization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.380155Z"},"links":{"cited_paper":"/paper/1806.01811","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:2dd72098521acb7c51824fb25a3f8e53c8fab16f117b690f2876468ec515f20c","observation_id":"904dc547-dc3b-4335-a6f3-35741be8a6b3","resolution":{"observed_at":"2026-08-14T10:47:31.380155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02865","last_updated":"2020-11-19T20:31:14Z","snapshot_observed_at":"2026-08-15T11:09:48.745476Z","submitted_at":"2018-03-07T20:30:35Z","title":"WNGrad: Learn the Learning Rate in Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02865","snapshot_observed_at":"2026-08-14T10:47:31.385502Z","title":"Wngrad: learn the learning rate in gradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.385502Z"},"links":{"cited_paper":"/paper/1803.02865","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:436828adb51574949b8771b7833f0db9c73326a3147c49f6ec7e06e5923da753","observation_id":"be367608-7198-49ba-b812-13d0d7321d36","resolution":{"observed_at":"2026-08-14T10:47:31.385502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08114","last_updated":"2019-02-26T22:57:12Z","snapshot_observed_at":"2026-08-15T04:44:23.358097Z","submitted_at":"2018-05-21T15:21:58Z","title":"On the Convergence of Stochastic Gradient Descent with Adaptive Stepsizes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08114","snapshot_observed_at":"2026-08-14T10:47:31.390275Z","title":"On the conver- gence of stochastic gradient descent with adaptive stepsizes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.390275Z"},"links":{"cited_paper":"/paper/1805.08114","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:b1d9d3739bf6b5e9b38afbe1230318e5e988d43e67ee3ceed4496c461f7247a0","observation_id":"f6db588b-1399-4e02-9f65-f0dcd41ac1df","resolution":{"observed_at":"2026-08-14T10:47:31.390275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.07288","last_updated":"2019-04-05T18:58:38Z","snapshot_observed_at":"2026-08-14T18:13:34.473443Z","submitted_at":"2018-10-16T21:48:11Z","title":"Fast and Faster Convergence of SGD for Over-Parameterized Models and an Accelerated Perceptron","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.07288","snapshot_observed_at":"2026-08-14T10:47:31.394878Z","title":"Sharan Vaswani, Francis Bach, and Mark Schmidt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.394878Z"},"links":{"cited_paper":"/paper/1810.07288","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:69de029c43f638408e8cc9ef4d7f5a2919ab0c4736609516ddcab835e5ddb909","observation_id":"ca916c6b-dc1e-4797-849b-39e7af5b864d","resolution":{"observed_at":"2026-08-14T10:47:31.394878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-14T10:47:31.401412Z","title":"Understanding deep learning requires rethinking generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.401412Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:10b088acd693e0feea94556244ab2f14078ae12c666950e26b8353104d1e3798","observation_id":"d50a180f-be27-4024-9110-15c9ec01e24b","resolution":{"observed_at":"2026-08-14T10:47:31.401412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.6370","last_updated":"2013-08-29T06:06:42Z","snapshot_observed_at":"2026-08-15T00:05:07.251336Z","submitted_at":"2013-08-29T06:06:42Z","title":"Fast Convergence of Stochastic Gradient Descent under a Strong Growth Condition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.6370","snapshot_observed_at":"2026-08-14T10:47:31.411341Z","title":"Mark Schmidt and Nicolas Le Roux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.411341Z"},"links":{"cited_paper":"/paper/1308.6370","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:6e404ad4da6fdf4ace4bd7f285ea10db09039328aac2922c65e7d1848b59ff2a","observation_id":"4fb55d86-6a6a-4bb4-af75-616871783ff7","resolution":{"observed_at":"2026-08-14T10:47:31.411341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.07111","last_updated":"2019-10-19T19:07:24Z","snapshot_observed_at":"2026-08-15T10:57:48.950461Z","submitted_at":"2019-02-19T16:08:55Z","title":"Global Convergence of Adaptive Gradient Methods for An Over-parameterized Neural Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.07111","snapshot_observed_at":"2026-08-14T10:47:31.416037Z","title":"Global convergence of adaptive gradient methods for an over-parameterized neural network","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.416037Z"},"links":{"cited_paper":"/paper/1902.07111","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:f3f3730554d7db3d5ceb0ad5b363c746666e53b1dfca2984367455d181c57a1c","observation_id":"77a35abd-4fcb-4c89-b5a7-2933697ae1f4","resolution":{"observed_at":"2026-08-14T10:47:31.416037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T10:47:31.359712Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.359712Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:dacbaab8ca5cebcb74d5cf338a345caa8edfaef6b2f0124f13714682eca2daeb","observation_id":"a0b0faa3-ae45-40ad-9c3b-1769a56a0136","resolution":{"observed_at":"2026-08-14T10:47:31.359712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4908","last_updated":"2010-07-07T19:07:16Z","snapshot_observed_at":"2026-08-15T05:25:29.252288Z","submitted_at":"2010-02-26T01:36:34Z","title":"Adaptive Bound Optimization for Online Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1002.4908","snapshot_observed_at":"2026-08-14T10:47:31.354327Z","title":"Adaptive bound optimization for online convex optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.354327Z"},"links":{"cited_paper":"/paper/1002.4908","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:36e94154eea6dfc8423ff3757ed83a4b0d31ca560a22234d2c270cb378a513b7","observation_id":"0f4a679c-2d5e-4bbb-a109-ee8c53aa91ff","resolution":{"observed_at":"2026-08-14T10:47:31.354327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.09319","last_updated":"2017-05-25T18:33:24Z","snapshot_observed_at":"2026-08-17T17:37:44.304132Z","submitted_at":"2017-05-25T18:33:24Z","title":"Diagonal Rescaling For Neural Networks","version":1},"cited_work":{"arxiv_id":"1705.09319","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.09319","snapshot_observed_at":"2026-08-14T10:47:31.624910Z","title":"Diagonal Rescaling For Neural Networks","venue":"cs.LG","work_id":"98e78836-b43b-4bdc-be17-4038f4f922b7","year":2017},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.364853Z"},"links":{"cited_paper":"/paper/1705.09319","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:8212fef13c883378448d9450364b4d1c5ded23fb5bde32bc5405fdaa1aa8d753","observation_id":"a279fb87-f15b-4112-b7d2-7bc0a0e96f4e","resolution":{"observed_at":"2026-08-14T10:47:31.631995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.03962","last_updated":"2019-06-17T06:39:04Z","snapshot_observed_at":"2026-08-15T12:33:17.579745Z","submitted_at":"2018-11-09T15:16:13Z","title":"A Convergence Theory for Deep Learning via Over-Parameterization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.03962","snapshot_observed_at":"2026-08-14T10:47:31.343819Z","title":"A convergence theory for deep learning via over- parameterization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.343819Z"},"links":{"cited_paper":"/paper/1811.03962","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:745ffc36c13748c07ace9ab209c81ba2eaf17ae7fc29872c0aad449944a7327a","observation_id":"e54fa5fe-e7ce-4bf7-b501-f56eb3228447","resolution":{"observed_at":"2026-08-14T10:47:31.343819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-14T10:47:31.370129Z","title":"Reddi, Satyen Kale, and Sanjiv Kumar","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.370129Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:126de45fcba23d90f933ea862b91ad101f4c4b957e9452800620fc62a93cd244","observation_id":"9c02d46b-dbf4-4e69-9580-1d8f4f47814f","resolution":{"observed_at":"2026-08-14T10:47:31.370129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.08888","last_updated":"2018-12-27T18:57:43Z","snapshot_observed_at":"2026-08-14T17:55:27.705967Z","submitted_at":"2018-11-21T18:58:46Z","title":"Stochastic Gradient Descent Optimizes Over-parameterized Deep ReLU Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.08888","snapshot_observed_at":"2026-08-14T10:47:31.349191Z","title":"Stochastic gradient descent optimizes over- parameterized deep relu networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.349191Z"},"links":{"cited_paper":"/paper/1811.08888","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:96bcead1f638180ae90a6659646378937f807044be94aa28152af68fa36950d7","observation_id":"2c219bbd-55e3-4a38-bbd7-6e3ab40b0eda","resolution":{"observed_at":"2026-08-14T10:47:31.349191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02564","last_updated":"2018-11-06T00:05:00Z","snapshot_observed_at":"2026-08-16T13:40:20.718757Z","submitted_at":"2018-11-06T00:05:00Z","title":"On exponential convergence of SGD in non-convex over-parametrized learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02564","snapshot_observed_at":"2026-08-14T10:47:31.406356Z","title":"On exponential convergence of sgd in non- convex over-parametrized learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:31.406356Z"},"links":{"cited_paper":"/paper/1811.02564","citing_paper":"/paper/1908.10525"},"observation_digest":"sha256:dfbca7c6cc11c713c95d9788d9aee8b3c9c7809b1eceb21d6fafc243b2f114d3","observation_id":"e882a8e9-4bb5-4bd9-b6c9-6a8e06f19d78","resolution":{"observed_at":"2026-08-14T10:47:31.406356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.10525","last_updated":"2020-03-06T05:05:01Z","latest_version":2,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-17T13:38:45.336902Z","submitted_at":"2019-08-28T02:42:50Z","title":"Linear Convergence of Adaptive Stochastic Gradient Descent"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:1908.10525."}