{"as_of":"2026-08-18T23:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f09957b4ac1df1d115e864a1b52bed8c8b24423008952d01c5494e7345cee551","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":229,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:37:36.756445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4797,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1906.09925","last_updated":"2019-06-24T13:13:45Z","snapshot_observed_at":"2026-08-13T16:58:53.864754Z","submitted_at":"2019-06-24T13:13:45Z","title":"To each route its own ETA: A generative modeling framework for ETA prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T17:14:59.051348Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1906.09925"},"observation_digest":"sha256:535fd1eac626d55e13d3622fb4a84f29f1157229425f41040c624918a7e31b1c","observation_id":"59f303c9-ded5-4142-b703-b74202a1866a","resolution":{"observed_at":"2026-05-25T17:16:04.424451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1906.10194","last_updated":"2019-06-24T19:37:03Z","snapshot_observed_at":"2026-08-03T22:07:24.501601Z","submitted_at":"2019-06-24T19:37:03Z","title":"Deep Neural Network Based Resource Allocation for V2X Communications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T16:54:10.078892Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1906.10194"},"observation_digest":"sha256:fd00c602b9c8a1e0fabf27ded973f0fb69ea56068e5b1d511ac8cdb974b65fa5","observation_id":"eb668279-0fd7-44da-b544-5461d98e2def","resolution":{"observed_at":"2026-05-25T16:56:04.306096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1906.10413","last_updated":"2019-06-25T09:34:38Z","snapshot_observed_at":"2026-08-13T09:04:56.329863Z","submitted_at":"2019-06-25T09:34:38Z","title":"A CNN-Based Super-Resolution Technique for Active Fire Detection on Sentinel-2 Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T16:57:27.375451Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1906.10413"},"observation_digest":"sha256:d90b44f1d79343333ed4e88a967bca40cd87cbd4fbcc1d924a61f7d55d4edf6b","observation_id":"c170f698-1b26-4768-94a3-bed1ca7e5952","resolution":{"observed_at":"2026-05-25T17:01:04.574232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1906.11018","last_updated":"2019-06-21T06:54:35Z","snapshot_observed_at":"2026-07-06T08:02:57.296778Z","submitted_at":"2019-06-21T06:54:35Z","title":"Integration of TensorFlow based Acoustic Model with Kaldi WFST Decoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T18:43:44.304619Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1906.11018"},"observation_digest":"sha256:feef2ae22c271ed12b2e1eb41adf3ec9b1b8567c09b21f452cfd3cce1ea7947a","observation_id":"4f5acbf9-c50f-4963-b26a-6a0f7692c62d","resolution":{"observed_at":"2026-05-25T18:46:08.815307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1906.11199","last_updated":"2019-06-20T15:17:02Z","snapshot_observed_at":"2026-08-05T13:54:49.069589Z","submitted_at":"2019-06-20T15:17:02Z","title":"Deployable probabilistic programming","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T18:53:37.039930Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1906.11199"},"observation_digest":"sha256:f94183afe1c3d9eca9db29fad3234dee5e84946546a4f802971f35ca8cf5fa59","observation_id":"fbc97010-a894-46b3-a97d-6c7e98b9e521","resolution":{"observed_at":"2026-05-25T18:56:08.966070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1907.02788","last_updated":"2019-07-05T12:13:46Z","snapshot_observed_at":"2026-08-17T12:40:43.869729Z","submitted_at":"2019-07-05T12:13:46Z","title":"Incremental Concept Learning via Online Generative Memory Recall","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T02:00:43.917441Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1907.02788"},"observation_digest":"sha256:aa98aca4410b1e791dcb79e15ac182a6a4ed546a9cfba9a3f3ae11b9ea502542","observation_id":"9b117c1a-8364-4d14-8b9a-f6479bc3fce3","resolution":{"observed_at":"2026-05-25T02:05:13.239722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1907.04831","last_updated":"2019-07-10T17:24:45Z","snapshot_observed_at":"2026-08-02T04:20:15.946823Z","submitted_at":"2019-07-10T17:24:45Z","title":"Learning the Wireless V2I Channels Using Deep Neural Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T23:28:29.197735Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1907.04831"},"observation_digest":"sha256:d2599da6672a95d39770b9e675300e64db90af9d9c10728519cdb4d8189873dc","observation_id":"694a0afb-abc4-425e-956d-905ced1660b1","resolution":{"observed_at":"2026-05-24T23:30:03.941575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1907.09008","last_updated":"2019-07-21T17:08:50Z","snapshot_observed_at":"2026-08-15T02:00:45.712888Z","submitted_at":"2019-07-21T17:08:50Z","title":"signADAM: Learning Confidences for Deep Neural Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T18:31:32.643209Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1907.09008"},"observation_digest":"sha256:2ed438cd32250e88ae39023b04d3f81e8c1a0d9b4b11638acce885a68118d2ee","observation_id":"3354e0aa-d510-47fd-92a3-2836717dff86","resolution":{"observed_at":"2026-05-24T18:34:48.502352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"1907.09807","last_updated":"2019-07-23T10:39:04Z","snapshot_observed_at":"2026-08-13T12:48:49.376927Z","submitted_at":"2019-07-23T10:39:04Z","title":"On Using Machine Learning to Identify Knowledge in API Reference Documentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T17:22:08.436340Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1907.09807"},"observation_digest":"sha256:275c53b37d1adc8234365e0a6b60a160ff771a404d824a9777f053622a45e560","observation_id":"d9e76dd3-c303-42da-9e83-fb44d89dc74a","resolution":{"observed_at":"2026-05-24T17:24:44.823565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T15:47:44.614334Z","title":"An overview of gradient descent optimizatio n algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.00636","last_updated":"2020-01-09T16:57:29Z","snapshot_observed_at":"2026-08-16T07:35:43.009618Z","submitted_at":"2019-08-01T21:28:46Z","title":"Optimize TSK Fuzzy Systems for Classification Problems: Mini-Batch Gradient Descent with Uniform Regularization and Batch Normalization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T15:47:44.614334Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.00636"},"observation_digest":"sha256:a43c493bd2daf352b557bd3d2b6aeaceeb80e7e99fe2b3274042084119555daf","observation_id":"4b3e1828-ade7-4834-8b70-957cb7a65c3f","resolution":{"observed_at":"2026-08-14T15:47:44.614334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T15:19:33.964944Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.01442","last_updated":"2019-08-05T02:01:02Z","snapshot_observed_at":"2026-08-14T15:10:32.659585Z","submitted_at":"2019-08-05T02:01:02Z","title":"Learning Compact Target-Oriented Feature Representations for Visual Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T15:19:33.964944Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.01442"},"observation_digest":"sha256:0ae846bbf792b502003aabd963380e79a3d1c24c9ac06348ac8cc92a313133ad","observation_id":"186be618-473b-421f-830d-d7b249254457","resolution":{"observed_at":"2026-08-14T15:19:33.964944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T15:18:42.222542Z","title":"CoRR abs/1609.04747 (2016), http://arxiv.org/abs/1609.04747","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.01769","last_updated":"2019-08-23T17:13:17Z","snapshot_observed_at":"2026-08-14T15:11:26.462423Z","submitted_at":"2019-08-04T22:31:02Z","title":"Stress-Plus-X (SPX) Graph Layout","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T15:18:42.222542Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.01769"},"observation_digest":"sha256:f782359fd6ead995c428fa65d293c7e150342d090f79b6520d0b1e02acc12561","observation_id":"a445e3ac-5370-4dc5-a675-ad38a538466e","resolution":{"observed_at":"2026-08-14T15:18:42.222542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T13:54:06.112440Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04116","last_updated":"2019-08-12T12:35:23Z","snapshot_observed_at":"2026-08-14T17:08:21.614894Z","submitted_at":"2019-08-12T12:35:23Z","title":"BGD-based Adam algorithm for time-domain equalizer in PAM-based optical interconnects","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:54:06.112440Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.04116"},"observation_digest":"sha256:3b76b28dde9b8b04122237945d6d1d8f1398dfdab9c45ac1d6b1b6d7e12f53d0","observation_id":"7b895e08-78aa-4cd3-89a2-82e1da0d13b2","resolution":{"observed_at":"2026-08-14T13:54:06.112440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T14:00:28.132482Z","title":"An overview of gradient descent optimizatio n algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04685","last_updated":"2019-08-12T02:55:00Z","snapshot_observed_at":"2026-08-18T19:25:10.905438Z","submitted_at":"2019-08-12T02:55:00Z","title":"Learn to Compress CSI and Allocate Resources in Vehicular Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:28.132482Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.04685"},"observation_digest":"sha256:a12e1975418780138b7c1f3bbe60199df9283acd85205582a5507420c79844e3","observation_id":"d51540f5-e3c9-4f09-a5dc-890395f9881a","resolution":{"observed_at":"2026-08-14T14:00:28.132482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T13:09:58.407125Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.05806","last_updated":"2019-08-19T00:20:06Z","snapshot_observed_at":"2026-08-16T10:56:01.391825Z","submitted_at":"2019-08-16T01:16:30Z","title":"Cross-Domain Adaptation for Animal Pose Estimation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T13:09:58.407125Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.05806"},"observation_digest":"sha256:9d001286246b1472ec2a968b2187e46ef724014dc22e22afa641a1dbbec980bf","observation_id":"6ce27dd5-d8d5-4a0b-a25c-bb6c88664da3","resolution":{"observed_at":"2026-08-14T13:09:58.407125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T12:49:42.788386Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06477","last_updated":"2019-10-26T20:45:08Z","snapshot_observed_at":"2026-08-18T19:00:01.178842Z","submitted_at":"2019-08-18T16:58:52Z","title":"Demystifying Learning Rate Policies for High Accuracy Training of Deep Neural Networks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:49:42.788386Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.06477"},"observation_digest":"sha256:e37c14c7b7ab8696848aff674cc8338636b8fd26ce4c07ace25e1e2c09fa7d9f","observation_id":"5b0dd070-b9f0-4ed8-80a9-c327e7cc8678","resolution":{"observed_at":"2026-08-14T12:49:42.788386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T12:22:46.649690Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07565","last_updated":"2022-02-16T19:02:31Z","snapshot_observed_at":"2026-08-16T06:28:37.377357Z","submitted_at":"2019-08-20T18:43:34Z","title":"Finding the right scale of a network: Efficient identification of causal emergence through spectral clustering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:46.649690Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.07565"},"observation_digest":"sha256:f5accb93d631b5392d1bcd3418e13dc8351ed21b226a0b15164a98a3d9b20eff","observation_id":"ed94680e-6d1a-45b7-bf61-211552cc14d0","resolution":{"observed_at":"2026-08-14T12:22:46.649690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T11:43:25.880546Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08495","last_updated":"2019-12-29T22:56:45Z","snapshot_observed_at":"2026-08-17T20:56:36.254129Z","submitted_at":"2019-08-22T17:03:23Z","title":"Applying machine learning optimization methods to the production of a quantum gas","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:43:25.880546Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.08495"},"observation_digest":"sha256:c3ffd7aa2e7db026827bb285ad08ff50de2d56a1e60290e8333fd52efc33ec3b","observation_id":"9b5af7f1-ded1-4a3e-a1d0-3fc0546ce306","resolution":{"observed_at":"2026-08-14T11:43:25.880546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-14T11:53:19.477332Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.10714","last_updated":"2019-08-22T00:57:45Z","snapshot_observed_at":"2026-08-17T12:12:59.072699Z","submitted_at":"2019-08-22T00:57:45Z","title":"Automated Architecture Design for Deep Neural Networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T11:53:19.477332Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/1908.10714"},"observation_digest":"sha256:b1c9fc57ffe7051a15ab23ac644cd34b7e153ea72f13a4c96f868924ded879b8","observation_id":"aa51a501-506a-45da-b205-170b77b601a8","resolution":{"observed_at":"2026-08-14T11:53:19.477332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"2102.11840","last_updated":"2026-05-19T16:23:20Z","snapshot_observed_at":"2026-07-06T10:43:58.764226Z","submitted_at":"2021-02-23T18:17:47Z","title":"Convergence rates for gradient descent in the training of overparameterized artificial neural networks with piecewise affine activation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T14:10:07.099631Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2102.11840"},"observation_digest":"sha256:aa46e32bbca381a90dbb7aaa6045ec354efbd9810f195a9cda40a66569e84e38","observation_id":"ce03afd9-fd0c-400c-8b07-fcc269ad1659","resolution":{"observed_at":"2026-05-24T14:14:33.276482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"2303.05330","last_updated":"2023-03-09T15:21:47Z","snapshot_observed_at":"2026-08-14T23:27:40.350006Z","submitted_at":"2023-03-09T15:21:47Z","title":"Cloudless-Training: A Framework to Improve Efficiency of Geo-Distributed ML Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T09:15:33.705393Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2303.05330"},"observation_digest":"sha256:b02e5473b427b40efe814cba5290316b1abbf65457c790cc4030944a0f1c7cd2","observation_id":"0e9b93b5-827a-4a45-8093-b53fd2b7d2f3","resolution":{"observed_at":"2026-05-24T09:16:06.488557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"2403.02988","last_updated":"2026-03-24T13:58:48Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:07:37Z","title":"An Operational Framework for Nonclassicality in Quantum Communication Networks","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-24T03:33:38.045846Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2403.02988"},"observation_digest":"sha256:dc6b0716a3f3fb260b52802078953e8b3ab56c7715116599af4887d7d5bfc2f3","observation_id":"ad5ee2b4-3636-45de-b151-a54bbcb9c2b5","resolution":{"observed_at":"2026-05-24T03:33:50.459213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"2410.23657","last_updated":"2026-04-16T16:14:03Z","snapshot_observed_at":"2026-08-15T12:03:08.917661Z","submitted_at":"2024-10-31T06:14:17Z","title":"Secret Leak Detection in Software Issue Reports using LLMs: A Comprehensive Evaluation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T19:13:56.838469Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2410.23657"},"observation_digest":"sha256:71d4c50ee22d3649209256ad0c618c71a53282e828eea0f29105e047e51e2850","observation_id":"8d313f68-af09-4108-a9c2-b3a9d461ada3","resolution":{"observed_at":"2026-05-23T19:15:47.394204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T21:47:34.217478Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.08335","last_updated":"2024-11-13T04:49:32Z","snapshot_observed_at":"2026-08-18T16:10:06.995122Z","submitted_at":"2024-11-13T04:49:32Z","title":"DEEGITS: Deep Learning based Framework for Measuring Heterogenous Traffic State in Challenging Traffic Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T21:47:34.217478Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.08335"},"observation_digest":"sha256:3a3ee8d73c15fef1b8d79faa1f2423763d99e41d20b08d489aaf86d9468cc672","observation_id":"ebf3a4f8-6e2b-449e-85dd-8f24bd37a52f","resolution":{"observed_at":"2026-08-12T21:47:34.217478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T21:13:32.663885Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.08992","last_updated":"2024-11-19T14:51:07Z","snapshot_observed_at":"2026-08-18T17:05:52.051735Z","submitted_at":"2024-11-13T19:33:08Z","title":"IDCIA: Immunocytochemistry Dataset for Cellular Image Analysis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:13:32.663885Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.08992"},"observation_digest":"sha256:ca85a79536258558a71e03f7c9f0cc349cdb3ac74c0f3f967c095d8b1a497431","observation_id":"aaf95806-8a0d-40d7-9e6f-eb41d7739e70","resolution":{"observed_at":"2026-08-12T21:13:32.663885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T21:00:03.437335Z","title":"An overview of gradient descent opti- mization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.09180","last_updated":"2024-11-14T04:39:10Z","snapshot_observed_at":"2026-08-18T16:12:06.227201Z","submitted_at":"2024-11-14T04:39:10Z","title":"LEAP:D -- A Novel Prompt-based Approach for Domain-Generalized Aerial Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:00:03.437335Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.09180"},"observation_digest":"sha256:e66ba193e04b44db06976e4e1e586c029dc6e6e9b171b00f610fce6b51ba8f4e","observation_id":"f9961ec9-56b6-46ac-bf32-b6eecab16a10","resolution":{"observed_at":"2026-08-12T21:00:03.437335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T20:31:53.504858Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.09604","last_updated":"2024-11-14T17:22:16Z","snapshot_observed_at":"2026-08-16T10:50:54.537647Z","submitted_at":"2024-11-14T17:22:16Z","title":"Local-Global Attention: An Adaptive Mechanism for Multi-Scale Feature Integration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:31:53.504858Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.09604"},"observation_digest":"sha256:c903c6da2cbed1cfc12c1228ad68947a2dcdc536d378644914f7aa886f1daff8","observation_id":"1a3eaa48-4c6c-49b2-bce8-eff3302fbb53","resolution":{"observed_at":"2026-08-12T20:31:53.504858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T20:31:12.194668Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.09734","last_updated":"2026-06-05T17:03:31Z","snapshot_observed_at":"2026-08-17T13:54:18.394366Z","submitted_at":"2024-11-14T19:00:01Z","title":"Modeling AdaGrad, RMSProp, and Adam with Integro-Differential Equations","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:31:12.194668Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.09734"},"observation_digest":"sha256:4ae29fa3c2ae896c7951f3f16b23e8b2098796dec80fd2363fb5df0981bddd72","observation_id":"483486dc-b960-48d4-87ba-ea2b759ac1b6","resolution":{"observed_at":"2026-08-12T20:31:12.194668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T19:32:59.856639Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10658","last_updated":"2025-03-31T02:34:53Z","snapshot_observed_at":"2026-08-18T21:25:12.195579Z","submitted_at":"2024-11-16T01:35:39Z","title":"Distributed Optimization Method Based On Optimal Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:59.856639Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.10658"},"observation_digest":"sha256:c547fee605e32d1792c1a59ed0faa59503f7e121abb5e11c31fbc91be4278daa","observation_id":"898e7606-9cf1-49b7-85ae-d83bf717a4c2","resolution":{"observed_at":"2026-08-12T19:32:59.856639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T19:18:16.026888Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10863","last_updated":"2024-11-16T19:01:50Z","snapshot_observed_at":"2026-08-16T13:41:04.346812Z","submitted_at":"2024-11-16T19:01:50Z","title":"Improvement in Facial Emotion Recognition using Synthetic Data Generated by Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:18:16.026888Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.10863"},"observation_digest":"sha256:0d1b6f08e864eaec4e1522f0f4ac403785a6f4b3a9c4902ccf1c66d4479330dd","observation_id":"99e65b3e-1487-470a-9e53-364929f7314a","resolution":{"observed_at":"2026-08-12T19:18:16.026888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T16:00:11.863323Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13742","last_updated":"2025-01-20T14:06:27Z","snapshot_observed_at":"2026-08-17T19:52:32.569545Z","submitted_at":"2024-11-20T22:54:23Z","title":"Benchmarking a wide range of optimisers for solving the Fermi-Hubbard model using the variational quantum eigensolver","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:00:11.863323Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.13742"},"observation_digest":"sha256:7f70aea41fd19d490a63748b078214f6553cc04e91e49942bd2fa74c3e4f6a0b","observation_id":"e7f5c465-7fc2-4bfc-a4eb-c47e6e6fb0e3","resolution":{"observed_at":"2026-08-12T16:00:11.863323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T15:48:13.127648Z","title":"Ruder, An overview of gradient descent optimization algorithms, ArXiv, abs/1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13903","last_updated":"2024-11-21T07:28:24Z","snapshot_observed_at":"2026-08-16T17:48:30.231432Z","submitted_at":"2024-11-21T07:28:24Z","title":"AmpliNetECG12: A lightweight SoftMax-based relativistic amplitude amplification architecture for 12 lead ECG classification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:48:13.127648Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.13903"},"observation_digest":"sha256:0a72f12e5a499a1aa6967182919b832465481d975b7b778bd16152f3e4453dc5","observation_id":"75107fea-2cc5-43c1-a451-1c4852cce15b","resolution":{"observed_at":"2026-08-12T15:48:13.127648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T14:28:42.722045Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15322","last_updated":"2024-11-22T19:30:40Z","snapshot_observed_at":"2026-08-14T00:04:37.702309Z","submitted_at":"2024-11-22T19:30:40Z","title":"Deep Learning-Based Automatic Delineation of Liver Domes in kV Triggered Images for Online Breath-hold Reproducibility Verification of Liver Stereotactic Body Radiation Therapy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:42.722045Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.15322"},"observation_digest":"sha256:a19e78105de73ced49ae57cee5e3aaf6430c89c001464782067d2caa2acbaad8","observation_id":"a169540f-787d-43e0-8739-45d58c44f29c","resolution":{"observed_at":"2026-08-12T14:28:42.722045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T14:02:39.728330Z","title":"Ruder, An overview of gradient descent optimization algorithms, arXiv preprint arXiv:1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15795","last_updated":"2024-12-16T11:06:00Z","snapshot_observed_at":"2026-08-15T00:19:18.427141Z","submitted_at":"2024-11-24T11:46:47Z","title":"Beyond adaptive gradient: Fast-Controlled Minibatch Algorithm for large-scale optimization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:02:39.728330Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.15795"},"observation_digest":"sha256:a8f63cc1ddbabc8d7d22ff1cc437aea7db4e06b29f89f9ccaa3ba33c00281286","observation_id":"3a018cd7-3bc7-4d2d-b9cb-3f25edad24fe","resolution":{"observed_at":"2026-08-12T14:02:39.728330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T13:16:34.255383Z","title":"Ruder, An overview of gradient descent optimization algorithms, arXiv preprint arXiv:1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16361","last_updated":"2025-07-16T13:06:24Z","snapshot_observed_at":"2026-08-17T00:49:11.807335Z","submitted_at":"2024-11-25T13:15:15Z","title":"Search for Higgs boson decays into a $Z$ boson and a light hadronically decaying resonance in $pp$ collisions at $\\sqrt{s}$=13 TeV with the ATLAS detector","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T13:16:34.255383Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.16361"},"observation_digest":"sha256:da044ba5aeb50c4844f9eed4f14e309eff19196a2346c7108f4fa871e9eee319","observation_id":"f6633fc6-984f-4c6c-8167-6ceb086f8b01","resolution":{"observed_at":"2026-08-12T13:16:34.255383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T12:51:27.857633Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16914","last_updated":"2024-11-25T20:32:57Z","snapshot_observed_at":"2026-08-16T09:48:10.112640Z","submitted_at":"2024-11-25T20:32:57Z","title":"Curvature in the Looking-Glass: Optimal Methods to Exploit Curvature of Expectation in the Loss Landscape","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T12:51:27.857633Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.16914"},"observation_digest":"sha256:58853374defee65ee6778be597b2986a373f9d32ce30ee9674b3bb515bbca68e","observation_id":"b543fdae-f9fe-42c7-a171-6cd66e0940b0","resolution":{"observed_at":"2026-08-12T12:51:27.857633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T12:39:37.198056Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.17006","last_updated":"2024-11-26T00:28:43Z","snapshot_observed_at":"2026-08-16T09:24:21.211796Z","submitted_at":"2024-11-26T00:28:43Z","title":"Event-based Spiking Neural Networks for Object Detection: A Review of Datasets, Architectures, Learning Rules, and Implementation","version":1},"reference_index":271,"source":"pdf_text","source_observed_at":"2026-08-12T12:39:37.198056Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.17006"},"observation_digest":"sha256:5459f8204b181602c3c2db140a536af49c3b06589a23f367957c11da646b304a","observation_id":"4a68f6b5-f5ac-4cc1-b94f-55d6440c1e4b","resolution":{"observed_at":"2026-08-12T12:39:37.198056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T11:37:26.101986Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.18085","last_updated":"2024-11-27T06:44:41Z","snapshot_observed_at":"2026-08-16T13:07:36.538993Z","submitted_at":"2024-11-27T06:44:41Z","title":"MONOPOLY: Learning to Price Public Facilities for Revaluing Private Properties with Large-Scale Urban Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:37:26.101986Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2411.18085"},"observation_digest":"sha256:6d5151facaff34071dfd3ab45b97f119fd75c60617eb74a2c1b4fb714608e529","observation_id":"b33821eb-ce2c-4d57-ad42-4344ab458d2d","resolution":{"observed_at":"2026-08-12T11:37:26.101986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T05:16:51.241496Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00640","last_updated":"2024-12-01T01:39:57Z","snapshot_observed_at":"2026-08-16T08:09:29.096495Z","submitted_at":"2024-12-01T01:39:57Z","title":"Stability of first-order methods in tame optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:16:51.241496Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.00640"},"observation_digest":"sha256:71a83758aa315d5afbc54ed4824dcfd412debefa0dc20ae496f9660c79bcfad2","observation_id":"c7a540bb-bf7b-435a-b265-b2d8bc99425c","resolution":{"observed_at":"2026-08-12T05:16:51.241496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-12T04:31:21.396260Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.01371","last_updated":"2024-12-02T10:55:38Z","snapshot_observed_at":"2026-08-15T15:20:15.611939Z","submitted_at":"2024-12-02T10:55:38Z","title":"An overview of diffusion models for generative artificial intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:31:21.396260Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.01371"},"observation_digest":"sha256:e33c3a94f4b57651658e5f57bbbaa9b4e63c0b9ce876424dd369995041d34893","observation_id":"748af1b9-7f9b-4160-ad04-980d1d63c8ae","resolution":{"observed_at":"2026-08-12T04:31:21.396260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T23:56:55.098412Z","title":"Ruder, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.02089","last_updated":"2024-12-03T02:20:30Z","snapshot_observed_at":"2026-08-15T03:50:08.814477Z","submitted_at":"2024-12-03T02:20:30Z","title":"Offline Stochastic Optimization of Black-Box Objective Functions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:56:55.098412Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.02089"},"observation_digest":"sha256:85201f7ea2163226015ade0a4998dc30bf0b583e8f63d4919323a1ee96939dd5","observation_id":"b790824e-39b0-4e02-837f-4fcdc22bc455","resolution":{"observed_at":"2026-08-11T23:56:55.098412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T22:28:56.692516Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03489","last_updated":"2025-08-06T06:04:26Z","snapshot_observed_at":"2026-08-18T16:05:42.478117Z","submitted_at":"2024-12-04T17:26:21Z","title":"Stochastic Gradient Estimation for Higher-order Differentiable Rendering","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:28:56.692516Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.03489"},"observation_digest":"sha256:dac4841ad4646edcfe7d85f3cbb82d2ef00020482fb458d1036de9cd1bc82460","observation_id":"7a251184-0667-4ace-9032-1436bb1c02a2","resolution":{"observed_at":"2026-08-11T22:28:56.692516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T22:11:36.593050Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03752","last_updated":"2025-03-30T21:09:13Z","snapshot_observed_at":"2026-08-18T19:23:34.404087Z","submitted_at":"2024-12-04T22:46:06Z","title":"Beyond Local Sharpness: Communication-Efficient Global Sharpness-aware Minimization for Federated Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:36.593050Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.03752"},"observation_digest":"sha256:d7a85c78e8e6ab87a1711d46f7909051fed08e135895c54ebd5d27c737e55688","observation_id":"a1d27fbd-79d3-49b6-aa98-1c8154658027","resolution":{"observed_at":"2026-08-11T22:11:36.593050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T22:03:47.379445Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03876","last_updated":"2026-05-29T05:06:30Z","snapshot_observed_at":"2026-08-17T02:00:20.841742Z","submitted_at":"2024-12-05T05:12:30Z","title":"Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:03:47.379445Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.03876"},"observation_digest":"sha256:ccd997f4fdbaacc48e05ed386f8186870192da00857441595474d07f9deb222c","observation_id":"94a86e68-37f9-48b5-bdfc-786493794353","resolution":{"observed_at":"2026-08-11T22:03:47.379445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T18:04:51.012074Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08286","last_updated":"2024-12-11T11:00:39Z","snapshot_observed_at":"2026-08-18T11:48:51.595230Z","submitted_at":"2024-12-11T11:00:39Z","title":"Towards Precision in Bolted Joint Design: A Preliminary Machine Learning-Based Parameter Prediction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:04:51.012074Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.08286"},"observation_digest":"sha256:8587628fdd5b46037cd17d46fba801cc93b0fc5698f7a34025e91b5fd16fcd55","observation_id":"3cdb4371-9f5f-429b-af62-c33d455a8315","resolution":{"observed_at":"2026-08-11T18:04:51.012074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T17:34:18.039860Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08894","last_updated":"2024-12-13T04:03:14Z","snapshot_observed_at":"2026-08-17T04:10:33.897815Z","submitted_at":"2024-12-12T03:14:50Z","title":"SMMF: Square-Matricized Momentum Factorization for Memory-Efficient Optimization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:34:18.039860Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.08894"},"observation_digest":"sha256:d9f30a894709e52b7720af01a694d25761291460f0164d82c677588b64139ff9","observation_id":"471d9fdf-fe8b-42a5-b39a-870051cbd735","resolution":{"observed_at":"2026-08-11T17:34:18.039860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T15:37:56.071559Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10853","last_updated":"2025-02-14T13:33:14Z","snapshot_observed_at":"2026-08-13T18:52:47.507868Z","submitted_at":"2024-12-14T14:54:44Z","title":"SEW: Self-calibration Enhanced Whole Slide Pathology Image Analysis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:37:56.071559Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.10853"},"observation_digest":"sha256:a5b3b1ccbd4f5908bcdd8b48c4e549efaff761bc3c01eba916ffcca4a3e46888","observation_id":"4d58cbeb-8a79-49e5-b3f8-ed27db462427","resolution":{"observed_at":"2026-08-11T15:37:56.071559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T15:21:47.153620Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11168","last_updated":"2025-03-10T12:26:21Z","snapshot_observed_at":"2026-08-14T03:38:21.013529Z","submitted_at":"2024-12-15T12:34:22Z","title":"PGD-Imp: Rethinking and Unleashing Potential of Classic PGD with Dual Strategies for Imperceptible Adversarial Attacks","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:21:47.153620Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.11168"},"observation_digest":"sha256:c777ea714ffea57957c399d49d808aa02b3ebab808f8f06c81d999bf51fd412b","observation_id":"0fd98446-37bb-4953-9583-b58096227505","resolution":{"observed_at":"2026-08-11T15:21:47.153620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T13:58:47.119946Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.12614","last_updated":"2024-12-24T03:57:49Z","snapshot_observed_at":"2026-08-14T04:04:57.938831Z","submitted_at":"2024-12-17T07:25:09Z","title":"NTC-KWS: Noise-aware CTC for Robust Keyword Spotting","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T13:58:47.119946Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.12614"},"observation_digest":"sha256:1843481cba5e6b594736985ec2b5dbdcd62342ced75d7387a24bd860cc040a04","observation_id":"42932dc1-ab74-4ee4-916f-fe8bfbbc0a64","resolution":{"observed_at":"2026-08-11T13:58:47.119946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T11:57:02.301186Z","title":"arXiv preprint arXiv:1609.04747 (2016) 13","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14833","last_updated":"2025-03-09T09:43:50Z","snapshot_observed_at":"2026-08-17T21:44:59.962980Z","submitted_at":"2024-12-19T13:21:04Z","title":"Synchronized and Fine-Grained Head for Skeleton-Based Ambiguous Action Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T11:57:02.301186Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.14833"},"observation_digest":"sha256:2bc7836ee27b70465dc98a39c834b44f1522e0e48ea47081a4a41774d8688fb4","observation_id":"37f98266-83c0-4f90-b5a2-357823e7d25e","resolution":{"observed_at":"2026-08-11T11:57:02.301186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T11:25:18.724431Z","title":"Ruder, An overview of gradient descent optimization algorithms, ArXiv abs/1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.15581","last_updated":"2024-12-20T05:29:45Z","snapshot_observed_at":"2026-08-18T18:16:31.934076Z","submitted_at":"2024-12-20T05:29:45Z","title":"Random Batch Method with Momentum Correction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:25:18.724431Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.15581"},"observation_digest":"sha256:2cee57693419195c6fdbf638b9d374ad662a276cd3aa75ec9ba0163855147495","observation_id":"8ec74140-0a80-44d9-8cac-b7b01bf9d1e1","resolution":{"observed_at":"2026-08-11T11:25:18.724431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T14:56:34.001808Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16191","last_updated":"2024-12-16T07:37:47Z","snapshot_observed_at":"2026-08-18T15:05:52.009925Z","submitted_at":"2024-12-16T07:37:47Z","title":"Real-valued continued fraction of straight lines","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:34.001808Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.16191"},"observation_digest":"sha256:f7f2d2f926573f792b5696e7b32db92b890d1d02e8b892029e724e32278350a4","observation_id":"efc176b8-28d3-4e90-8b2c-3aa637a6962b","resolution":{"observed_at":"2026-08-11T14:56:34.001808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T06:00:15.642310Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16946","last_updated":"2024-12-22T09:40:48Z","snapshot_observed_at":"2026-08-18T12:15:46.160491Z","submitted_at":"2024-12-22T09:40:48Z","title":"Video Domain Incremental Learning for Human Action Recognition in Home Environments","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T06:00:15.642310Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.16946"},"observation_digest":"sha256:917ad79e72322bb223078e44a0829c6aff0371f5c0024299bc2ffcc12f8aa927","observation_id":"2352cb9c-010d-4bad-80f9-1d78771555b9","resolution":{"observed_at":"2026-08-11T06:00:15.642310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T05:52:57.300913Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17107","last_updated":"2025-03-05T07:29:42Z","snapshot_observed_at":"2026-08-15T02:20:16.458743Z","submitted_at":"2024-12-22T17:39:32Z","title":"Grams: Gradient Descent with Adaptive Momentum Scaling","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:52:57.300913Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.17107"},"observation_digest":"sha256:b84ad83daa1458d18a1dfa98d8005cf4f82bb8af6a7a6f80db5b0ac0be74e62f","observation_id":"77d4c6cb-1434-4256-bbc5-e074de49aa50","resolution":{"observed_at":"2026-08-11T05:52:57.300913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-11T11:24:55.598495Z","title":"An Overview of Gradient Descent Optimization Algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17855","last_updated":"2024-12-20T03:20:58Z","snapshot_observed_at":"2026-08-18T23:57:31.070592Z","submitted_at":"2024-12-20T03:20:58Z","title":"Foxtsage vs. Adam: Revolution or Evolution in Optimization?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:55.598495Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.17855"},"observation_digest":"sha256:0899edcaeaaa1fe05358b0a5490f33e7dc8941738ffcfc81bdfd713f90555f58","observation_id":"09ef9a0f-268d-4d46-8e49-732099dfb3a3","resolution":{"observed_at":"2026-08-11T11:24:55.598495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T23:29:16.930323Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20302","last_updated":"2025-05-16T08:00:28Z","snapshot_observed_at":"2026-08-17T00:26:18.548502Z","submitted_at":"2024-12-29T00:11:54Z","title":"EXAdam: The Power of Adaptive Cross-Moments","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:16.930323Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.20302"},"observation_digest":"sha256:6363d50cc09e41343a9f1b34cdbfa4913150f76ac2bde0c3e6bbb4191fa55ea8","observation_id":"3ae48589-efdb-4a37-b204-6f4267cc1d06","resolution":{"observed_at":"2026-08-10T23:29:16.930323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T23:08:15.087964Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.21049","last_updated":"2024-12-30T16:08:12Z","snapshot_observed_at":"2026-08-18T01:15:49.688870Z","submitted_at":"2024-12-30T16:08:12Z","title":"Learning Epidemiological Dynamics via the Finite Expression Method","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:15.087964Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2412.21049"},"observation_digest":"sha256:453e25ae8b9f18d5a4792d07bccfd8f1b5fa2043e659263322f5130ff90f0b5e","observation_id":"647e8ea4-e8dc-45a7-9b6d-541586ee3812","resolution":{"observed_at":"2026-08-10T23:08:15.087964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T21:37:57.351615Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04379","last_updated":"2025-01-08T09:45:14Z","snapshot_observed_at":"2026-08-16T16:52:20.366350Z","submitted_at":"2025-01-08T09:45:14Z","title":"Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:37:57.351615Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.04379"},"observation_digest":"sha256:98ae03742c178d599c722565863bc5cb40760b98e978ba7fadde9f94a79c2621","observation_id":"5fd56fea-2983-41db-ac35-7f198a3f1abd","resolution":{"observed_at":"2026-08-10T21:37:57.351615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T21:11:06.921779Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06081","last_updated":"2025-01-10T16:15:25Z","snapshot_observed_at":"2026-08-16T17:41:40.673661Z","submitted_at":"2025-01-10T16:15:25Z","title":"Averaged Adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:06.921779Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.06081"},"observation_digest":"sha256:bd023e50b3e960eceb871e48aab619cd51d5f2532adf525d0c1ba9847881205a","observation_id":"bc5265ac-68dc-4c86-9aa8-9c6755fd3ea6","resolution":{"observed_at":"2026-08-10T21:11:06.921779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T20:34:07.245243Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08193","last_updated":"2025-01-14T15:14:26Z","snapshot_observed_at":"2026-08-18T18:49:24.666387Z","submitted_at":"2025-01-14T15:14:26Z","title":"Modeling Quantum Machine Learning for Genomic Data Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:07.245243Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.08193"},"observation_digest":"sha256:e0e45f7434d3c8faabc44c6c17fced357264d837c559247f4fb27aff8b4fab6f","observation_id":"a753021c-4c7a-482e-a1d5-95920eab0cd6","resolution":{"observed_at":"2026-08-10T20:34:07.245243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T19:55:19.153546Z","title":"An overview of gradient descent optimization algo- rithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09608","last_updated":"2025-01-16T15:32:41Z","snapshot_observed_at":"2026-08-18T02:16:30.532447Z","submitted_at":"2025-01-16T15:32:41Z","title":"Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:55:19.153546Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.09608"},"observation_digest":"sha256:9e6da68b07164c9d68dd6d2b46181c966b6273f349e7873098852992711386b7","observation_id":"a524e6c8-1f54-483a-afb9-4711bb84588f","resolution":{"observed_at":"2026-08-10T19:55:19.153546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-08-16T15:15:38.321253Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:17.473970Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.09732"},"observation_digest":"sha256:8a96a38c540494e666bc2878b031484ab046dc367291e26fa7b92987a66f352f","observation_id":"b9b48804-0e5e-4093-a6b9-bed3e3cb9912","resolution":{"observed_at":"2026-05-20T11:45:17.518404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T18:26:52.988799Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12417","last_updated":"2025-01-20T10:22:01Z","snapshot_observed_at":"2026-08-13T21:25:19.679040Z","submitted_at":"2025-01-20T10:22:01Z","title":"Egoistic MDS-based Rigid Body Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:26:52.988799Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.12417"},"observation_digest":"sha256:9ede7e64f8a8704de0e4d582c181647f3c7106101175f0dc98f397a7f94f0e56","observation_id":"a3426647-09db-405a-93cc-0dbfe02cef19","resolution":{"observed_at":"2026-08-10T18:26:52.988799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T22:57:49.730165Z","title":"arXiv preprint arXiv:1609.04747","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14775","last_updated":"2024-12-31T08:03:15Z","snapshot_observed_at":"2026-08-18T17:38:15.388418Z","submitted_at":"2024-12-31T08:03:15Z","title":"Hybrid Firefly-Genetic Algorithm for Single and Multi-dimensional 0-1 Knapsack Problems","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:49.730165Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.14775"},"observation_digest":"sha256:c469137503aca122ac160a1e6c056fb585e52252e27da7b15f30cb07425ed62a","observation_id":"fbe2ebd8-456e-45ff-bd2f-a70a72e01647","resolution":{"observed_at":"2026-08-10T22:57:49.730165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T14:42:33.176756Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15065","last_updated":"2025-01-25T04:09:56Z","snapshot_observed_at":"2026-08-17T22:30:06.678846Z","submitted_at":"2025-01-25T04:09:56Z","title":"Task Arithmetic in Trust Region: A Training-Free Model Merging Approach to Navigate Knowledge Conflicts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T14:42:33.176756Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.15065"},"observation_digest":"sha256:afeb0b3196ff3fcd7eda5a85c7d2b0d93e6c9ec9597f8490fe17df74d896d106","observation_id":"51887331-b80e-453a-84f2-de6f896b9e96","resolution":{"observed_at":"2026-08-10T14:42:33.176756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T14:28:00.603627Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15318","last_updated":"2025-01-25T20:05:27Z","snapshot_observed_at":"2026-08-15T23:36:48.990829Z","submitted_at":"2025-01-25T20:05:27Z","title":"A Post-Processing-Based Fair Federated Learning Framework","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:28:00.603627Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.15318"},"observation_digest":"sha256:e54e006615e92de8d02c1172cd32ec2c954e4fb122698b836faab6ae65093094","observation_id":"6a57d00f-c8b3-4e3a-8cac-57aaa049a9d2","resolution":{"observed_at":"2026-08-10T14:28:00.603627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T14:10:55.258087Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.258087Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:e33fd6e8e51bf03439f5dcba4f85f217daa0990a31b86497c5dc1eaf377335b7","observation_id":"587b5c32-04c1-459a-b2e3-85e6a28f2179","resolution":{"observed_at":"2026-08-10T14:10:55.258087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T14:03:43.473254Z","title":"2016, arXiv e-prints, arXiv:1609.04747, 10.48550/arXiv.1609.04747","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15739","last_updated":"2025-01-27T03:04:34Z","snapshot_observed_at":"2026-08-15T08:05:54.348325Z","submitted_at":"2025-01-27T03:04:34Z","title":"Automatic Machine Learning Framework to Study Morphological Parameters of AGN Host Galaxies within $z < 1.4$ in the Hyper Supreme-Cam Wide Survey","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T14:03:43.473254Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.15739"},"observation_digest":"sha256:43e1c4ce2b327534725638588b6cec15fddd7e5e28372ade65c0455ccc715cb2","observation_id":"7d86151f-fd86-4a57-b88c-7af7eff89162","resolution":{"observed_at":"2026-08-10T14:03:43.473254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T13:41:16.206540Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.16228","last_updated":"2025-01-27T17:22:34Z","snapshot_observed_at":"2026-08-15T00:57:00.465898Z","submitted_at":"2025-01-27T17:22:34Z","title":"Optimizer-Dependent Generalization Bound for Quantum Neural Networks","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:16.206540Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.16228"},"observation_digest":"sha256:5c9e64d496410c0049f1e98ec9c0ec45dc169122c923343dc1705a80477c1fe4","observation_id":"9c3d9c6f-e5d7-4307-b6b5-3ad5527175aa","resolution":{"observed_at":"2026-08-10T13:41:16.206540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T10:08:11.530109Z","title":"Ruder, An overview of gradient descent optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16867","last_updated":"2025-01-28T11:36:09Z","snapshot_observed_at":"2026-08-14T09:23:32.352635Z","submitted_at":"2025-01-28T11:36:09Z","title":"Empirical modeling and hybrid machine learning framework for nucleate pool boiling on microchannel structured surfaces","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T10:08:11.530109Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.16867"},"observation_digest":"sha256:aa235624ec7d9faa388286c2dbf626f9fd04e0660569639c8f0f8363a1d4450e","observation_id":"47c3d01b-ac5b-41f6-ae35-de83a5713d09","resolution":{"observed_at":"2026-08-10T10:08:11.530109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-09T21:57:15.054955Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.18935","last_updated":"2025-05-31T08:08:18Z","snapshot_observed_at":"2026-08-15T11:30:10.841944Z","submitted_at":"2025-01-31T07:40:34Z","title":"TabFSBench: Tabular Benchmark for Feature Shifts in Open Environments","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T21:57:15.054955Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.18935"},"observation_digest":"sha256:f070f2b5d6607829952442713ecb05e28821285d85d388b5580cc994c0cdb17d","observation_id":"539a94ad-ad79-4911-9679-982667aa7cc0","resolution":{"observed_at":"2026-08-09T21:57:15.054955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-09T20:34:01.424326Z","title":", year 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.19370","last_updated":"2025-01-31T18:21:12Z","snapshot_observed_at":"2026-08-18T14:39:51.264690Z","submitted_at":"2025-01-31T18:21:12Z","title":"Greedy Stein Variational Gradient Descent: An algorithmic approach for wave prospection problems","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.424326Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.19370"},"observation_digest":"sha256:d36075186e4bcdd72c27c921fea6a4d3a5a2b5fe8c36cd5051588c04dcb4acdf","observation_id":"a87fbcb6-9ebd-42d2-b46b-fe9968653ab3","resolution":{"observed_at":"2026-08-09T20:34:01.424326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-09T19:57:19.460289Z","title":"arXiv preprint arXiv:1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00182","last_updated":"2025-06-03T16:38:42Z","snapshot_observed_at":"2026-08-18T06:08:15.630904Z","submitted_at":"2025-01-31T21:58:15Z","title":"Understanding Federated Learning from IID to Non-IID dataset: An Experimental Study","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:57:19.460289Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2502.00182"},"observation_digest":"sha256:7d625bda5bcdfae476aafd4f0b695cb2c1cbd68c2eb72a6b440cef06267b3afb","observation_id":"7332f7ad-1de9-45a2-b9c1-663592e6307b","resolution":{"observed_at":"2026-08-09T19:57:19.460289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-09T14:50:58.724319Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01634","last_updated":"2025-02-03T18:59:04Z","snapshot_observed_at":"2026-08-18T19:04:32.281863Z","submitted_at":"2025-02-03T18:59:04Z","title":"Online Gradient Boosting Decision Tree: In-Place Updates for Efficient Adding/Deleting Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T14:50:58.724319Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2502.01634"},"observation_digest":"sha256:7d656e09d91e1be5d3ebcbfca8356278d2580a5b4b1f49e167635590e6a1854d","observation_id":"b4d840a8-93af-4040-9557-c44a928eb086","resolution":{"observed_at":"2026-08-09T14:50:58.724319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-09T13:03:36.701438Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02202","last_updated":"2025-02-05T11:13:34Z","snapshot_observed_at":"2026-08-11T12:34:27.934055Z","submitted_at":"2025-02-04T10:27:54Z","title":"Multi-level Supervised Contrastive Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T13:03:36.701438Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2502.02202"},"observation_digest":"sha256:043d4ffa45f0534f11f69066f666a0551c6f361c68d44b0750fcf91dd88b8fc8","observation_id":"697e1e7a-5072-47ec-b11d-fad450baa5fa","resolution":{"observed_at":"2026-08-09T13:03:36.701438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-08T20:51:10.096594Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05244","last_updated":"2025-02-07T14:29:07Z","snapshot_observed_at":"2026-08-17T22:12:55.119831Z","submitted_at":"2025-02-07T14:29:07Z","title":"Probabilistic Artificial Intelligence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:51:10.096594Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2502.05244"},"observation_digest":"sha256:598c5ba5ffb4c395fa4a32dcd025450d22b51a72714630bfacfa24580636ae81","observation_id":"d73a48d9-9e5a-49bb-b27c-57f90561eb63","resolution":{"observed_at":"2026-08-08T20:51:10.096594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-08T13:12:17.015877Z","title":"Ruder, An overview of gradient descent optimization algorithms, CoRR abs/1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07317","last_updated":"2025-02-11T07:27:41Z","snapshot_observed_at":"2026-08-18T00:39:30.548572Z","submitted_at":"2025-02-11T07:27:41Z","title":"Position reconstruction and surface background model for the PandaX-4T detector","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:12:17.015877Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2502.07317"},"observation_digest":"sha256:f5c48353869f063acde821623a515521a5f018d3a4d5dd96057ac646f2b1aa37","observation_id":"41a406cd-f410-45c1-92dd-304d80258971","resolution":{"observed_at":"2026-08-08T13:12:17.015877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-08T05:12:33.575982Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08441","last_updated":"2025-08-01T15:28:51Z","snapshot_observed_at":"2026-08-16T20:39:13.907720Z","submitted_at":"2025-02-12T14:32:17Z","title":"Better Embeddings with Coupled Adam","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T05:12:33.575982Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2502.08441"},"observation_digest":"sha256:9b36a6817d2c7877017f1dd3b41841b55f0acab2da94ea3c8889eb5208078d75","observation_id":"65579a00-31e0-4e9c-bad7-01316c086f3d","resolution":{"observed_at":"2026-08-08T05:12:33.575982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T12:37:36.756445Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12601","last_updated":"2025-04-17T02:56:20Z","snapshot_observed_at":"2026-08-16T12:25:32.852543Z","submitted_at":"2025-04-17T02:56:20Z","title":"Stochastic Gradient Descent in Non-Convex Problems: Asymptotic Convergence with Relaxed Step-Size via Stopping Time Methods","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.756445Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.12601"},"observation_digest":"sha256:14e11df3fae8c88f794430fd8f5a8b60d606ac31da6aab8f63572964beb30e11","observation_id":"fd54b708-b542-408c-b768-f6b058eb735d","resolution":{"observed_at":"2026-08-16T12:37:36.756445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T12:30:11.838982Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12750","last_updated":"2025-04-17T08:44:29Z","snapshot_observed_at":"2026-08-16T12:20:57.735818Z","submitted_at":"2025-04-17T08:44:29Z","title":"Spatial Functional Deep Neural Network Model: A New Prediction Algorithm","version":1},"reference_index":4946,"source":"pdf_text","source_observed_at":"2026-08-16T12:30:11.838982Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.12750"},"observation_digest":"sha256:a6f603673ed975c9dbfb8693db65790015509904a03f9b467bd7f7d3c4442c46","observation_id":"1d9b7db4-e621-41aa-8047-85ca960fab7f","resolution":{"observed_at":"2026-08-16T12:30:11.838982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T12:08:38.724459Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13990","last_updated":"2025-04-18T14:18:02Z","snapshot_observed_at":"2026-08-16T11:59:44.996801Z","submitted_at":"2025-04-18T14:18:02Z","title":"PC-DeepNet: A GNSS Positioning Error Minimization Framework Using Permutation-Invariant Deep Neural Network","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:08:38.724459Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.13990"},"observation_digest":"sha256:2fee75f91e03cb1c9b5f15184d2931f4931aca034bab45bc8f00017a4007f78c","observation_id":"b2c79674-f74f-4612-bea3-0dca541c2dc3","resolution":{"observed_at":"2026-08-16T12:08:38.724459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:47:42.998287Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14665","last_updated":"2025-04-20T16:14:07Z","snapshot_observed_at":"2026-08-16T11:41:26.065716Z","submitted_at":"2025-04-20T16:14:07Z","title":"DMPCN: Dynamic Modulated Predictive Coding Network with Hybrid Feedback Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:47:42.998287Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.14665"},"observation_digest":"sha256:2a2230b4ed3f6d89b5e2c71d5c928f7d24354c6e033cc7df9cebdaa17091273d","observation_id":"9c838f7c-3b71-476b-babf-db6a0c407c60","resolution":{"observed_at":"2026-08-16T11:47:42.998287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:45:51.109184Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14817","last_updated":"2025-04-21T02:50:34Z","snapshot_observed_at":"2026-08-16T11:38:06.662678Z","submitted_at":"2025-04-21T02:50:34Z","title":"DNN based HRIRs Identification with a Continuously Rotating Speaker Array","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:51.109184Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.14817"},"observation_digest":"sha256:5c673fc2f15f52723fb7f9031b6fb2e7a3d771ef27688a7cbc8dc6ff95d9bdbf","observation_id":"52ca542d-a173-4eeb-aa75-bec36faccbc5","resolution":{"observed_at":"2026-08-16T11:45:51.109184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:18:01.212175Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.212175Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6d17b1ed51cbbfeb82866da7712a9cbe641ebd8800ab46e40de7e2fea8dc0a7f","observation_id":"b9af3f5e-22ba-4e4d-afd8-44cd4c145b01","resolution":{"observed_at":"2026-08-16T11:18:01.212175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:17:24.970863Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16182","last_updated":"2025-08-14T12:34:24Z","snapshot_observed_at":"2026-08-18T19:45:10.511648Z","submitted_at":"2025-04-22T18:15:30Z","title":"CGD: Modifying the Loss Landscape by Gradient Regularization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:24.970863Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.16182"},"observation_digest":"sha256:f3e2964729dd9c1f2d4e9a6f6261af0d02fbc9d7e3aa3b68659e6534480880ed","observation_id":"487a73bf-cb57-495c-982c-b3997eeb1fe2","resolution":{"observed_at":"2026-08-16T11:17:24.970863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:11:20.610925Z","title":"arXiv preprint arXiv:1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16263","last_updated":"2025-04-22T20:47:06Z","snapshot_observed_at":"2026-08-18T16:12:04.384220Z","submitted_at":"2025-04-22T20:47:06Z","title":"Gradient-Optimized Fuzzy Classifier: A Benchmark Study Against State-of-the-Art Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:11:20.610925Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.16263"},"observation_digest":"sha256:58d8db4c0fa73150962353669f00b1b4689ab6e1b5b7c71a8aae6a2be849192b","observation_id":"a8a0c7ec-63c6-410f-b9de-cdf8c4302574","resolution":{"observed_at":"2026-08-16T11:11:20.610925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T10:39:10.872037Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.17618","last_updated":"2025-04-24T14:43:07Z","snapshot_observed_at":"2026-08-18T17:02:07.736388Z","submitted_at":"2025-04-24T14:43:07Z","title":"The effects of Hessian eigenvalue spectral density type on the applicability of Hessian analysis to generalization capability assessment of neural networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:10.872037Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.17618"},"observation_digest":"sha256:a35e909d0bb7c5a8eb15aa5cdc6e9a304c390d23d959def0a0976d0ec08049a0","observation_id":"70df41f0-634c-4b24-943f-eb35c9ed958e","resolution":{"observed_at":"2026-08-16T10:39:10.872037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T10:27:02.854963Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18105","last_updated":"2025-04-25T06:22:31Z","snapshot_observed_at":"2026-08-16T10:21:50.347913Z","submitted_at":"2025-04-25T06:22:31Z","title":"Temperature Estimation in Induction Motors using Machine Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:27:02.854963Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.18105"},"observation_digest":"sha256:8a62bbeccc5b71c88055901ec4a0e690e77cd67c5db7a664e07daa8a8d4f0ff1","observation_id":"655c9cfd-6a3a-49e5-b14d-f6ceb0ef5c10","resolution":{"observed_at":"2026-08-16T10:27:02.854963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T10:16:55.689242Z","title":"An overview of gradient descent optimization algo rithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18694","last_updated":"2025-07-01T17:42:54Z","snapshot_observed_at":"2026-08-18T17:08:21.162690Z","submitted_at":"2025-04-25T21:03:19Z","title":"Experimental neuromorphic computing based on quantum memristor","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:55.689242Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.18694"},"observation_digest":"sha256:87ffc653356b1459a57b519ac1525bfa7c922600f4e84ad3272b1101f1682554","observation_id":"47ba8615-4a02-40ff-ae95-eae0628b47df","resolution":{"observed_at":"2026-08-16T10:16:55.689242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T06:07:20.787013Z","title":"arXiv preprint arXiv:1609.04747, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.19083","last_updated":"2025-04-27T02:45:13Z","snapshot_observed_at":"2026-08-16T05:59:36.232471Z","submitted_at":"2025-04-27T02:45:13Z","title":"Performance Study of a Position-sensitive Plastic Scintillator Detector","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T06:07:20.787013Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.19083"},"observation_digest":"sha256:64edd19d5d6206a7f12e94cdcc49301f074a6a6717c36cf5dc267fb40de9b442","observation_id":"17266983-f4f8-4649-bc9f-45554ccf5091","resolution":{"observed_at":"2026-08-16T06:07:20.787013Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T06:04:09.777150Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.777150Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:daaa9f6bf2fc9f7a569b125769b0560bf9b9aee637d6e403a7ae37356c7ab269","observation_id":"3bf2af90-2139-4dc3-8400-1cf1c3df1241","resolution":{"observed_at":"2026-08-16T06:04:09.777150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T00:49:23.056315Z","title":"An overview of gradient descent optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02743","last_updated":"2026-07-30T19:20:59Z","snapshot_observed_at":"2026-08-18T01:11:46.377663Z","submitted_at":"2025-05-05T15:50:52Z","title":"Cooperative Variance Estimation and Bayesian Neural Networks for Disentangling Aleatoric and Epistemic Uncertainties","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:49:23.056315Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.02743"},"observation_digest":"sha256:fa9aac69ef28afed899b1378b66c3c80eee37f4ab47ac77638fd39e1aaeb1aa3","observation_id":"4d609abe-2fbc-4ea8-a7c3-2e3cd43365e1","resolution":{"observed_at":"2026-08-16T00:49:23.056315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-15T23:58:42.089480Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.03475","last_updated":"2025-05-29T08:23:44Z","snapshot_observed_at":"2026-08-18T12:50:14.251276Z","submitted_at":"2025-05-06T12:28:50Z","title":"am-ELO: A Stable Framework for Arena-based LLM Evaluation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:58:42.089480Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.03475"},"observation_digest":"sha256:f2d7bb51743fcfe5cb4bc9f1a1981ea3f8bbf2d56540e539329e233506c456d0","observation_id":"e820b6c3-aab5-4eff-aec3-c94f4558e81c","resolution":{"observed_at":"2026-08-15T23:58:42.089480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T00:01:10.972577Z","title":"An overview of gradient descent optimization algo- rithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.03533","last_updated":"2025-05-06T13:41:59Z","snapshot_observed_at":"2026-08-18T12:17:17.742170Z","submitted_at":"2025-05-06T13:41:59Z","title":"Small-Scale-Fading-Aware Resource Allocation in Wireless Federated Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:01:10.972577Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.03533"},"observation_digest":"sha256:72b8bf239d70d984c423782a279347bd86a1a0c5cc1b498e17e2e083158107b5","observation_id":"4a948858-2f87-44ce-825f-48463cf17d81","resolution":{"observed_at":"2026-08-16T00:01:10.972577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-15T23:38:30.281970Z","title":"Ruder, arXiv preprint arXiv:1609.04747 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.04236","last_updated":"2025-05-07T08:40:41Z","snapshot_observed_at":"2026-08-17T12:28:03.351710Z","submitted_at":"2025-05-07T08:40:41Z","title":"Neural-network-based longitudinal electric field prediction in nonlinear plasma wakefield accelerators","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:38:30.281970Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.04236"},"observation_digest":"sha256:9c47792c0e26a3009077fb5ab70860673098e5d4c32de0d1e5061eac728e6419","observation_id":"b58abad4-35e1-4d97-8bdc-05c30c2bcd95","resolution":{"observed_at":"2026-08-15T23:38:30.281970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-15T23:34:30.198645Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04354","last_updated":"2025-05-07T12:07:49Z","snapshot_observed_at":"2026-08-18T08:01:09.386780Z","submitted_at":"2025-05-07T12:07:49Z","title":"Optimization Problem Solving Can Transition to Evolutionary Agentic Workflows","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:30.198645Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.04354"},"observation_digest":"sha256:ec06dd6fc69d8dd2a299cc6cfb7f0b5c6522353f0b0fc938b64cac7c20b4090d","observation_id":"7d099c10-b6df-4792-bcc1-db950e49a0e7","resolution":{"observed_at":"2026-08-15T23:34:30.198645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-15T22:57:22.561096Z","title":"An Overview of Gradient Descent OptimizationAlgorithms (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05961","last_updated":"2026-07-15T20:34:56Z","snapshot_observed_at":"2026-08-15T22:49:43.366806Z","submitted_at":"2025-05-09T11:21:51Z","title":"GEORCE: A Fast New Control Algorithm for Computing Geodesics","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:22.561096Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.05961"},"observation_digest":"sha256:adaceefb693106e3c50984066fda2c386b289731fa031ae166be254fb399c6f2","observation_id":"399da835-a152-4217-a9d7-337d62a133ef","resolution":{"observed_at":"2026-08-15T22:57:22.561096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-15T22:22:58.251409Z","title":"An Overview of Gradient Descent Optimization Algorithms,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07411","last_updated":"2025-06-15T08:13:14Z","snapshot_observed_at":"2026-08-18T19:57:07.707400Z","submitted_at":"2025-05-12T10:07:23Z","title":"ICE-Pruning: An Iterative Cost-Efficient Pruning Pipeline for Deep Neural Networks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:22:58.251409Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.07411"},"observation_digest":"sha256:1ead7c7f0eae060c476e6ddc646dbd601878831cd74d75809ccf990abaa14ca3","observation_id":"1797b787-1d8c-4a1a-9bd2-445656cc49d0","resolution":{"observed_at":"2026-08-15T22:22:58.251409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-15T20:25:09.537802Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13144","last_updated":"2025-05-19T14:11:14Z","snapshot_observed_at":"2026-08-16T01:31:00.705521Z","submitted_at":"2025-05-19T14:11:14Z","title":"Temporal Distance-aware Transition Augmentation for Offline Model-based Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:25:09.537802Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.13144"},"observation_digest":"sha256:39901e14dfdf6603caaac4e8f26b7d0805a9c9259c8f58064af64d264b142c66","observation_id":"f6e61a0a-aea5-4b8e-ac32-5eb4289fc6ad","resolution":{"observed_at":"2026-08-15T20:25:09.537802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":"1609.04747","doi":"10.48550/arxiv.1609.04747","metadata_source":"pith","pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An overview of gradient descent optimization algorithms","venue":"cs.LG","work_id":"840f481e-6e07-4454-8939-95804142c46d","year":2016},"citing_paper":{"arxiv_id":"2505.13196","last_updated":"2026-06-09T19:32:07Z","snapshot_observed_at":"2026-08-17T04:04:14.844862Z","submitted_at":"2025-05-19T14:51:40Z","title":"A Physics-Inspired Optimizer: Velocity Regularized Adam","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T14:34:37.468180Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.13196"},"observation_digest":"sha256:d5d79035481d2bd7055a5cdb55d33ea8cb97f4e243214c179d9199cc5ad27c71","observation_id":"b83e88f9-b00c-4f24-8e1f-1b493fcb593a","resolution":{"observed_at":"2026-05-22T14:34:54.330966Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T05:08:09.422576+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1609.04747/citation-record","integrity":"/paper/1609.04747/integrity","json":"/paper/1609.04747/citation-record.json","paper":"/paper/1609.04747"},"outbound":[],"paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 100 inbound Pith citation observations for arXiv:1609.04747."}