{"as_of":"2026-08-17T19:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:907df5bae0ebe4c974ae918681ff157ef604078a385ad1bd54e4577c12e6251d","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:04:09.790187Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:42:54.670505Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T10:30:00.239783Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19426","snapshot_observed_at":"2026-08-07T10:42:54.670505Z","title":"Sharp higher order convergence rates for the adam optimizer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04805","last_updated":"2026-05-25T11:37:32Z","snapshot_observed_at":"2026-08-15T12:12:45.953662Z","submitted_at":"2025-06-05T09:31:41Z","title":"Adaptive Preconditioners Trigger Loss Spikes in Adam","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:54.670505Z"},"links":{"cited_paper":"/paper/2504.19426","citing_paper":"/paper/2506.04805"},"observation_digest":"sha256:2126134326bdafe76607c1fd2be124014338b5ffc8c3cf11537e6282234c9435","observation_id":"4d82e7a9-7249-454b-a4c3-3b8045202f8a","resolution":{"observed_at":"2026-08-07T10:42:54.670505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":"2504.19426","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19426","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharp higher order conver- gence rates for the Adam optimizer","venue":null,"work_id":"5e1da4b3-db16-4e8c-8323-f756c49da28c","year":2025},"citing_paper":{"arxiv_id":"2603.15823","last_updated":"2026-05-18T13:39:59Z","snapshot_observed_at":"2026-08-17T08:49:18.795545Z","submitted_at":"2026-03-16T18:57:58Z","title":"Global Stability and Step Size Robustness of RMSProp","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T10:27:38.221096Z"},"links":{"cited_paper":"/paper/2504.19426","citing_paper":"/paper/2603.15823"},"observation_digest":"sha256:6064f91ae82534d60b146f576ab27aade96c09b5a74649e9283a5e808e177ab2","observation_id":"914b32af-e72b-4420-9a8d-1fbd7a790794","resolution":{"observed_at":"2026-05-21T10:30:00.242328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":"2504.19426","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19426","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharp higher order conver- gence rates for the Adam optimizer","venue":null,"work_id":"5e1da4b3-db16-4e8c-8323-f756c49da28c","year":2025},"citing_paper":{"arxiv_id":"2605.12878","last_updated":"2026-05-13T01:46:23Z","snapshot_observed_at":"2026-08-15T21:00:01.735313Z","submitted_at":"2026-05-13T01:46:23Z","title":"Adam-SHANG: A Convergent Adam-Type Method for Stochastic Smooth Convex Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T18:44:25.714500Z"},"links":{"cited_paper":"/paper/2504.19426","citing_paper":"/paper/2605.12878"},"observation_digest":"sha256:1bb2c4a72cea3dcf6e0bec3bfb703f4404641ff83607e9f812ebaffdf1368040","observation_id":"ce90e50e-8aaa-4330-871e-33521e027eb9","resolution":{"observed_at":"2026-05-14T18:47:36.587701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19426","snapshot_observed_at":"2026-07-11T20:46:05.467029Z","title":"Sharp higher order convergence rates for the Adam optimizer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04233","last_updated":"2026-07-05T11:11:40Z","snapshot_observed_at":"2026-08-16T20:56:16.792561Z","submitted_at":"2026-07-05T11:11:40Z","title":"Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-11T20:46:05.467029Z"},"links":{"cited_paper":"/paper/2504.19426","citing_paper":"/paper/2607.04233"},"observation_digest":"sha256:edcd7421d8fbe63e9faf11f28e8dd43440b293830bc34ebc51084e41c8a268ae","observation_id":"b5b8a45f-5e63-49d3-9f03-ebbb75c42c96","resolution":{"observed_at":"2026-07-11T20:46:05.467029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19426/citation-record","integrity":"/paper/2504.19426/integrity","json":"/paper/2504.19426/citation-record.json","paper":"/paper/2504.19426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.376402Z","title":"Learning Theory from First Principles , ﬁrst edition ed","venue":null,"work_id":"c17652c9-84d0-4e15-9d49-6329b46ed920","year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.610161Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:da97cf42f8dce04dd4b2aa9fc9e1b9925997aa0bd52c69045fa720fda11b54f6","observation_id":"1e545ef3-3bc4-48e7-8ca9-5d27c75a4428","resolution":{"observed_at":"2026-08-16T06:04:10.381372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.07596","last_updated":"2020-09-24T12:52:11Z","snapshot_observed_at":"2026-08-13T20:40:37.541690Z","submitted_at":"2019-11-18T13:00:02Z","title":"Convergence Analysis of a Momentum Algorithm with Adaptive Step Size for Non Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.07596","snapshot_observed_at":"2026-08-16T06:04:09.614937Z","title":"Convergence rates of a momentum algorithm with bounded adaptive step size for nonconvex optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.614937Z"},"links":{"cited_paper":"/paper/1911.07596","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:48abf96422933a93b1201c6da835b93cf6358f9a558f5a39327d6c815a6281cb","observation_id":"95094f53-0767-4ba4-9e0b-96382f5163ea","resolution":{"observed_at":"2026-08-16T06:04:09.614937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.362833Z","title":"Convergence and dynamical behavior of the Adam algorithm for nonconvex stochastic optimization","venue":null,"work_id":"1b8fef66-d173-401f-a898-98f01b5873c4","year":2021},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.620337Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:b6960f30c546a57719c5b48bded3dc8b87a8ce9884981e3f8c6cefc2e8c77dba","observation_id":"d3473149-1eb9-46ed-8deb-649ed03aefc0","resolution":{"observed_at":"2026-08-16T06:04:10.367354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.348974Z","title":"Stochastic optimization with momentum: convergence, ﬂuctuations, an d traps avoidance","venue":null,"work_id":"6dd337e2-4722-4d7d-bd18-86f05e4b23a6","year":2021},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.624754Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:7abb51a6e85bfa761d19de4351f1afbc5844484966138d49d5a061390d5e8636","observation_id":"4977aa62-6d09-4f11-98c2-6c0ce428ce48","resolution":{"observed_at":"2026-08-16T06:04:10.353373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.334889Z","title":"S., and von Wurstemberge r, P","venue":null,"work_id":"80c3a2a7-835e-4477-9dc4-94698d7c8ff8","year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.629160Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:17497360f7cc1d7b6f69de46e01fef652804912673aedef1e7b1ac363b2146bd","observation_id":"0510455f-8c72-441d-b427-9b81a1f9c74a","resolution":{"observed_at":"2026-08-16T06:04:10.339483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.321315Z","title":"A Proof of Local Convergence for the Adam Optimizer","venue":null,"work_id":"b4535845-bc59-4e20-af91-117a0897275c","year":2019},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.633633Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:01ed3f896ad691a7d53004a7b558e989327eb5aec6d1c442f17296d081783a2c","observation_id":"c226eefd-014e-434d-a565-0bad11a6b358","resolution":{"observed_at":"2026-08-16T06:04:10.325588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.307211Z","title":"Méthode générale pour la résolution des systèmes d’équatio ns si- multanées","venue":null,"work_id":"b9fefc77-f845-4430-9f01-9b3d115ca4f6","year":null},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.638642Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:acb30b5668c844d5351a93af89a8d05bef60578dd13eaa78882c61e9491f6083","observation_id":"f410d068-3ece-4c72-98bb-22e205b5344f","resolution":{"observed_at":"2026-08-16T06:04:10.311695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.02941","last_updated":"2019-03-10T00:48:35Z","snapshot_observed_at":"2026-08-14T18:43:13.595114Z","submitted_at":"2018-08-08T21:14:07Z","title":"On the Convergence of A Class of Adam-Type Algorithms for Non-Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.02941","snapshot_observed_at":"2026-08-16T06:04:09.643067Z","title":"On the Convergence of A Class of Adam-Type Algorithms for Non-Convex Optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.643067Z"},"links":{"cited_paper":"/paper/1808.02941","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:07b8ee39021ada4baac87f03c740ea1776fa175b282e39c72caf68b9613a7651","observation_id":"d04069a4-3cbd-4265-bc64-8e5f25673c14","resolution":{"observed_at":"2026-08-16T06:04:09.643067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.294031Z","title":"Non-convergence of stochas- tic gradient descent in the training of deep neural networks","venue":null,"work_id":"b1513d21-ce05-471c-877f-6c37df1bc084","year":2021},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.647659Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:5953955096eeefc4970be4f2fbaee62d98168c88739dc33625305c699bc93310","observation_id":"5c769ceb-4226-4f82-980b-d63e70b26a80","resolution":{"observed_at":"2026-08-16T06:04:10.298432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.280866Z","title":"A Simple Convergence Proof of Adam and Adagrad","venue":null,"work_id":"897f7994-7e50-48c4-a0da-c492ce0d48f3","year":2022},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.652016Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:d55890e0cd1fcf80f266fc627e2ec98f69210d71db62d021383f1eb80e36c807","observation_id":"78f34057-0ea6-4265-b2e4-ee8d9fc8e44f","resolution":{"observed_at":"2026-08-16T06:04:10.285128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08100","last_updated":"2024-07-11T00:10:35Z","snapshot_observed_at":"2026-08-16T13:35:15.470140Z","submitted_at":"2024-07-11T00:10:35Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08100","snapshot_observed_at":"2026-08-16T06:04:09.656396Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization m ethods for non-vanishing learning rates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.656396Z"},"links":{"cited_paper":"/paper/2407.08100","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:7f7afb57599ec4abfba482db0dc4073ac8d4a8b7e077a308e0e68fbb786b3ffc","observation_id":"92dd69be-8d6a-467e-a83f-5d3eb6327a2a","resolution":{"observed_at":"2026-08-16T06:04:09.656396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21078","last_updated":"2024-07-29T22:49:04Z","snapshot_observed_at":"2026-08-16T13:30:03.571779Z","submitted_at":"2024-07-29T22:49:04Z","title":"Convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21078","snapshot_observed_at":"2026-08-16T06:04:09.661231Z","title":"Convergence rates for the Adam optimizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.661231Z"},"links":{"cited_paper":"/paper/2407.21078","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:7c90754850ac80e6182939def2a487a7177c4ca061d0e9e6a268d7305b195b7b","observation_id":"58005b27-ec72-479c-9bf0-f06098d20999","resolution":{"observed_at":"2026-08-16T06:04:09.661231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14340","last_updated":"2026-07-05T12:58:20Z","snapshot_observed_at":"2026-08-16T13:41:05.849698Z","submitted_at":"2024-06-20T14:07:39Z","title":"Learning rate adaptive stochastic gradient descent optimization methods: numerical simulations for deep learning methods for partial differential equations and convergence analyses","version":2},"cited_work":{"arxiv_id":"2406.14340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14340","snapshot_observed_at":"2026-08-16T06:04:10.055415Z","title":"Learning rate adaptive stochastic gradient descent optimization methods: numerical simulations for deep learning methods for partial differential equations and convergence analyses","venue":"math.OC","work_id":"c34d23fe-e27c-4aae-a162-e5227067c02c","year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.665987Z"},"links":{"cited_paper":"/paper/2406.14340","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:91cc598802e760c1a5a6baba16e07eddaa8d89bfe8f3d2b7f0e25d68545a7a63","observation_id":"30dfd595-5127-4ed5-8461-c3e428b208bc","resolution":{"observed_at":"2026-08-16T06:04:10.062227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09385","last_updated":"2024-01-09T16:01:17Z","snapshot_observed_at":"2026-08-16T18:45:14.847573Z","submitted_at":"2021-02-16T12:42:25Z","title":"Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09385","snapshot_observed_at":"2026-08-16T06:04:09.670445Z","title":"Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.670445Z"},"links":{"cited_paper":"/paper/2102.09385","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:24b88f88aa5d680c067de0f7db663f2aa2701c0ccd83deb07d9e3300e612a90d","observation_id":"fc0e604e-8ec4-4439-9be1-c37486970d8c","resolution":{"observed_at":"2026-08-16T06:04:09.670445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10533","last_updated":"2025-02-15T04:17:23Z","snapshot_observed_at":"2026-08-16T13:41:27.333862Z","submitted_at":"2024-10-14T14:11:37Z","title":"Non-convergence to global minimizers in data driven supervised deep learning: Adam and stochastic gradient descent optimization provably fail to converge to global minimizers in the training of deep neural networks with ReLU activation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10533","snapshot_observed_at":"2026-08-16T06:04:09.675097Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.675097Z"},"links":{"cited_paper":"/paper/2410.10533","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:b642fd90eb03c537282b8ef3ca875ae21d1d9f3d1c6a05dd128c681a1da5f18f","observation_id":"4838e261-417c-4152-be2f-a0ab65616662","resolution":{"observed_at":"2026-08-16T06:04:09.675097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.267713Z","title":"On the oracle complexity of smooth strongly convex minimization","venue":null,"work_id":"80db9816-3a12-47c1-a52c-4a18ccaef0ee","year":2022},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.679456Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:c43dea935fa34248a9625bde4628cf539ae9f6f285a5d5f032823b2d8025e190","observation_id":"91ca25ad-86d3-4c1e-bf20-8e18f616897e","resolution":{"observed_at":"2026-08-16T06:04:10.272092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.254183Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":"bbecdde3-a667-4c79-9a9c-84c1762de53d","year":2011},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.683879Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:d62a0f6cd361814536c8a154452726e72a233477c7ce5173cda8f757e4f5a365","observation_id":"6a5ec2e9-e7cd-4cb5-87a2-067fcb5b66fd","resolution":{"observed_at":"2026-08-16T06:04:10.258671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10713","last_updated":"2020-12-07T23:36:20Z","snapshot_observed_at":"2026-08-12T11:27:30.709881Z","submitted_at":"2020-09-22T17:55:47Z","title":"Towards a Mathematical Understanding of Neural Network-Based Machine Learning: what we know and what we don't","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10713","snapshot_observed_at":"2026-08-16T06:04:09.688177Z","title":"Towards a Mathematical Understanding of Neural Network-Based Machine Learning: w hat we know and what we don’t","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.688177Z"},"links":{"cited_paper":"/paper/2009.10713","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:fd2c1cfb33dbf9d23eaf68f5a35e3cb5f49c7b79a83f0d2824e199b44b858e73","observation_id":"b29572d0-e2c8-499e-a84e-d5b69df684f6","resolution":{"observed_at":"2026-08-16T06:04:09.688177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15641","last_updated":"2022-11-28T18:49:09Z","snapshot_observed_at":"2026-08-16T16:12:41.844654Z","submitted_at":"2022-11-28T18:49:09Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15641","snapshot_observed_at":"2026-08-16T06:04:09.692953Z","title":"Blow up phenomena for gra- dient descent optimization methods in the training of artiﬁ cial neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.692953Z"},"links":{"cited_paper":"/paper/2211.15641","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:649b79fabdd537037224d87f1fe3e99b4659d6e37ecfb971bd464207698274c0","observation_id":"16cf2906-5a97-40e5-b95f-01a96f2bc6ac","resolution":{"observed_at":"2026-08-16T06:04:09.692953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-08-16T15:59:56.095916Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-16T06:04:09.697637Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.697637Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:38ff0577f8fd06eb9c1e97c47d1b377d50252a82f8e560dc60598766d3e8a7fc","observation_id":"cb1307a7-986c-4c29-a4be-029e263cc436","resolution":{"observed_at":"2026-08-16T06:04:09.697637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01370","last_updated":"2023-03-01T07:36:03Z","snapshot_observed_at":"2026-08-16T15:51:49.931877Z","submitted_at":"2023-03-01T07:36:03Z","title":"Non asymptotic analysis of Adaptive stochastic gradient algorithms and applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01370","snapshot_observed_at":"2026-08-16T06:04:09.702282Z","title":"Non asymptotic analysis of Adaptive stochastic gradient algorithms and applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.702282Z"},"links":{"cited_paper":"/paper/2303.01370","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:16e7a2a47c1e85c12d3002a86fad7cb6605ba85998fc7cb634fd71b9d1e4f13f","observation_id":"e9591481-79ff-4299-888f-681aa1e0df85","resolution":{"observed_at":"2026-08-16T06:04:09.702282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11782","last_updated":"2023-07-20T12:02:17Z","snapshot_observed_at":"2026-08-16T15:14:42.430863Z","submitted_at":"2023-07-20T12:02:17Z","title":"Convergence of Adam for Non-convex Objectives: Relaxed Hyperparameters and Non-ergodic Case","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11782","snapshot_observed_at":"2026-08-16T06:04:09.706749Z","title":"Convergence of Adam for Non-convex Ob- jectives: Relaxed Hyperparameters and Non-ergodic Case","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.706749Z"},"links":{"cited_paper":"/paper/2307.11782","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:f3c7776914bed1f066d75af8c10e6a184c53d13ac68b360fbfc37954d2dce809","observation_id":"449966e4-f16d-4285-a2b5-8a5db4a37bcd","resolution":{"observed_at":"2026-08-16T06:04:09.706749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.240980Z","title":"Lecture 6e: Rm- sprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"4addc68a-b57e-45dd-b352-43826f7f1627","year":2017},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.711382Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:b62c42edd3cf98673c355ef8eb9772be52f1c6d8b9d9864584672f47f2af507c","observation_id":"9d8fc442-befe-4e62-be43-57a196566a6a","resolution":{"observed_at":"2026-08-16T06:04:10.245313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13794","last_updated":"2024-09-13T13:28:04Z","snapshot_observed_at":"2026-08-16T14:16:35.855924Z","submitted_at":"2024-02-21T13:24:14Z","title":"Revisiting Convergence of AdaGrad with Relaxed Assumptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13794","snapshot_observed_at":"2026-08-16T06:04:09.715653Z","title":"Revisiting Convergence of AdaGrad with Relaxed Assump- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.715653Z"},"links":{"cited_paper":"/paper/2402.13794","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:029e5234f94b36f1ae0801c9fa1261f132338d145e346b13c925a8330aaeff4d","observation_id":"51d98009-7324-40a1-96fa-0902e09121a4","resolution":{"observed_at":"2026-08-16T06:04:09.715653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.227257Z","title":"A., and Johnson, C","venue":null,"work_id":"67534282-2e7b-472b-be33-7bc659a033ea","year":2017},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.720111Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:378ba6a2d947629f15ac2ac54c2d955b1c9cab6cf791a7304fa9ba3c6db49e1f","observation_id":"6dfc630a-a26d-4f45-afa4-ff776ddcc1ac","resolution":{"observed_at":"2026-08-16T06:04:10.231463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.213183Z","title":"Strong error analysis for stochastic gradient descent opti mization algorithms","venue":null,"work_id":"64b86698-3746-4e56-b78e-64e0ef4508c6","year":2021},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.724439Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:40724e301763181f2ea27b65a2cd64a023945eab71200fece079e67826836997","observation_id":"f455d188-0797-4df8-84c2-48014e95f2c1","resolution":{"observed_at":"2026-08-16T06:04:10.217787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20360","last_updated":"2025-07-15T18:49:51Z","snapshot_observed_at":"2026-08-16T14:47:16.535565Z","submitted_at":"2023-10-31T11:01:23Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20360","snapshot_observed_at":"2026-08-16T06:04:09.729045Z","title":"Mathemat- ical Introduction to Deep Learning: Methods, Implementati ons, and Theory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.729045Z"},"links":{"cited_paper":"/paper/2310.20360","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:6ba752bdfb377093a423a4a300b99c61159d32799e57d2de01ecb871497f4851","observation_id":"c281985c-4ec6-4414-b305-3aca83575d19","resolution":{"observed_at":"2026-08-16T06:04:09.729045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05155","last_updated":"2024-02-07T16:14:04Z","snapshot_observed_at":"2026-08-16T14:20:32.593954Z","submitted_at":"2024-02-07T16:14:04Z","title":"Non-convergence to global minimizers for Adam and stochastic gradient descent optimization and constructions of local minimizers in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05155","snapshot_observed_at":"2026-08-16T06:04:09.733450Z","title":"Non-convergence to global minimizers for Adam and stochastic gradient descent optimization and construc tions of local minimizers in the training of artiﬁcial neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.733450Z"},"links":{"cited_paper":"/paper/2402.05155","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:c3d2ef8ad87be43c8767cd5fb4f5f90babfeccd0e8a689e24f4a73e6c83c8a95","observation_id":"19228ced-58a2-4c41-8298-742441154085","resolution":{"observed_at":"2026-08-16T06:04:09.733450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.197928Z","title":"Lower error bounds for the stochas- tic gradient descent optimization algorithm: sharp conver gence rates for slowly and fast decaying learning rates","venue":null,"work_id":"d7ff90d3-77c4-4fbb-a2e4-e5dd081ed5b0","year":2020},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.737953Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:15438d9e11a89ea39b9edee62d39e0b0763137ac8ca328ab84962d62e93e4d5e","observation_id":"a29c38ad-c599-4374-a0af-e36ff323e3c6","resolution":{"observed_at":"2026-08-16T06:04:10.202926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T06:04:09.742264Z","title":"P., and Ba, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.742264Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:f5b158da56ed7d7b7575229c027fd88d984698f12eeb89be20e5a098b42e4116","observation_id":"dae0a935-b83d-4d20-8f31-a0f009c62063","resolution":{"observed_at":"2026-08-16T06:04:09.742264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13972","last_updated":"2023-11-07T03:12:49Z","snapshot_observed_at":"2026-08-16T15:37:21.145577Z","submitted_at":"2023-04-27T06:27:37Z","title":"Convergence of Adam Under Relaxed Assumptions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13972","snapshot_observed_at":"2026-08-16T06:04:09.746762Z","title":"Convergence of Adam Under Relaxed Assumptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.746762Z"},"links":{"cited_paper":"/paper/2304.13972","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:58864ead7330102d7db9e3fdf6f1c0316056f6268fa9f2485b2a25f38df4e2c7","observation_id":"95ccecfa-b64f-4906-8d25-b0e53182d437","resolution":{"observed_at":"2026-08-16T06:04:09.746762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.183382Z","title":"Dying ReLU and Initialization: Theory and Numerical Exampl es","venue":null,"work_id":"52b7e89e-6aa1-4443-847d-d6d8a3feefd2","year":2020},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.751091Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:e0286f811cffb6331f39cf37b5f3901963f702c42078b7507e88b107df28a6f9","observation_id":"86f650ee-260b-426e-8d29-68d3aabf7352","resolution":{"observed_at":"2026-08-16T06:04:10.187787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.169454Z","title":"A method of solving a convex programming problem with conver - gence rate o(1/k2)","venue":null,"work_id":"44262d73-8290-4d35-a829-ed434f760ec8","year":1983},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.755626Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:5b7082251c9e3265cdfe537ce34d0269b08a8f752da60e822e1e7ed2f91780aa","observation_id":"0424415e-49a1-4f4b-8976-8100d8a41505","resolution":{"observed_at":"2026-08-16T06:04:10.174011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.155377Z","title":"Introductory lectures on convex optimization , vol","venue":null,"work_id":"55f280d1-941f-437f-96c5-4d5907a19992","year":2004},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.759658Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:0f12962e8937128c5ad0a8ac96ddc55867cee417b58737c2677192fd09f3f60e","observation_id":"fe8a8080-0bbb-41cf-a270-d6e405d79715","resolution":{"observed_at":"2026-08-16T06:04:10.159993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.141004Z","title":"Gradient methods for the minimisation of functionals","venue":null,"work_id":"736928fc-ccd2-4e5f-a1eb-60719dab1473","year":1963},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.764208Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:eace8aaf80dbd41bfc82f591c1b395f76a6f149173113e2deee69caecfbcbe50","observation_id":"e24dc468-266b-4b47-b6f0-33c37b1e2b02","resolution":{"observed_at":"2026-08-16T06:04:10.146073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:10.127120Z","title":"Some methods of speeding up the convergence of iteration met hods","venue":null,"work_id":"006b70b9-6d20-4999-bd59-0a82def07bf5","year":1964},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.768650Z"},"links":{"citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:c28f94588f573bf25cc3d79a0e46dcd5aea16fa5e89ad0ea659fc00c67e2496b","observation_id":"996c2fd0-bf19-4c6e-baca-e2482d5e9ef1","resolution":{"observed_at":"2026-08-16T06:04:10.131640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-16T06:04:09.772860Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.772860Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:bd10ee8b071ef709a2d9132941ef7d238bda55b8779d877e92bd65656fa973be","observation_id":"340a60d1-29f5-4cd8-bf5b-f7156d05fe87","resolution":{"observed_at":"2026-08-16T06:04:09.772860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T06:04:09.777150Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.777150Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:daaa9f6bf2fc9f7a569b125769b0560bf9b9aee637d6e403a7ae37356c7ab269","observation_id":"3bf2af90-2139-4dc3-8400-1cf1c3df1241","resolution":{"observed_at":"2026-08-16T06:04:09.777150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08957","last_updated":"2019-12-19T00:23:18Z","snapshot_observed_at":"2026-08-05T19:03:39.733993Z","submitted_at":"2019-12-19T00:23:18Z","title":"Optimization for deep learning: theory and algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08957","snapshot_observed_at":"2026-08-16T06:04:09.781626Z","title":"Optimization for deep learning: theory and algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.781626Z"},"links":{"cited_paper":"/paper/1912.08957","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:0c36f6f21a61fce3ba34a2e2977c23d8a0f2e91b33d0b1e975263c486da508e8","observation_id":"ade76d91-fa5e-44ae-b3a7-7d77354f4c5e","resolution":{"observed_at":"2026-08-16T06:04:09.781626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09632","last_updated":"2023-01-13T15:06:19Z","snapshot_observed_at":"2026-08-16T16:38:01.727184Z","submitted_at":"2022-08-20T08:12:37Z","title":"Adam Can Converge Without Any Modification On Update Rules","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.09632","snapshot_observed_at":"2026-08-16T06:04:09.786051Z","title":"Adam Can Converge Without Any Modiﬁcation On Update Rules","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.786051Z"},"links":{"cited_paper":"/paper/2208.09632","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:df4a77b58bf9e7427b35f941275d2b4a2b976872c869d15d69ee66b9df5b865e","observation_id":"55a86273-5bdb-45fa-b649-7a7b9dfb5551","resolution":{"observed_at":"2026-08-16T06:04:09.786051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09358","last_updated":"2019-06-25T03:39:53Z","snapshot_observed_at":"2026-08-16T10:57:50.245987Z","submitted_at":"2018-11-23T04:26:47Z","title":"A Sufficient Condition for Convergences of Adam and RMSProp","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.09358","snapshot_observed_at":"2026-08-16T06:04:09.790187Z","title":"A Suﬃcient Condition for Convergences of Adam and RMSProp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:09.790187Z"},"links":{"cited_paper":"/paper/1811.09358","citing_paper":"/paper/2504.19426"},"observation_digest":"sha256:287f5e9a4b6f7309bbe27028d300d3024a157427c6a6f0c5206d78f49ec47024","observation_id":"1847c1e1-8652-4047-9445-2fb4f0c4022f","resolution":{"observed_at":"2026-08-16T06:04:09.790187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.19426","last_updated":"2025-04-28T02:17:50Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-17T09:02:43.677169Z","submitted_at":"2025-04-28T02:17:50Z","title":"Sharp higher order convergence rates for the Adam optimizer"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 4 inbound Pith citation observations for arXiv:2504.19426."}