{"as_of":"2026-08-08T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db99c06b601b3c918b681698ef0b370d5da45f6acc866a8e0fdc0fa6a2389f8f","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:18.346914Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:24.103094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T18:46:45.040439Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23081","snapshot_observed_at":"2026-08-06T23:35:24.103094Z","title":"Gradient methods with online scaling part i","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17650","last_updated":"2025-06-21T09:20:30Z","snapshot_observed_at":"2026-08-07T18:15:50.465521Z","submitted_at":"2025-06-21T09:20:30Z","title":"Enhanced PDHG for Linear Programming with Online Preconditioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:24.103094Z"},"links":{"cited_paper":"/paper/2505.23081","citing_paper":"/paper/2506.17650"},"observation_digest":"sha256:f5d8c6a8bbff90125dd77cd5f8762eb3c595d13c26745966dff6ce31bdfcf68f","observation_id":"ff55bcce-22c1-47d3-8546-124f443adfee","resolution":{"observed_at":"2026-08-06T23:35:24.103094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"cited_work":{"arxiv_id":"2505.23081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23081","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient methods with online scaling part i","venue":null,"work_id":"c67ab1fc-21de-4939-89c5-d833c45ac7c8","year":2025},"citing_paper":{"arxiv_id":"2509.05288","last_updated":"2026-04-14T06:59:33Z","snapshot_observed_at":"2026-07-06T22:24:42.849960Z","submitted_at":"2025-09-05T17:55:22Z","title":"Learning to accelerate distributed ADMM using graph neural networks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T18:46:36.084583Z"},"links":{"cited_paper":"/paper/2505.23081","citing_paper":"/paper/2509.05288"},"observation_digest":"sha256:0a35131608772f081bd28c7ad4ae707b266f55d1f6f03a4afdc5607f1e4f2a1d","observation_id":"d0b4f173-62f7-41a0-89ae-6cc9a6d201e3","resolution":{"observed_at":"2026-05-18T18:46:45.043079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23081/citation-record","integrity":"/paper/2505.23081/integrity","json":"/paper/2505.23081/citation-record.json","paper":"/paper/2505.23081"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-07-06T09:00:26.490403Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-07T13:10:06.894473Z","title":"Disentangling adaptive gradient methods from learning rates.CoRR, abs/2002.11803, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.894473Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:9eea4434a6c351ef8efbf40a62db40245307eb82f28efd1ff8527ad5f9f7b8a8","observation_id":"582a86a0-fd6c-4ea8-b92a-5d0679058bde","resolution":{"observed_at":"2026-08-07T13:10:06.894473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.029777Z","title":"Parameter adaptation in stochastic optimization","venue":null,"work_id":"9a1a058b-0da6-46dc-81bd-b603b184e4dc","year":1999},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.990413Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:cb5805c27445fe1ee08943c582c9ed6f985a5f019863b285f02fb6e3a9e06ed6","observation_id":"211f7c72-ff18-4c09-98d4-96bdf3d248f3","resolution":{"observed_at":"2026-08-07T13:10:33.100819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.824543Z","title":"Acceleration by stepsize hedging: Silver stepsize schedule for smooth convex optimization.Mathematical Programming, pages 1–14, 2024","venue":null,"work_id":"4e955f75-bfaa-48a4-8fd4-d556f4fa0f70","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.143282Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0d649aba295367941c3e6752b09ce44a939af8c8c2a25d2b8cfbbefa4a24066e","observation_id":"599fe075-96bd-486d-81b3-a6cdd78f65b6","resolution":{"observed_at":"2026-08-07T13:10:32.891809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.649821Z","title":"Acceleration by stepsize hedging: Multi-step descent and the silver stepsize schedule.Journal of the ACM, 72(2):1–38, 2025","venue":null,"work_id":"bf6b0d6a-6717-4ffb-a76d-42ec544c743e","year":2025},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.264191Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:d4d2f7d1cff38234014eb9631b9251a215703e3a09b3264fb12894c51ea674af","observation_id":"97a905fd-c4f7-41c4-8a17-67139bb6e03d","resolution":{"observed_at":"2026-08-07T13:10:32.749701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.379118Z","title":"Practical large-scale linear programming using primal-dual hybrid gradient.Advances in Neural Information Processing Systems, 34:20243–20257, 2021","venue":null,"work_id":"42b03eb5-7fd4-45bc-b935-caeec2c681f5","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.400967Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:8e8b9be647d33948607c13e6dd66b3ab0dab5db4b9063ccc6368b9935c19c3e4","observation_id":"c5b313fa-e5df-4908-9b14-6441dfa666ba","resolution":{"observed_at":"2026-08-07T13:10:32.470056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.135525Z","title":"Two-point step size gradient methods.IMA journal of numerical analysis, 8(1):141–148, 1988","venue":null,"work_id":"9ccf283e-c054-4f02-8500-b91853b2cc1c","year":1988},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.573874Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:453d8b07ae54fb3bb2e242b4b0356425814d10cfff4720dbbff2c4b518217b0a","observation_id":"685e8275-53dd-47c0-af85-624b89fa7cc4","resolution":{"observed_at":"2026-08-07T13:10:32.237528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.905875Z","title":"Online learning rate adaptation with hypergradient descent","venue":null,"work_id":"6f132f0e-e2c2-42de-9c33-1f57155e231d","year":2018},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.744515Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:96c33e325c1033045eb822912dfd1f760a7090674e25b45582aa6d0715b9ac4c","observation_id":"e00dd785-aae5-44e8-8e37-adb003f682b6","resolution":{"observed_at":"2026-08-07T13:10:31.987009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.610966Z","title":"Gradient descent: The ultimate optimizer.Advances in Neural Information Processing Systems, 35:8214–8225, 2022","venue":null,"work_id":"05c4fc25-aa57-49e2-87d6-02e84fcb51ce","year":2022},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.900330Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:94cf80f10dcacd39a8ec43617f4a823b1ac2ce4abbd1530c40cb3824428ad623","observation_id":"e0b9c6f3-bd1d-4b8a-9d02-fa5d750a7e55","resolution":{"observed_at":"2026-08-07T13:10:31.773172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11229","last_updated":"2025-03-16T21:17:53Z","snapshot_observed_at":"2026-08-07T18:14:26.210171Z","submitted_at":"2025-02-16T18:49:02Z","title":"Provable and Practical Online Learning Rate Adaptation with Hypergradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11229","snapshot_observed_at":"2026-08-07T13:10:07.974495Z","title":"Provable and practical online learning rate adaptation with hypergradient descent.arXiv preprint arXiv:2502.11229, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.974495Z"},"links":{"cited_paper":"/paper/2502.11229","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:acedfc2c4e81d05316be0ed00ec01055344163e06b73805b2ab4bf3649848a67","observation_id":"08be7905-0102-40c6-a315-5309d64fbfbe","resolution":{"observed_at":"2026-08-07T13:10:07.974495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.376217Z","title":"Non-monotonebehavioroftheheavyballmethod","venue":null,"work_id":"ec740093-238c-4a0e-981b-cab2795d62c1","year":2018},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.166282Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2a8a15c643f84ee8c675150cacd834e80f0290ea57ce73d50fd4aec1168721bc","observation_id":"cc825b92-a85e-441e-ac2f-0b5ca3016d0c","resolution":{"observed_at":"2026-08-07T13:10:31.467420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.188771Z","title":"An enhanced alternating direction method of multipliers-based interior point method for linear and conic optimization.INFORMS Journal on Computing, 2024","venue":null,"work_id":"01a61fa0-6478-4c03-a2bd-cb49de55e0ce","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.339118Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:fe76fc6b6390de38ec406982cee3401ddb734f4c85f881c0ba8770cafa17f755","observation_id":"698dab72-3f8c-4753-9886-28607abc2b74","resolution":{"observed_at":"2026-08-07T13:10:31.295597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06319","last_updated":"2026-04-16T15:15:47Z","snapshot_observed_at":"2026-07-06T20:03:47.277630Z","submitted_at":"2024-12-09T09:13:54Z","title":"Uniformly Optimal and Parameter-free First-order Methods for Convex and Function-constrained Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06319","snapshot_observed_at":"2026-08-07T13:10:08.488432Z","title":"Uniformly optimal and parameter-free first-order methods for convex and function-constrained optimization.arXiv preprint arXiv:2412.06319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.488432Z"},"links":{"cited_paper":"/paper/2412.06319","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:c3c1f1d38eca1877041060fc66c19768bdc30809f17019eac4ab8396545d4cac","observation_id":"ad823aab-24c0-474f-b3ef-d0b9e2921766","resolution":{"observed_at":"2026-08-07T13:10:08.488432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.958476Z","title":"Adaptive subgradient methods for online learning and stochas- tic optimization.Journal of machine learning research, 12(7), 2011","venue":null,"work_id":"62379173-d010-41e3-af9c-063b214c28ee","year":2011},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.656273Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:d5db6d739d4c980d60341c996bb64314a8cca9fc2c82fccbea1a410d3128adb9","observation_id":"700875c0-508d-452e-81d6-ddfa3eec3544","resolution":{"observed_at":"2026-08-07T13:10:31.076594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.628692Z","title":"John Wiley & Sons, 2000","venue":null,"work_id":"86f75c70-f6eb-4259-afd6-0da9e1efa280","year":2000},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.809382Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:b878c42e6e7e8a972a0b1402de6d447bad01fc5fe10601047f734a33c2676195","observation_id":"36c42a4e-7125-48b8-9783-19a765fb6ca4","resolution":{"observed_at":"2026-08-07T13:10:30.834841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01803","last_updated":"2024-11-05T21:16:44Z","snapshot_observed_at":"2026-08-01T02:48:11.871788Z","submitted_at":"2024-11-04T05:04:18Z","title":"Gradient Methods with Online Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01803","snapshot_observed_at":"2026-08-07T13:10:09.008540Z","title":"Gradient methods with online scaling.arXiv preprint arXiv:2411.01803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.008540Z"},"links":{"cited_paper":"/paper/2411.01803","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:adc7bdf302fb4f4a55856769efec9521a0593508e2c5ac9cf3fa34f66839188d","observation_id":"3ea42a4d-5fdf-4220-b05e-a03902fc660f","resolution":{"observed_at":"2026-08-07T13:10:09.008540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15594","last_updated":"2024-11-05T21:38:35Z","snapshot_observed_at":"2026-07-06T17:07:48.292847Z","submitted_at":"2023-12-25T03:05:09Z","title":"Scalable Approximate Optimal Diagonal Preconditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15594","snapshot_observed_at":"2026-08-07T13:10:09.165212Z","title":"Scalable approximate optimal diagonal pre- conditioning.arXiv preprint arXiv:2312.15594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.165212Z"},"links":{"cited_paper":"/paper/2312.15594","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:8d44eafb9badbdbbc76bf1c34fcd1549b8ed356512ed6d6faa4f8ed802bc16b4","observation_id":"e3cc866c-4d62-4b8a-b00e-b6e99c6b6d3f","resolution":{"observed_at":"2026-08-07T13:10:09.165212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12762","last_updated":"2024-05-21T13:15:19Z","snapshot_observed_at":"2026-08-06T04:56:28.221817Z","submitted_at":"2024-05-21T13:15:19Z","title":"Clarabel: An interior-point solver for conic programs with quadratic objectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12762","snapshot_observed_at":"2026-08-07T13:10:09.347627Z","title":"Clarabel: An interior-point solver for conic programs with quadratic objectives.arXiv preprint arXiv:2405.12762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.347627Z"},"links":{"cited_paper":"/paper/2405.12762","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:feef1de84d249dc52fb3a5958b84015848852dece6bf5b84c0cb3c290b60f749","observation_id":"d7242c41-90e9-4302-98c0-6a9148e4e5ac","resolution":{"observed_at":"2026-08-07T13:10:09.347627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.428398Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"161376e4-0769-4efc-a3f5-e5c18b6ab57a","year":2018},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.577230Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:7a36a50e2c7d31c854e5236c504ff693ccfad5a82e04cc9b9e8dda4ef2d9f6af","observation_id":"34e87645-c7c9-4b16-a7d6-cb95dde4dbfd","resolution":{"observed_at":"2026-08-07T13:10:30.552063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.096306Z","title":"Introduction to online convex optimization.Foundations and Trends®in Optimization, 2(3-4):157–325, 2016","venue":null,"work_id":"8dbbd75b-863f-4ae1-9328-d7b769745209","year":2016},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.773950Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:36bb36320fd86aa545aa304555d07457f5a6f883a3ad689d03e4e34a6291df75","observation_id":"e82d314b-437f-4135-a23d-8f672afdbcf5","resolution":{"observed_at":"2026-08-07T13:10:30.256654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00313","last_updated":"2022-08-02T17:48:25Z","snapshot_observed_at":"2026-07-06T07:49:44.506891Z","submitted_at":"2019-05-01T13:47:40Z","title":"Revisiting the Polyak step size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00313","snapshot_observed_at":"2026-08-07T13:10:09.962195Z","title":"Revisiting the polyak step size.arXiv preprint arXiv:1905.00313, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.962195Z"},"links":{"cited_paper":"/paper/1905.00313","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:ec2493219e9657dd49b17708a9c4a07f3b5564c4cab2982c0ca879a69b92b342","observation_id":"830e8eff-9523-47ee-986c-3c8d79cc32c5","resolution":{"observed_at":"2026-08-07T13:10:09.962195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.804878Z","title":"Adaptive online gradient descent.Advances in neural information processing systems, 20, 2007","venue":null,"work_id":"87fddb71-7421-44bf-af96-28f94abbdb52","year":2007},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.093964Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:13989dfb0724ffe72f4edee19babd78c1e1a3e10502a50dbfd03ca792ec55d1e","observation_id":"da8727a2-61f7-4d95-a314-16abdb8e8882","resolution":{"observed_at":"2026-08-07T13:10:29.949825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.477866Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent.Cited on, 14(8):2, 2012","venue":null,"work_id":"2bfbc853-019e-4c31-9aa4-2a2d4cddc3bb","year":2012},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.226107Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:166f288e4b9b5ba113b9d2b44a0a9e5f1a3333e57da9611535e55d6da715c097","observation_id":"c3541b60-4e1e-4b6e-bb89-7d2e4984a221","resolution":{"observed_at":"2026-08-07T13:10:29.627509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16160","last_updated":"2024-10-05T18:27:53Z","snapshot_observed_at":"2026-07-06T18:19:47.765281Z","submitted_at":"2024-05-25T09:59:39Z","title":"Restarted Primal-Dual Hybrid Conjugate Gradient Method for Large-Scale Quadratic Programming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16160","snapshot_observed_at":"2026-08-07T13:10:10.367209Z","title":"Restarted primal-dual hybrid conjugate gradient method for large-scale quadratic programming.arXiv preprint arXiv:2405.16160, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.367209Z"},"links":{"cited_paper":"/paper/2405.16160","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:50bcfa2a4d99a89789622c02fa4b5d82e03ed88c697ae8bfd8344008892a9ed2","observation_id":"e6011afc-fe50-4103-97f7-d1c2d57e712e","resolution":{"observed_at":"2026-08-07T13:10:10.367209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.222791Z","title":"Increased rates of convergence through learning rate adaptation.Neural networks, 1(4):295–307, 1988","venue":null,"work_id":"fb6b0b7a-356f-4c1b-b1bd-06be078e1606","year":1988},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.441402Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0b25d5314e62b08d9ea35381548608b087bef971948d1d81f754c8e9fe8ac048","observation_id":"242d1643-d6d3-4f2e-a90a-ef7b5f1ef31c","resolution":{"observed_at":"2026-08-07T13:10:29.321487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.085833Z","title":"Unconstrained online learning with unbounded losses","venue":null,"work_id":"be8e7dfe-cd9d-4f51-839f-5bb3a3008c99","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.614661Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:5a10bde076e255f9f4c0b5b63d9af83bddb519883fddb0ceb47c33270b64783e","observation_id":"d1204d1f-fbf2-41b4-ab6e-d79bf1ea9980","resolution":{"observed_at":"2026-08-07T13:10:29.152637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.854155Z","title":"Online learning guided curvature approximation: A quasi-newton method with global non-asymptotic superlinear convergence","venue":null,"work_id":"0287d85f-c36e-410a-80ea-6dd614fc2c2f","year":1962},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.776182Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:45885cca15999b4a6dec92df7f4bf14a806d0c50e0cc217d2ded5bdd381bebe9","observation_id":"21918e13-066d-48bb-9e7c-8b7f63fc7b0b","resolution":{"observed_at":"2026-08-07T13:10:28.917531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02626","last_updated":"2024-10-03T16:08:16Z","snapshot_observed_at":"2026-07-06T19:27:07.844117Z","submitted_at":"2024-10-03T16:08:16Z","title":"Online Learning Guided Quasi-Newton Methods with Global Non-Asymptotic Convergence","version":1},"cited_work":{"arxiv_id":"2410.02626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02626","snapshot_observed_at":"2026-08-07T13:10:18.878295Z","title":"Online Learning Guided Quasi-Newton Methods with Global Non-Asymptotic Convergence","venue":"math.OC","work_id":"d29c4cd3-5b8d-418c-a40c-d06e53c015b3","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.986354Z"},"links":{"cited_paper":"/paper/2410.02626","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:8d7e0b692115594f2cc06b32d9ad2bcf2a0f61df30e2b15a202b10872419664a","observation_id":"e4d11c3a-afaf-4ef0-bdf8-fd298e008b85","resolution":{"observed_at":"2026-08-07T13:10:19.028351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.702424Z","title":"Adaptive hierarchical hyper-gradient descent.International Journal of Machine Learning and Cybernetics, 13(12):3785–3805, 2022","venue":null,"work_id":"b88d481f-d654-4a76-8b32-108ce0e2961b","year":2022},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.149792Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:99e03064fc9e07f8e26af5174acdb8c91289ff1b8dc2ddc857983cc9d4b6633d","observation_id":"1a392729-b1cc-4389-b592-503af395f9af","resolution":{"observed_at":"2026-08-07T13:10:28.781008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16731","last_updated":"2025-01-08T01:41:29Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T16:41:57Z","title":"Non-asymptotic Global Convergence Analysis of BFGS with the Armijo-Wolfe Line Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16731","snapshot_observed_at":"2026-08-07T13:10:11.348183Z","title":"Non-asymptotic global convergence analysis of bfgs with the armijo-wolfe line search.arXiv preprint arXiv:2404.16731, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.348183Z"},"links":{"cited_paper":"/paper/2404.16731","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:8caee129a7a03df7dd1bf7e532eeaf936cd22842dd6e4eb82333461dd798e077","observation_id":"b509697c-f221-4fff-983a-ed592bab0dd8","resolution":{"observed_at":"2026-08-07T13:10:11.348183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01267","last_updated":"2025-07-15T00:34:40Z","snapshot_observed_at":"2026-08-07T12:22:02.922304Z","submitted_at":"2024-04-01T17:44:07Z","title":"Non-asymptotic Global Convergence Rates of BFGS with Exact Line Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01267","snapshot_observed_at":"2026-08-07T13:10:11.500660Z","title":"Non-asymptotic global convergence rates of bfgs with exact line search.arXiv preprint arXiv:2404.01267, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.500660Z"},"links":{"cited_paper":"/paper/2404.01267","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0d09873c6f2ccca0aa69295b3b382b962c205d10721b75d35b8a7c34cfd4e0ca","observation_id":"e0306c6a-5ece-4e3e-996c-773dbf121f8e","resolution":{"observed_at":"2026-08-07T13:10:11.500660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.463198Z","title":"Non-asymptotic superlinear convergence of standard quasi-newton methods.Mathematical Programming, 200(1):425–473, 2023","venue":null,"work_id":"890c22d9-a842-4cc7-8b29-7d75a5e1e67b","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.664806Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:d759460b397a7c24c8bf1101a3b47ef00d8ed4a5581d9ee83dd5ca7a4ad941c3","observation_id":"2b6fc337-097e-43af-b5ff-a957bed4e696","resolution":{"observed_at":"2026-08-07T13:10:28.586015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:10:11.796601Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.796601Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:e55a81f1cbc893a8b1884691dedd70ea4a851349e1a27c6e834328fb68712585","observation_id":"fd73d695-ef08-4ce8-833b-5df61ebae305","resolution":{"observed_at":"2026-08-07T13:10:11.796601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.225160Z","title":"Searching for optimal per-coordinate step-sizes with multidimensional backtracking.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"94db2d01-b4a8-4114-bdfe-beab812e5b15","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.949488Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0927b37a1991e4b0dde309966b5d35a3d1db971ac97478046c4d908431c9c1be","observation_id":"cda76596-1567-42f0-935a-41cdfc408c9f","resolution":{"observed_at":"2026-08-07T13:10:28.347020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12139","last_updated":"2024-11-15T12:23:42Z","snapshot_observed_at":"2026-07-06T16:35:11.681492Z","submitted_at":"2023-10-18T17:50:13Z","title":"Optimal and parameter-free gradient minimization methods for convex and nonconvex optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12139","snapshot_observed_at":"2026-08-07T13:10:12.138443Z","title":"Optimal and parameter-free gradient minimization methods for smooth optimization.arXiv preprint arXiv:2310.12139, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.138443Z"},"links":{"cited_paper":"/paper/2310.12139","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:e1ac0b9b4218af6b85ce2ba5f70a99cf1eff71f23e307d92737f706a3b5a1748","observation_id":"2f51d06b-a0fb-4662-b0ab-143ebea5d09d","resolution":{"observed_at":"2026-08-07T13:10:12.138443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10082","last_updated":"2024-08-17T03:06:14Z","snapshot_observed_at":"2026-08-08T00:23:42.227303Z","submitted_at":"2023-10-16T05:26:03Z","title":"A simple uniformly optimal method without line search for convex optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10082","snapshot_observed_at":"2026-08-07T13:10:12.329475Z","title":"A simple uniformly optimal method without line search for convex opti- mization.arXiv preprint arXiv:2310.10082, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.329475Z"},"links":{"cited_paper":"/paper/2310.10082","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2e5e79b1efba470b6bf4ee9fcca91ee01a355d03a54cfd1c639d483e615e675c","observation_id":"5f05fe23-b761-4118-9756-402baffd1343","resolution":{"observed_at":"2026-08-07T13:10:12.329475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.924457Z","title":"A second look at exponential and cosine step sizes: Simplicity, adaptivity, and performance","venue":null,"work_id":"0ecbc6e3-f5bc-499c-b31e-0d282522f925","year":null},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.491677Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:1eeeed4bf2513f9d3dfd3a53c5d713ee5d056edd742774234db597beff5547f9","observation_id":"22afb333-41fb-4049-a4ec-f93bc7ff20bc","resolution":{"observed_at":"2026-08-07T13:10:28.024072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.357164Z","title":"An admm-based interior-point method for large-scale linear programming.Optimization Methods and Software, 36(2-3):389–424, 2021","venue":null,"work_id":"53a695de-bc72-47ff-a265-7dac336deee3","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.806062Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2e2b7748b0d9064e39e2e0ca3f8c650e2cf33e89e0e5f619aa1bb2b558559440","observation_id":"58b31885-133b-402d-846b-f502f5e517c4","resolution":{"observed_at":"2026-08-07T13:10:27.490108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.017954Z","title":"Pdcs: A primal-dual large-scale conic programming solver with gpu enhancements.arXiv preprint arXiv:2505.00311, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.017954Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:3ace142e963b0aaf8519e4d9c5d3a672fea1282bba84dc757b950effdfd2f517","observation_id":"10ffd99f-c795-4c93-9a25-2bc8a81907fd","resolution":{"observed_at":"2026-08-07T13:10:13.017954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12180","last_updated":"2024-06-07T16:51:52Z","snapshot_observed_at":"2026-08-04T22:51:37.414194Z","submitted_at":"2023-11-20T20:50:49Z","title":"cuPDLP.jl: A GPU Implementation of Restarted Primal-Dual Hybrid Gradient for Linear Programming in Julia","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12180","snapshot_observed_at":"2026-08-07T13:10:13.221669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.221669Z"},"links":{"cited_paper":"/paper/2311.12180","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0a463143abce6abb90739be57944484cfbbe8132e600748d986c1429d63ec86e","observation_id":"13043e44-b86d-454d-b3e1-a3d1cf0a2a7e","resolution":{"observed_at":"2026-08-07T13:10:13.221669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14832","last_updated":"2024-01-07T06:52:56Z","snapshot_observed_at":"2026-08-06T20:32:08.575521Z","submitted_at":"2023-12-22T17:07:50Z","title":"cuPDLP-C: A Strengthened Implementation of cuPDLP for Linear Programming by C language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14832","snapshot_observed_at":"2026-08-07T13:10:13.373008Z","title":"cupdlp-c: A strengthened implementation of cupdlp for linear programming by c language.arXiv preprint arXiv:2312.14832, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.373008Z"},"links":{"cited_paper":"/paper/2312.14832","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:9996c1292e52ae9e6391ee5c8902f13c35e680d5b20a9285d3b81b35529083e9","observation_id":"86ae7d01-ff31-4cda-8697-9c946a456fef","resolution":{"observed_at":"2026-08-07T13:10:13.373008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:26.888478Z","title":"Tuning-freestep-size adaptation","venue":null,"work_id":"6042875f-7f7a-4698-8ded-c175448accd0","year":2012},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.492046Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:21efa9605e177fbe4b27382412c4ce86eafa80b5ccbae2ddf4e1a772203de83d","observation_id":"8cb11ec2-df2b-4407-8d46-3c97fdc6e0e8","resolution":{"observed_at":"2026-08-07T13:10:27.135518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:26.498775Z","title":"Adaptive gradient descent without descent","venue":null,"work_id":"546e5490-4cc4-418f-b3f6-1a2a0f45a7c2","year":2020},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.621772Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:1a56e3eaddca9278c539cf15a76a10bd2966aae8c52110d9966eee74e388b64f","observation_id":"d537402d-9002-461e-9a01-fd926b69f4ad","resolution":{"observed_at":"2026-08-07T13:10:26.619015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:26.175119Z","title":"Adaptive proximal gradient method for convex optimization","venue":null,"work_id":"f616902d-1750-43ae-ab9c-7f98295789c0","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.774680Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:50cbd0813e074bcd18d542717588eb3602b17b99c6088515ebea5485662e656e","observation_id":"690cc81a-7386-4bb0-b398-2d4fd274d894","resolution":{"observed_at":"2026-08-07T13:10:26.349459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4908","last_updated":"2010-07-07T19:07:16Z","snapshot_observed_at":"2026-07-06T02:04:37.023313Z","submitted_at":"2010-02-26T01:36:34Z","title":"Adaptive Bound Optimization for Online Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1002.4908","snapshot_observed_at":"2026-08-07T13:10:13.932005Z","title":"Adaptive bound optimization for online convex optimization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.932005Z"},"links":{"cited_paper":"/paper/1002.4908","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:1da1f312c60b04e85770867b8585339dda61b47b2b86bb4138c950f0db9e3f36","observation_id":"405bcadf-473c-4c53-892d-48321954815b","resolution":{"observed_at":"2026-08-07T13:10:13.932005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.872299Z","title":null,"venue":null,"work_id":"0b863517-c060-4504-9f0e-8f295afb53d5","year":2004},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.074627Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:df0e4b512991e8bd7c6130309686bf303c5e0984a88d12803050dc71975154a1","observation_id":"3eea46ed-ab74-43c5-9a9f-6f1a7e1fb9f5","resolution":{"observed_at":"2026-08-07T13:10:26.037314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.563493Z","title":"Linear convergence of first order methods for non-strongly convex optimization.Mathematical Programming, 175:69–107, 2019","venue":null,"work_id":"0b4566f3-94d3-4365-88b9-72794b9631a3","year":2019},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.243941Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0b746855e198f045f79ac9980afb26d106570ff473d8d73bd195bc2e8dbd808f","observation_id":"cda48efa-20d9-41cb-84ca-4dcc1c763e04","resolution":{"observed_at":"2026-08-07T13:10:25.725934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.268859Z","title":"A method for solving the convex programming problem with convergence rate o (1/k2)","venue":null,"work_id":"a75906b9-eb2c-4787-bf0e-f327f5bfed27","year":1983},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.377838Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:8ce68dbc26994772d0b4f2b9b0206c7fa52fc9b3854ad4ec753c82858704e838","observation_id":"a97f9952-f43a-4b26-ab3b-4bad7f9a6d42","resolution":{"observed_at":"2026-08-07T13:10:25.422538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.982451Z","title":"Springer Science & Business Media, 2013","venue":null,"work_id":"7ce925b4-c21f-4507-8aac-0cd3583fdb12","year":2013},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.540097Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:bcbbe08222cb82e67d199e3d4d08902024b6ed9311b9c97f1765e82c18eb31e6","observation_id":"af122e1a-fd8f-45d9-8581-b8e70602774c","resolution":{"observed_at":"2026-08-07T13:10:25.146817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.718253Z","title":"Springer, 1999","venue":null,"work_id":"0cbb2c04-ecc1-4d36-8a10-bf1da2a4cffc","year":1999},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.688071Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:77337af8e1fdb3605aa6427c137982847b6ccf62a431a16135708228b658251c","observation_id":"b6fd424a-635e-4a24-b603-d5275a7a25a8","resolution":{"observed_at":"2026-08-07T13:10:24.847880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.474661Z","title":"Conic optimization via operator splitting and homogeneous self-dual embedding.Journal of Optimization Theory and Applications, 169:1042–1068,","venue":null,"work_id":"e4e0a20e-f31d-4cd6-ad30-b514b0270098","year":null},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.887592Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:28ef43020cffe96381493b0648ea28467e5c4c07bb81a2abf6835b568440c91e","observation_id":"073b82e1-a03a-4f53-9384-b6868aad5493","resolution":{"observed_at":"2026-08-07T13:10:24.596628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-07-06T08:47:45.187408Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-07T13:10:15.037964Z","title":"A modern introduction to online learning.arXiv preprint arXiv:1912.13213, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.037964Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:3482980f9be6c4d01fb5132524249a151e8cdd552fe9ea330affb6ac637f7574","observation_id":"8fad7c9b-8518-43ef-9b02-cd5c18cbbc9c","resolution":{"observed_at":"2026-08-07T13:10:15.037964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.176378Z","title":"Coin betting and parameter-free online learning.Advances in Neural Information Processing Systems, 29, 2016","venue":null,"work_id":"fc226b45-6de2-4b24-8766-ecd7684fb41f","year":2016},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.203695Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:ea5ecb2458e0aebf22eb43371a5979ac58b172580c243fbed27a2255ae7a2bf8","observation_id":"11c62399-0f76-4282-9aeb-3c8a61671e7f","resolution":{"observed_at":"2026-08-07T13:10:24.353932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.803472Z","title":"MADA: Meta-adaptive optimizers through hyper-gradient descent","venue":null,"work_id":"c4710ea3-4b71-4f17-88f0-4b1c86bfe187","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.404845Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:685cbfaa0d06fdd5e04c729b427ad279b56cea738841a61d8827d3ac285f1d02","observation_id":"a2d47ced-c099-4894-b9ba-99dab4fdbcd4","resolution":{"observed_at":"2026-08-07T13:10:23.997951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.329703Z","title":"Introduction to optimization","venue":null,"work_id":"1ecd8d45-7f62-4de1-9983-d786fd978265","year":1987},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.614007Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:f9bf9a345ce9056ed4e8b7f95a605ad8c8145dc8a3056568fa8210796eb8f914","observation_id":"7d629dba-c740-40a2-b598-0f19e07ecefa","resolution":{"observed_at":"2026-08-07T13:10:23.506836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.011310Z","title":"Optimal diagonal precondi- tioning.Operations Research, 2024","venue":null,"work_id":"1bae0e56-66e1-433a-a575-bab0bb89c329","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.729222Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:a19a846f873709e0037d3b32d09fba7c8574b3bea5a0eb217d3ac5c8d44380e7","observation_id":"0473bbe0-f075-45ac-a88c-d90e57b30df4","resolution":{"observed_at":"2026-08-07T13:10:23.187929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.765811Z","title":"Lecture notes on online learning draft, 2009","venue":null,"work_id":"00f42701-cbda-43dc-9475-8597147b5dfc","year":2009},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.885167Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:b2e22fef6407d1d9d16370ea0defc748b40ffde1db5b0f59a87191a3dfbf08a9","observation_id":"e227455b-df14-4f60-8c1d-8ac694052ba0","resolution":{"observed_at":"2026-08-07T13:10:22.888468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-07T13:10:16.063965Z","title":"On the convergence of adam and beyond.arXiv preprint arXiv:1904.09237, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.063965Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:de835b27a1d62bc8badf9adfa8142f2a73a8813781fdee849f0dfbbd8cd69f41","observation_id":"deef3e93-5088-46c0-b9e4-f524ea99ca99","resolution":{"observed_at":"2026-08-07T13:10:16.063965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.581689Z","title":"Greedy quasi-newton methods with explicit superlinear conver- gence.SIAM Journal on Optimization, 31(1):785–811, 2021","venue":null,"work_id":"e1fdcb75-7b70-4b81-888a-e7799c4b9164","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.251549Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:7e3bd52d19cc779a78247c2cfde5607a6816b45b7a050a8fa4f9d7c94adbb6d4","observation_id":"07821767-069b-4dad-ada2-b1eb6a819236","resolution":{"observed_at":"2026-08-07T13:10:22.657859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.360902Z","title":"New results on superlinear convergence of classical quasi-newton methods.Journal of optimization theory and applications, 188:744–769, 2021","venue":null,"work_id":"ef8bb264-cb10-4877-a2ad-e75b15d40887","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.373687Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:9e367abd5061168c9c330bf526b0f67c61c7eccaf89ce0dfac5faa0c8f3433d5","observation_id":"fcd11103-fce6-4d6e-9177-588f55060dc1","resolution":{"observed_at":"2026-08-07T13:10:22.492178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.019409Z","title":"Ratesofsuperlinearconvergenceforclassicalquasi-newtonmethods","venue":null,"work_id":"05dc4859-d054-459d-8475-0a114910c43b","year":2022},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.529064Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:370296801e57030b9ef43e726e285c62fd1d44ac4ed507103b214d0152f11391","observation_id":"50bcfa29-c047-477c-aa49-627546b67153","resolution":{"observed_at":"2026-08-07T13:10:22.203383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.756489Z","title":"Convergence analysis of an adaptive method of gradient descent.University of Oxford, Oxford, M","venue":null,"work_id":"1bacef58-34e9-4b75-a56d-32a3e0f58c90","year":2017},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.744234Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:03f3b92d0da4ba00aaef378974a281042c63fa89db4194e26dc600b348a0774c","observation_id":"28a70dfa-4977-4735-8bce-83f2423e0fd4","resolution":{"observed_at":"2026-08-07T13:10:21.869002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.414813Z","title":"Local gain adaptation in stochastic gradient descent","venue":null,"work_id":"f3ab5add-34cf-4e79-88f5-df9393f1d570","year":1999},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.855472Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:1df10c13e21989f85b45b44767baa19c72cf7e48c75d449c38b63c2f19b212ce","observation_id":"86f09eaa-efb1-48da-a833-c69adcb76bb9","resolution":{"observed_at":"2026-08-07T13:10:21.591671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.088991Z","title":"Adapting bias by gradient descent: An incremental version of delta-bar-delta","venue":null,"work_id":"604b6b0d-6fd1-4444-b44e-91969849d0e2","year":1992},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.038377Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:4d7c63c3af76c16470746ccfa2611f30d4cd57d3de250098931f102f0c1f0016","observation_id":"6a17c6f7-b9c3-4b92-853e-850ce34d27e5","resolution":{"observed_at":"2026-08-07T13:10:21.248493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.758455Z","title":"No-regret dynamics in the fenchel game: A unified framework for algorithmic convex optimization.Mathematical Programming, 205(1):203–268, 2024","venue":null,"work_id":"8327d995-cbc8-44fb-9d6f-83a928e5f33a","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.226881Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:43f4fc31dba4b461044f8e9c00346e206ed9b36713936d9cf5e2b6e60693ef33","observation_id":"c4be4a74-e36d-4bec-be13-b0d9120ff377","resolution":{"observed_at":"2026-08-07T13:10:20.916902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.471188Z","title":"On the convergence of stochastic gradient descent with bandwidth-based step size.Journal of Machine Learning Research, 24(48):1–49, 2023","venue":null,"work_id":"8cde7b23-4d78-479b-8db8-5b4c2c0d44eb","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.431702Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0e89e1ff129489fdb975e0bc2ae6263b38b78e8203377b45d34fcf8c86483b8f","observation_id":"2b5126e1-b40e-4efb-b46c-ee6866f94cb9","resolution":{"observed_at":"2026-08-07T13:10:20.605338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01942","last_updated":"2024-07-15T17:51:31Z","snapshot_observed_at":"2026-07-06T18:24:52.604412Z","submitted_at":"2024-06-04T03:50:12Z","title":"The Role of Level-Set Geometry on the Performance of PDHG for Conic Linear Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01942","snapshot_observed_at":"2026-08-07T13:10:17.588000Z","title":"The role of level-set geometry on the performance of pdhg for conic linear optimization.arXiv preprint arXiv:2406.01942, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.588000Z"},"links":{"cited_paper":"/paper/2406.01942","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:40275e42f7143e54b9ea99ea0180831d8c52eccff351330b34db5d053796127d","observation_id":"81a47c91-72de-40b5-8262-7b20494b7c7e","resolution":{"observed_at":"2026-08-07T13:10:17.588000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.178968Z","title":"Adaptive powerball stochastic conjugate gradient for large-scale learning.IEEE Transactions on Big Data, 9(6):1598–1606, 2023","venue":null,"work_id":"69edaf7d-926f-461c-a26a-e42d669f2303","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.719711Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2d815c9194812caf0231ed2053008da242b2a9752cfeb2bc33c44b759bf823e8","observation_id":"09a18a02-c2b9-413e-a58c-08ea1777735d","resolution":{"observed_at":"2026-08-07T13:10:20.317776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-07T13:10:17.855272Z","title":"Adam-mini: Use fewer learning rates to gain more.arXiv preprint arXiv:2406.16793, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.855272Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:057a9b44ca954530b493c4eecadc0e007ecd1472262cb9a70a92edf3ada983fa","observation_id":"ccd1611f-fda8-426f-b2c8-293a42ac63b6","resolution":{"observed_at":"2026-08-07T13:10:17.855272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.807561Z","title":"Algorithm 778: L-bfgs-b: Fortran sub- routines for large-scale bound-constrained optimization.ACM Transactions on mathematical software (TOMS), 23(4):550–560, 1997","venue":null,"work_id":"7b82dcf6-0f86-4875-ab1d-d238c7166f64","year":1997},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.009345Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:4f23a40e62c84618c3d25424f70896fc084d65cddab0c5d885eab60090ab9f8c","observation_id":"acf4447c-13d9-48d8-bdf1-9b7663236653","resolution":{"observed_at":"2026-08-07T13:10:20.001214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.570867Z","title":"Adabelief optimizer: Adapting stepsizes by the belief in observed gradients.Advances in neural information processing systems, 33:18795–18806, 2020","venue":null,"work_id":"01c2327c-39a4-4798-8c90-36d7565b9a3d","year":2020},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.193092Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:dae7e48991b100068d8901ab9345230d455197bfeec4885a99a6a05865f4d2bf","observation_id":"1caf9fe7-598d-494a-a3d9-884a50a16de7","resolution":{"observed_at":"2026-08-07T13:10:19.729131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.250294Z","title":"Surrogate losses for online learning of stepsizes in stochastic non-convex optimization","venue":null,"work_id":"1275130e-ef4b-4b11-8699-c33b1202637b","year":2019},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.346914Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2a81f56db6777d9a771f699eb9db77ab8ff1ec483014455064fb6fb045af1423","observation_id":"f8f4b0a7-8547-4732-9036-7ad4c23feadd","resolution":{"observed_at":"2026-08-07T13:10:19.409231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.623133Z","title":"(cited on 17)","venue":null,"work_id":"4f64d5d7-8663-4119-8253-bfcd384d680d","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":6564,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.619868Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:015e9528b42b8e389bab5f70ec078dc086af26d670a0075c4178edb961a4e618","observation_id":"9400cacb-1509-4471-be06-d6ca5c05c077","resolution":{"observed_at":"2026-08-07T13:10:27.789881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-07T12:51:27.021234Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2505.23081."}