{"as_of":"2026-08-16T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f1c0bba4747d4c937963894f3fdee27ce9d87da0c0e24b298196e26f43a4ea6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:59:07.603628Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.14969/citation-record","integrity":"/paper/2509.14969/integrity","json":"/paper/2509.14969/citation-record.json","paper":"/paper/2509.14969"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.564448Z","title":"Parameter-free FISTA by adaptive restart and backtracking.SIAM Journal on Optimization, 34(4):3259–3285, 2024","venue":null,"work_id":"3a7f604d-ec1d-48cf-8e3e-44191f4e0738","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.366329Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:e3548e9b21eb2d9aa89be184ffef8eb57292490f1bb6f871043915ff7d23636b","observation_id":"28515651-884d-4a01-884c-bac83ee0ee7a","resolution":{"observed_at":"2026-08-15T15:59:08.568467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.553066Z","title":"FISTA restart using an automatic estimation of the growth parameter.Journal of Optimization Theory and Applications, 206(2):51, 2025","venue":null,"work_id":"51669406-7703-4c4f-91f4-1495568cf249","year":2025},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.371418Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:0d751a7e2516ed0f178b619cbece06da6d54a224d4a887487d11cb639e103ca4","observation_id":"e65ef1d3-1899-4412-b8d6-fe0c8e795fa1","resolution":{"observed_at":"2026-08-15T15:59:08.556523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.541756Z","title":"Complexity guarantees for Polyak steps with momentum","venue":null,"work_id":"20c9d73f-4c11-4a2e-ace9-e99a869375c7","year":2020},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.375644Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:5dacf73b376a8211e05a3f4e9f9d9a52cd8637a407cfdb92bf4c11ae2fe41218","observation_id":"6d77bdeb-52f5-496f-a44e-62a4d89dde3d","resolution":{"observed_at":"2026-08-15T15:59:08.546068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.381309Z","title":"Two-point step size gradient methods.IMA journal of numerical analysis, 8(1):141–148, 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.381309Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:ea3deed429f243f136afbc1c62620592ee2047a106bacd2af427da5ce4e18911","observation_id":"e0313f02-1807-4d43-b1ea-fc839a17b4c0","resolution":{"observed_at":"2026-08-15T15:59:07.381309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.524513Z","title":null,"venue":null,"work_id":"28d1314f-a86c-4f06-975a-bb59513bee2d","year":2021},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.385336Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:0513d164b7f6f527612c81fec40a3e44cdac3ac3ce2ef6ddadc730a70e36e0b3","observation_id":"d72975c5-2f8b-45e9-b78e-80874bfd2fdb","resolution":{"observed_at":"2026-08-15T15:59:08.528569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.389404Z","title":"Sample size selection in optimization methods for machine learning.Mathematical programming, 134(1):127–155, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.389404Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:85fa0e9f2dbba418ca53bc3191ddf3cacf82b60dd1a8aa48cd54d3226d391318","observation_id":"a58afa3b-3cfb-4139-adb5-3cb279c76106","resolution":{"observed_at":"2026-08-15T15:59:07.389404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.433272Z","title":"Making SGD parameter-free","venue":null,"work_id":"c482f465-42a8-461f-a1dd-14d50383f00d","year":2022},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.394698Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:58c3dca294d4e08d435437e367799324d3f75e11cf1de5301bd64fdaff359172","observation_id":"1b59495b-ca11-45c4-8fbf-55e0dd863434","resolution":{"observed_at":"2026-08-15T15:59:08.485330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.347672Z","title":"Second-order step-size tuning of SGD for non-convex optimization.Neural Processing Letters, 54(3):1727–1752, 2022","venue":null,"work_id":"28258686-52a3-4ea3-a882-f740e94d8212","year":2022},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.399142Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:99456917a4f87362069e56cee662c74210327d1c667c8d978b92e286a78163b5","observation_id":"ee45d76b-4018-4ffa-87a4-8a087f48b818","resolution":{"observed_at":"2026-08-15T15:59:08.396419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.322432Z","title":"Fast bundle-level methods for unconstrained and ball-constrained convex optimization.Computational Optimization and Applications, 73(1):159–199, 2019","venue":null,"work_id":"a2a24e42-5598-4058-90c9-8506632eade1","year":2019},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.402857Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:cc090a960a97c894e5cdc781dbfd96f997d02a911a3fee622d87fde3274b823b","observation_id":"0790e4b9-2d94-4595-b944-e8775f091fc1","resolution":{"observed_at":"2026-08-15T15:59:08.326011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.311720Z","title":"Convergence rates of gradient methods for convex optimization in the space of measures.Open J","venue":null,"work_id":"685152e1-7b31-4f90-a9ba-7065bf804fc8","year":2022},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.406246Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:330ad7cc3e78b0c862e0a068b316824fac884bbb6072254928c75355245c8361","observation_id":"c3abeb0f-0392-48a7-8dd6-8218b9f2d7f0","resolution":{"observed_at":"2026-08-15T15:59:08.315693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.410124Z","title":"New tight bounds for SGD without variance assumption: A computer-aided Lyapunov analysis.arXiv preprint arXiv:2505.17965, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.410124Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:65aaa023ce078a8551484742bb540e2da750059e985d4d11f642fbe974fdc8e3","observation_id":"140c0664-2c14-49ef-8c24-735a3533fd20","resolution":{"observed_at":"2026-08-15T15:59:07.410124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.299838Z","title":"Artificial constraints and hints for unbounded online learning","venue":null,"work_id":"2968a491-5c06-4794-b888-7f0481d21e53","year":2019},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.413476Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:815c1547623648a5d86b1d5ac35b164cf1ed4a99a2f8e0893f2fe5f9f0e4fff9","observation_id":"e26ba4f2-82e7-4cac-b269-8d3b3553ff1a","resolution":{"observed_at":"2026-08-15T15:59:08.304197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.416714Z","title":"Learning-rate-free learning by d-adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.416714Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:5d0b7a2f9f7519bd7f3736fa6327c34719ac6a8865e4e64f65013ae3650cdd16","observation_id":"1c05c533-0bc4-49df-911f-dbf26ce0137a","resolution":{"observed_at":"2026-08-15T15:59:07.416714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06900","last_updated":"2022-06-14T14:55:27Z","snapshot_observed_at":"2026-08-16T16:53:04.972842Z","submitted_at":"2022-06-14T14:55:27Z","title":"Grad-GradaGrad? A Non-Monotone Adaptive Stochastic Gradient Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.06900","snapshot_observed_at":"2026-08-15T15:59:07.421848Z","title":"Grad-gradagrad? a non-monotone adaptive stochastic gradient method","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.421848Z"},"links":{"cited_paper":"/paper/2206.06900","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:44489ef9719babcc2e2ce7f2a9584739102c244ceeded5eb29d78a44c5a58c9c","observation_id":"eff84c2b-4497-480f-9b5b-b057e7cf982b","resolution":{"observed_at":"2026-08-15T15:59:07.421848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.281944Z","title":"Adaptive subgradient methods for online learning and stochastic opti- mization.Journal of Machine Learning Research, 12(7), 2011","venue":null,"work_id":"8470160e-49bc-4c2a-9e4b-06886f24a3b0","year":2011},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.425840Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:9a298265b8158e057d256fc0928d329997ce395b287c7a017cdc0b6e5a2cc3cd","observation_id":"3c24ff1d-ccba-4b4b-b9b5-52b9b9f4fada","resolution":{"observed_at":"2026-08-15T15:59:08.285698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.269309Z","title":"Duflo.Random iterative models, volume 34 ofApplications of Mathematics, New York","venue":null,"work_id":"da699c7c-3f18-4c47-91af-ca1ba24ace27","year":1997},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.429310Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:f48df4fff1691e2f5d27a64d0d27c12ae0280bceeb0b4e9555f47a03bc7a043c","observation_id":"bc8321df-3c0b-48d7-9eac-604bfc083a27","resolution":{"observed_at":"2026-08-15T15:59:08.272947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.257404Z","title":"The power of adaptivity in SGD: Self-tuning step sizes with unbounded gradients and affine variance","venue":null,"work_id":"3c108ea9-c49e-43ad-8aba-16cc8550dee2","year":2022},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.433159Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:47882904b80f51babc2b3b200ea6d3ff35b9a3c6105f02b575f8eeac077f6c44","observation_id":"aa693b89-a4ec-43dd-a207-21f99067efa3","resolution":{"observed_at":"2026-08-15T15:59:08.261625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.245582Z","title":"Learning rate selection in stochastic gradient methods based on line search strategies.Applied Mathematics in Science and Engineering, 31(1):2164000, 2023","venue":null,"work_id":"0f9aac9f-5a59-40d5-b43d-db920e929ee1","year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.436608Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:60409ce456cc9606ed4e391bb519b9b9e82da8a4becf40c8fd57356879b4bc36","observation_id":"6e2d9cdb-3c3f-40b2-893a-7800631c9af1","resolution":{"observed_at":"2026-08-15T15:59:08.249426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-08-16T15:59:56.095916Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-15T15:59:07.440472Z","title":"Handbook of convergence theorems for (stochastic) gradient methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.440472Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:36c26c34e3d41917eb392ab3a099aa6d941d30830950bac9f19c5b58f2f0369d","observation_id":"cc2d94ea-5041-4793-9690-b9e0a3af17c5","resolution":{"observed_at":"2026-08-15T15:59:07.440472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.234199Z","title":"A neural-network-based convex regularizer for inverse problems.IEEE Trans","venue":null,"work_id":"4ff1f41c-c6fb-4f9b-a167-77913485e927","year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.444984Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:a5e2ce4734b5f8b9469ff841bd70175e377aadfeef5f286209602f76e28fdee3","observation_id":"cd6dab65-6b8b-468b-b38b-c5bcb06ad2bc","resolution":{"observed_at":"2026-08-15T15:59:08.237925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.223136Z","title":"On optimal universal first-order methods for minimizing heterogeneous sums.Optimization Letters, 18(2):427–445, 2024","venue":null,"work_id":"3045c602-2b7d-420f-be17-d940636f5a5c","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.448339Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:5b4e0ea09fc9317eb6db5996274b826c4143b2580f7b094d8db7a4bdbcc80e90","observation_id":"feba319e-8c15-4fbc-a349-b7dad3d9efb4","resolution":{"observed_at":"2026-08-15T15:59:08.227519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00313","last_updated":"2022-08-02T17:48:25Z","snapshot_observed_at":"2026-08-14T16:38:47.494236Z","submitted_at":"2019-05-01T13:47:40Z","title":"Revisiting the Polyak step size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00313","snapshot_observed_at":"2026-08-15T15:59:07.451981Z","title":"Revisiting the Polyak step size.arXiv preprint arXiv:1905.00313, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.451981Z"},"links":{"cited_paper":"/paper/1905.00313","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:8345098cad26338c7925fe4b7d51007dca47cee81708eb72c49afb1efd29dbcb","observation_id":"bacb869c-9fcb-4e48-a60b-22086e0761fe","resolution":{"observed_at":"2026-08-15T15:59:07.451981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.211807Z","title":"Ismailov.Ridge functions and applications in neural networks, volume 263 ofMathematical Surveys and Monographs","venue":null,"work_id":"e8b635e2-e86e-4dd2-bb7d-642f299d7b25","year":2021},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.455860Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:530c7f5bb04c65f56ee4fc3fcdd414b141c4fd4d0e05c3e89b29def7eee8e219","observation_id":"7ce6b06f-3c1c-4aa6-ac22-42f9a31a9acb","resolution":{"observed_at":"2026-08-15T15:59:08.216038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.199387Z","title":"DoG is SGD’s best friend: A parameter-free dynamic step size schedule","venue":null,"work_id":"4c3b9af9-f386-447e-ba5a-fac6907ce223","year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.458997Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:cb78e120102017b7070bc2e499638ab75c0ccb87b059dd72c34c4868d6a66d01","observation_id":"a175e88c-0b64-4b61-b98a-e8d77019fef2","resolution":{"observed_at":"2026-08-15T15:59:08.203786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.186848Z","title":"Tuning-free stochastic optimization","venue":null,"work_id":"a9aba2c9-d44a-4f2b-a1cf-4521bae1ac6a","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.462665Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:70b465e132a94f530df530fa6ea351f1429e3f9a79c082f6aa82fe1df0eef6ba","observation_id":"c50062e0-4bd4-4bdd-8fa6-fd1254a52309","resolution":{"observed_at":"2026-08-15T15:59:08.191022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.174667Z","title":"DoWG Unleashed: An efficient universal parameter-free gradi- ent descent method.Advances in Neural Information Processing Systems, 36:6748–6769, 2023","venue":null,"work_id":"560438af-a201-495f-940d-600413ee8083","year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.466111Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:80160c3c529dce085e6fb1b130ce1ab5a39665bb0d7ea1dbc1f776cd1357d248","observation_id":"2dad2205-f1a9-4e60-835d-3f311736d5d4","resolution":{"observed_at":"2026-08-15T15:59:08.178752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.163073Z","title":"ADAM: A method for stochastic optimization","venue":null,"work_id":"2818e2d8-08a6-46ed-a601-4e98e9177937","year":2015},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.469865Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:c34b059f6e1c84615148f124fd695b5ef8c7824dde06f9c0e5deb8c27b4fd5f9","observation_id":"303be1cc-f74d-40d8-af06-8b798d32d4e7","resolution":{"observed_at":"2026-08-15T15:59:08.167436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12139","last_updated":"2024-11-15T12:23:42Z","snapshot_observed_at":"2026-08-16T14:50:58.714813Z","submitted_at":"2023-10-18T17:50:13Z","title":"Optimal and parameter-free gradient minimization methods for convex and nonconvex optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12139","snapshot_observed_at":"2026-08-15T15:59:07.473306Z","title":"Optimal and parameter-free gradient minimization methods for convex and nonconvex optimization.arXiv preprint arXiv:2310.12139, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.473306Z"},"links":{"cited_paper":"/paper/2310.12139","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:96c9782f8d544f654df4361b57a79a84effe11e85a44810c759d208842e7483e","observation_id":"76274d5a-228b-4715-80d3-e5216f0852e4","resolution":{"observed_at":"2026-08-15T15:59:07.473306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.146077Z","title":"Adaptive proximal algorithms for convex optimization under local lipschitz continuity of the gradient.Mathematical Programming, pages 1–39, 2024","venue":null,"work_id":"c5646716-9432-42f6-8a30-93b08f0805f8","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.476756Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:5078e546451939c436bf8fbafe828011f2994f375a829aa4df37aeeb51df0478","observation_id":"fb31f7df-5cd1-4727-830f-864e0dc89356","resolution":{"observed_at":"2026-08-15T15:59:08.150660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.133727Z","title":"Online to offline conversions, universality and adaptive minibatch sizes.Advances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":"e0dedab0-d99b-40cc-afaa-2ffd0bb02701","year":2017},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.480870Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:87bbcc14a455bf2a77385e267495bf444cd71cb512489316bab617a7616e6968","observation_id":"7f7e61f7-4a91-4cb1-8a2d-ae8c3823a604","resolution":{"observed_at":"2026-08-15T15:59:08.138355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10082","last_updated":"2024-08-17T03:06:14Z","snapshot_observed_at":"2026-08-16T14:51:54.209392Z","submitted_at":"2023-10-16T05:26:03Z","title":"A simple uniformly optimal method without line search for convex optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10082","snapshot_observed_at":"2026-08-15T15:59:07.484917Z","title":"A simple uniformly optimal method without line search for convex optimization.arXiv preprint arXiv:2310.10082, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.484917Z"},"links":{"cited_paper":"/paper/2310.10082","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:04c5018325fb61092cf175f96fd806affc05c6351d9c66d9694f3971933d4f9f","observation_id":"8d01bc9b-8e29-440c-81b9-febc9acb6297","resolution":{"observed_at":"2026-08-15T15:59:07.484917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.122390Z","title":"On the convergence of stochastic gradient descent with adaptive stepsizes","venue":null,"work_id":"1950cf3c-5f52-4887-b93d-c26ea1a759ea","year":2019},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.488891Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:aa88933345b069c7e50fc1805822198bfacc9310d8dd58d5c0f4c8bb5701018a","observation_id":"0c4f6c97-5b1e-49b4-b26f-7f3e2119ab7e","resolution":{"observed_at":"2026-08-15T15:59:08.126222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.493114Z","title":"Stochastic polyak step-size for SGD: An adaptive learning rate for fast convergence","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.493114Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:62aac56b187f04450f62eb485418fd407076c8f44c1f6265fa9c5d7637814fc5","observation_id":"38d041ae-4ee6-477e-902f-99b01ca736b2","resolution":{"observed_at":"2026-08-15T15:59:07.493114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10053","last_updated":"2024-04-15T16:37:57Z","snapshot_observed_at":"2026-08-16T18:57:10.988459Z","submitted_at":"2023-11-16T17:48:06Z","title":"Near-optimal Closed-loop Method via Lyapunov Damping for Convex Optimization","version":2},"cited_work":{"arxiv_id":"2311.10053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.10053","snapshot_observed_at":"2026-08-15T15:59:07.689504Z","title":"Near-optimal Closed-loop Method via Lyapunov Damping for Convex Optimization","venue":"math.OC","work_id":"5c2feece-8dbd-43c1-8e57-6432ede5d216","year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.500932Z"},"links":{"cited_paper":"/paper/2311.10053","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:d93d331c94f072ec426fbeeb093a50cc9758a77fdd3c662a0bde252683e2e1da","observation_id":"24a15f6b-751f-4d91-894c-03ece99c5e46","resolution":{"observed_at":"2026-08-15T15:59:07.697262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.102970Z","title":"Adaptive gradient descent without descent","venue":null,"work_id":"e4db90f8-d55e-4049-a953-fb61c308bc16","year":2020},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.505747Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:3ef62001d6dab3b9515e6e7a7c833a8a540a4f196d86859fcd3f71e39ed9d29f","observation_id":"4fb0c890-86e0-4d9f-9ca1-4bd35ca3b3d3","resolution":{"observed_at":"2026-08-15T15:59:08.107434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.087450Z","title":"Adaptive proximal gradient method for convex optimization.Advances in Neural Information Processing Systems, 37:100670–100697, 2024","venue":null,"work_id":"e125a3c0-5025-4373-87b1-fdac4a37c629","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.509441Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:3599453185739a19e49459da6cca13b4568d02bf3a1f2bf9a3f7a83c3ae5a33d","observation_id":"ff61b99f-f1a8-4c31-b5be-e7c1fa9d2798","resolution":{"observed_at":"2026-08-15T15:59:08.092416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.074731Z","title":"Adaptive bound optimization for online convex optimization","venue":null,"work_id":"6cb84219-8d78-4803-8246-cc56b61e2a0c","year":2010},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.512636Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:04b64566637e904be6cdddd380cd105c0f6175480b413bfba219b267a776e641","observation_id":"83ceb75f-5465-4585-a8b6-56b2eca9fbe4","resolution":{"observed_at":"2026-08-15T15:59:08.078631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.062650Z","title":"Prodigy: An expeditiously adaptive parameter-free learner","venue":null,"work_id":"86bc1e06-f0e9-4c33-9104-ee721f803d0f","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.516726Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:6fc653242d8bc8cea525571893c0407c9dd7be87bfab584d9fcfa4676c3c4696","observation_id":"590c4013-2aab-4b00-bd5b-7574d819ad9a","resolution":{"observed_at":"2026-08-15T15:59:08.066315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.051633Z","title":"Universal gradient methods for convex optimization problems.Mathematical Programming, 152(1):381– 404, 2015","venue":null,"work_id":"aa975e1d-c8e8-4564-b4cb-58e0143b613a","year":2015},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.520428Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:7cc04c7e45449e68262b12e71dd5ececb698be42ef9479e8ee0a0b642adb5af8","observation_id":"0a860d4c-3d81-4e56-97f7-2ed0db1dc669","resolution":{"observed_at":"2026-08-15T15:59:08.055338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.040146Z","title":"A method of solving a convex programming problem with convergence rate O 1 k2","venue":null,"work_id":"3261a742-d825-481f-b9b5-1fb030651ea0","year":1983},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.524703Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:f09e589b3303a760108ecffd83b87d428c85ef1d99b2bb423495c25700e0bf86","observation_id":"9858f094-aec4-434e-97b3-b7a86d5480a1","resolution":{"observed_at":"2026-08-15T15:59:08.044167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.530945Z","title":"Springer Science & Business Media, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.530945Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:02cd7b9e6256cd5bcfab1071432ebb33169c4b060ddc19b191b294332f79712e","observation_id":"defe4a81-6ef4-4fef-96b3-80681a1795c7","resolution":{"observed_at":"2026-08-15T15:59:07.530945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.019621Z","title":"Simultaneous model selection and optimization through parameter-free stochastic learning.Ad- vances in Neural Information Processing Systems, 27, 2014","venue":null,"work_id":"61eb39f3-bb51-4162-90b3-aa87ef973999","year":2014},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.534473Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:b1c513749c7ecc859257f2657877be00d6909e84cedaae85a383f97f680ada83","observation_id":"5ca82a62-91e6-47c9-a69e-3ffb1a9fb9f1","resolution":{"observed_at":"2026-08-15T15:59:08.024839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-16T16:05:28.745337Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-08-15T15:59:07.539876Z","title":"Normalized gradients for all.arXiv preprint arXiv:2308.05621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.539876Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:eeee76717d103c07590511a5ce963fb06fd44fc6b33503445af023c2e497aa84","observation_id":"731ef92c-faeb-4a58-b737-16f0d94a6409","resolution":{"observed_at":"2026-08-15T15:59:07.539876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:08.007287Z","title":"Icml 2020 tutorial on parameter-free online optimization, 2020","venue":null,"work_id":"650fe20f-8753-45e2-9e37-f3ac4ab2b135","year":2020},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.544180Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:3a4a5c29f4dd06ce8aca5eaec2360ac1945b16a9dded6ca291b9ba0e5f1cce87","observation_id":"67d39c1b-c324-4921-aec4-45f45bce4444","resolution":{"observed_at":"2026-08-15T15:59:08.012262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.990699Z","title":"Coin betting and parameter-free online learning.Advances in Neural Information Processing Systems, 29, 2016","venue":null,"work_id":"da5cf710-75ef-4e07-a36a-202773778479","year":2016},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.548269Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:7ca7992faa539ba42a610abb4beb01481dd20dd09c890591a0e00ce2fecb9978","observation_id":"c0e0de3d-0d15-4999-a295-088e2c922ee8","resolution":{"observed_at":"2026-08-15T15:59:07.997311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00236","last_updated":"2021-01-30T15:05:34Z","snapshot_observed_at":"2026-08-16T18:48:52.295012Z","submitted_at":"2021-01-30T15:05:34Z","title":"Parameter-free Stochastic Optimization of Variationally Coherent Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.00236","snapshot_observed_at":"2026-08-15T15:59:07.551940Z","title":"Parameter-free stochastic optimization of variationally coherent functions.arXiv preprint arXiv:2102.00236, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.551940Z"},"links":{"cited_paper":"/paper/2102.00236","citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:6ab3cd64bfcc44a70f5d50a80c3be3f72fcdc69564d1056ff519bae74ba81341","observation_id":"1588ba47-5fc5-4574-81ac-439271e3e317","resolution":{"observed_at":"2026-08-15T15:59:07.551940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.973236Z","title":"Training deep networks without learning rates through coin betting.Ad- vances in neural information processing systems, 30, 2017","venue":null,"work_id":"6a5459f8-ff33-4d0f-834b-cbd8661fa7bc","year":2017},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.557083Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:90d17eb9e854234e7cb0bdc27a5a5d6572b8cbb701c94ae06f8d130c0d8f69ce","observation_id":"141aeb97-6624-456d-a489-40cee3d94474","resolution":{"observed_at":"2026-08-15T15:59:07.979548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.561094Z","title":"Pedregosa, G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.561094Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:5b6781c0de60e604dc0bd5a4b509e92d18c142406019194341702b01ffac5ccb","observation_id":"050cc27b-5502-4d5b-bdbb-30a9a4c2d9ab","resolution":{"observed_at":"2026-08-15T15:59:07.561094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.948907Z","title":"New York, Optimization Software,, 1987","venue":null,"work_id":"64228763-a781-40e5-8f77-6709fe380d91","year":1987},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.564683Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:889f60cfbe841deb740d1678873d51a21360860f76e22233451ab86f2d5c0cb2","observation_id":"d195bf5e-95d7-4a68-afab-f8d1ff788cd6","resolution":{"observed_at":"2026-08-15T15:59:07.953859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.933622Z","title":"Statistical complexity and optimal algorithms for nonlinear ridge bandits.The Annals of Statistics, 52(6):2557 – 2582, 2024","venue":null,"work_id":"1eec1f72-8e55-4c42-af6d-5376d2312682","year":2024},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.575245Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:6c1a641fd92bd1f748b92f568a99f0b53fdeaee7f30b74495a8dca62680ef445","observation_id":"6bd2c4f5-c401-4783-aca7-48833feb4f82","resolution":{"observed_at":"2026-08-15T15:59:07.939370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.921927Z","title":"The Barzilai and Borwein gradient method for the large scale unconstrained minimization problem","venue":null,"work_id":"9e5d71de-c592-4251-8955-cd0ef1d73299","year":1997},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.579375Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:805cb5105543d40e8cf6ad6a311c5967f94bf78d3866bb742279efcf1d4d8f69","observation_id":"a0bd617d-532c-4d3c-b9d5-293dda0b98a6","resolution":{"observed_at":"2026-08-15T15:59:07.927117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.906959Z","title":"Robbins and D","venue":null,"work_id":"efb5fb97-db9c-4eab-8620-48dfccb1a369","year":1971},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.583065Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:7c06eb040e760e25faaf94f234ae61459fe850b6bf417dbae13e05cd6dcd56ce","observation_id":"4843c126-a99f-4cd0-8710-6d4c73e56b16","resolution":{"observed_at":"2026-08-15T15:59:07.912448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.893476Z","title":"Robles-Kelly and A","venue":null,"work_id":"346214f2-acee-4615-bb95-743fe948fd5b","year":2019},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.587995Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:fcfc999b99ded1e4e5270d301c06935f3c8d7b133f43628df8c9d47e4aadc6ec","observation_id":"790950f1-63a9-41ae-aa73-4201b3363fbb","resolution":{"observed_at":"2026-08-15T15:59:07.897216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.878963Z","title":"Optimizer benchmarking needs to account for hyperparameter tuning","venue":null,"work_id":"0003d45f-69ae-456d-ae62-689314796649","year":2020},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.591732Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:3f7e3f4d79de148276dc2402873027972c13c60f37024a0266944a15ea003f8a","observation_id":"d30a7e49-5966-47c4-a92d-3a129da31d48","resolution":{"observed_at":"2026-08-15T15:59:07.883611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.866962Z","title":"Barzilai-borwein step size for stochastic gradient descent","venue":null,"work_id":"649e1fb5-79df-467e-b4c1-98843c7ca7ab","year":2016},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.595793Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:3f2ed81357a7db7aec680072864f6bd2b2bd4ab32427645c594954c5ae907c1c","observation_id":"8a43bd19-7ae7-450d-9640-45793f57df6b","resolution":{"observed_at":"2026-08-15T15:59:07.871122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.855140Z","title":"RMSprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"4c9fc13d-5323-4abe-a6dd-11abec41b73a","year":2012},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.599408Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:c1735dc38995b601390adbf623694cc6030935083cbef33adfe238b9e79d58bb","observation_id":"43fa126e-d9c9-45fb-8e63-d439ced752b0","resolution":{"observed_at":"2026-08-15T15:59:07.858763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:59:07.844411Z","title":"Finally, for the right-hand side of (26), from (4), θkλk = λ2 k λk−1 ≤λ k−1 1 + 1− 1 k1/2+δ θk−1 =λ k−1 1 +θk−1− θk−1 k1/2+δ =λ k−1 (1 +θk−1) 1− 1 k1/2+δ θk−1 1 +θk−1","venue":null,"work_id":"12fd389d-8968-4831-bca8-f58f1fa6f24b","year":null},"citing_paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:59:07.603628Z"},"links":{"citing_paper":"/paper/2509.14969"},"observation_digest":"sha256:8acde390b4838dd1e00d99fe81c2881fd7311439814d9291c6ff209e44151edf","observation_id":"6bd536bb-2809-4111-ae3c-ae8ee4d89d70","resolution":{"observed_at":"2026-08-15T15:59:07.848187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.14969","last_updated":"2026-06-17T12:22:35Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T15:48:28.950902Z","submitted_at":"2025-09-18T14:02:10Z","title":"Stochastic Adaptive Gradient Descent Without Descent"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2509.14969."}