{"as_of":"2026-08-08T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd106aee30c6e624154feecfdaef579f3d97faef7fabb491d525d3a718263578","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:30:29.286244Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21651/citation-record","integrity":"/paper/2505.21651/integrity","json":"/paper/2505.21651/citation-record.json","paper":"/paper/2505.21651"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03126","last_updated":"2024-10-20T11:36:13Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T15:51:49Z","title":"How Free is Parameter-Free Stochastic Optimization?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03126","snapshot_observed_at":"2026-08-07T13:30:23.064115Z","title":"How free is parameter-free stochastic optimization? arXiv:2402.03126 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.064115Z"},"links":{"cited_paper":"/paper/2402.03126","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:d0ec5853ebdcc155af397feda58f36413db20c59fa0a169a044c25df7550fbb3","observation_id":"4ddf0f5f-4ee3-4ef8-8117-8dfa3e70f1be","resolution":{"observed_at":"2026-08-07T13:30:23.064115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:38.244747Z","title":"Calculus , volume 1","venue":null,"work_id":"a566dedb-b601-4931-8dc3-2606034113a9","year":1967},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.187262Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:ade2bc5c740f4656772a007395973d556bc07394006777b3d69b26dde09d8aba","observation_id":"aee387a0-0d2a-4cc7-9874-868a878da780","resolution":{"observed_at":"2026-08-07T13:30:38.322528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:38.014755Z","title":"Gradient descent converges linearly for logistic regression on separable data","venue":null,"work_id":"81d47062-09ed-45c4-95c1-ee2b3be8933c","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.284766Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:5c8e9240dd5bd3c542445e054d9cb89016b96565d4317ce7e290f183c31d48d9","observation_id":"fd78edb9-5eaa-446c-be1a-9cf9327857e3","resolution":{"observed_at":"2026-08-07T13:30:38.105432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.798378Z","title":"Julia: A fresh approach to numerical computing","venue":null,"work_id":"3795d3be-d4d6-4cab-a09a-bddd02e38cb5","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.335801Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:af88edeabd643ff5aeb7944d553f3efbea6c876683dfd6a5a1a8deb2a0c02c9d","observation_id":"204a1cdd-8cea-4e8b-a5b1-2ac44fe571ee","resolution":{"observed_at":"2026-08-07T13:30:37.889146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.607389Z","title":"Making SGD parameter-free","venue":null,"work_id":"906a0993-3a4b-4551-8646-54e348a205e8","year":2022},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.434935Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:6d667308fa0bb11e8f1bb1026a3aec3e55f7591c7afaf24b7b9968b25b2104db","observation_id":"dc942eac-f20d-4881-9c73-6ccf8118e61b","resolution":{"observed_at":"2026-08-07T13:30:37.708704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.409221Z","title":"Understanding and detecting convergence for stochastic gradient descent with momentum","venue":null,"work_id":"d922e7d2-8ce3-432a-a08d-f11e7000c9dd","year":2020},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.514854Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:d21fd81546f9d75424d459782089f5b29a3e08fcb64e10c90c44f5b7c414cbe5","observation_id":"649b4055-4bd7-4127-91ae-22caed5799c1","resolution":{"observed_at":"2026-08-07T13:30:37.455861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06382","last_updated":"2018-02-23T04:31:07Z","snapshot_observed_at":"2026-07-06T06:04:43.542218Z","submitted_at":"2017-10-17T16:51:16Z","title":"Convergence diagnostics for stochastic gradient descent with constant step size","version":2},"cited_work":{"arxiv_id":"1710.06382","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.06382","snapshot_observed_at":"2026-08-07T13:30:29.821389Z","title":"Convergence diagnostics for stochastic gradient descent with constant step size","venue":"stat.ML","work_id":"6a37aa15-9604-49c5-ba90-251c836141e1","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.643611Z"},"links":{"cited_paper":"/paper/1710.06382","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:0fc475f6bcb8aea5e9eb88af1808f0f3df41d00357a679a860362f8fb6a76efa","observation_id":"bfe847ce-4044-43d8-bb02-0ea0237f626a","resolution":{"observed_at":"2026-08-07T13:30:29.874881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.111342Z","title":"Automatically constructing a corpus of sentential paraphrases","venue":null,"work_id":"2b1d579f-2012-482a-b784-930af3131b49","year":2005},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.724831Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:a60db9c7f9c018e6ed7806453837d214111992be9900a2a15a680e099f41dd15","observation_id":"42083acd-ec66-4610-9a39-1d291963493f","resolution":{"observed_at":"2026-08-07T13:30:37.288214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.904388Z","title":"Robust, accurate stochastic optimization for variational inference","venue":null,"work_id":"a2268f73-04d2-4019-b416-9ded2fa9c5e8","year":2020},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.809334Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:d737b6fb9edb546ca38cea56c3f74783b40841e4f8bffbc63770f33274b938e2","observation_id":"9a2ecdec-5fd7-49f3-80ca-fc787084035f","resolution":{"observed_at":"2026-08-07T13:30:36.998998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.876555Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.876555Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e6e1b18e1374dc240f7885941609dbe50942ad529701b22f33cf6b91b37989ab","observation_id":"4171f955-c560-453a-a9de-dfcea1481669","resolution":{"observed_at":"2026-08-07T13:30:23.876555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.709238Z","title":"Learning-rate-free learning by D - A daptation","venue":null,"work_id":"cba41ebb-c457-4544-8f87-0a7eafe40036","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.965152Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:56616ce68a208ab833a364a33e0b2ec7e9b59b83cf15d1181a4ef5fe4774db2f","observation_id":"574adbda-bd38-4bb3-94fa-ad42f88a16f6","resolution":{"observed_at":"2026-08-07T13:30:36.763690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.547155Z","title":"Markov Chains","venue":null,"work_id":"d2104096-ebb1-409b-98f7-a9297068b9c3","year":2018},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.009501Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9f7d01d63c79afb20b3364987595ae65091884ef0198e9e0638829e94054c853","observation_id":"af7dafda-77e2-414a-8acb-756552a0c142","resolution":{"observed_at":"2026-08-07T13:30:36.610874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.353874Z","title":"Probability: Theory and Examples","venue":null,"work_id":"2cb7b786-1a46-412d-a1d3-41a7d784a415","year":2010},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.084769Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:5397964a257b6bcfebf96d6f36dc3290376308ca869c164cb9e694a829914887","observation_id":"aa54e8af-cc3b-455b-9b0e-3665668e6992","resolution":{"observed_at":"2026-08-07T13:30:36.444990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.124737Z","title":"The road less scheduled","venue":null,"work_id":"e4752c58-a07c-4869-94cb-8d25a6b230ad","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.161205Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9d8e6f911163e1a8db2e766f8aa015fb289ec09056074a5f5641ea529a32d411","observation_id":"b622ca89-67b0-408d-b08e-385de1e777df","resolution":{"observed_at":"2026-08-07T13:30:36.211598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.918970Z","title":"Bayesian Data Analysis","venue":null,"work_id":"67cd1c95-a8c9-4ed3-8fc9-4c820de7b78c","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.217374Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:45e84614a1b1b2474a2a4a8f48fda427598c8c628653a40a714aad17f7e19a8a","observation_id":"abd233f5-8329-4f89-8b88-1d11de747c4e","resolution":{"observed_at":"2026-08-07T13:30:36.005226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-07-06T14:44:56.245065Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-07T13:30:24.271122Z","title":"Handbook of convergence theorems for (stochastic) gradient methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.271122Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e9fef70c48085f11246fb69bed4a15f250f8a46de8290e7bb618f88b8830a100","observation_id":"7d99c6f7-0b53-42b8-a1aa-b86f26760ca8","resolution":{"observed_at":"2026-08-07T13:30:24.271122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.766032Z","title":"Inference from iterative simulation using multiple sequences","venue":null,"work_id":"fbcd7482-f064-4411-ad6f-ed553b6057ad","year":1992},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.344053Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:a2c9b6a58c37ac32c2fd0b1856c255547ce5342e84ebf8acd3ba270e1987dbf3","observation_id":"f3906197-8710-4483-afbb-550483e6c94e","resolution":{"observed_at":"2026-08-07T13:30:35.833611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.640744Z","title":"Don't be so monotone: R elaxing stochastic line search in over-parameterized models","venue":null,"work_id":"0fe9c8c7-c927-44b4-bec8-62693f706305","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.514784Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3eb9b163fcc8628caf2fe2ed41982691dde232144c98ce23804670f8352a34e7","observation_id":"f269af48-9b48-43d1-983c-85bc5d2e6d37","resolution":{"observed_at":"2026-08-07T13:30:35.705094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.388975Z","title":"Variance-reduced methods for machine learning","venue":null,"work_id":"4f78e54f-71d4-4000-af18-05fd5ec40b40","year":1968},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.644887Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9c767822fe0fa95f160a6d1011691daa3b9cd7e1b0d1676fe57d64b8ee3a2ce7","observation_id":"0380042f-3f8f-460a-a8b9-8bc45ae1a90f","resolution":{"observed_at":"2026-08-07T13:30:35.526086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.203538Z","title":"Srivastava, and K","venue":null,"work_id":"e52f4489-b68d-4f05-b876-12e728a55c2f","year":2012},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.734965Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:c6f0365f2aaa56b1cb3a8148e0c07a024fc2cf833ad72b95996291427ade0d46","observation_id":"36e6b8fe-9663-4636-b810-db23e70870ae","resolution":{"observed_at":"2026-08-07T13:30:35.292698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:24.804785Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.804785Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:81a6d0526870be8433ea5333f80aa3ede5a8f15e177c0e059fa827f703278a5e","observation_id":"fb0b79d0-6103-4375-8ba0-994978c72d94","resolution":{"observed_at":"2026-08-07T13:30:24.804785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.993698Z","title":"DoG is SGD 's best friend: A parameter-free dynamic step size schedule","venue":null,"work_id":"320c6c6a-005f-4d73-b4e3-09b4724508bd","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.917999Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:a9231f3abb2681ff2f378fd7e36600d131750291bd5a9acbc8ba3513d698bb59","observation_id":"e243249d-3c26-45c5-80ad-d1392bbc1618","resolution":{"observed_at":"2026-08-07T13:30:35.106516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.820664Z","title":"Parallelizing stochastic gradient descent for least squares regression: mini-batching, averaging, and model misspecification","venue":null,"work_id":"dcd626c0-67b7-4b72-a418-840eae71ca4e","year":2018},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.014606Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:5e71bba67060ff3fdccc88fa93b4dfd4137cfe4d911bd8f8d5dcdf42695ed2d4","observation_id":"a7c3fab8-dca2-42b3-b1d3-4e9e0e683339","resolution":{"observed_at":"2026-08-07T13:30:34.900072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:30:25.236602Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.236602Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:90369d0614d85dc47bc5f5840f78554834d1a9abb1a3d39d2b6d6400708945a3","observation_id":"8c143f95-dbd4-4722-969e-b57ec402f1a1","resolution":{"observed_at":"2026-08-07T13:30:25.236602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.596043Z","title":"Accelerated parameter-free stochastic optimization","venue":null,"work_id":"40d4f15f-c90e-418e-b9a3-38814c21e27e","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.364739Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:883511d5320a65586e8cdfeefb085d343813b35694c7177cb20f50a95b6a1034","observation_id":"e9f5da1e-7290-4058-a06b-8bc3a8160200","resolution":{"observed_at":"2026-08-07T13:30:34.699088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07793","last_updated":"2024-03-18T20:19:43Z","snapshot_observed_at":"2026-08-05T18:48:44.831235Z","submitted_at":"2024-02-12T16:59:06Z","title":"Tuning-Free Stochastic Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07793","snapshot_observed_at":"2026-08-07T13:30:25.644802Z","title":"Tuning-free stochastic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.644802Z"},"links":{"cited_paper":"/paper/2402.07793","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:f2db7ff10ae8f4fbdc5c7fc5a6589db6a1a7c10b9a68f2197c13808aa6144eff","observation_id":"f1dbf6ab-fc57-427a-9682-0f28089a6926","resolution":{"observed_at":"2026-08-07T13:30:25.644802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.411623Z","title":"Linear convergence of black-box variational inference: S hould we stick the landing? In International Conference on Artificial Intelligence and Statistics , pages 235--243","venue":null,"work_id":"c48378a7-52c9-4b0c-9af8-5f49bda2072d","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.815236Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:8609472997a7f0b2f797ce7e989cdec3a1d15e1a83bbd945fa2e3fa785286634","observation_id":"332916ce-44bc-4a4c-a515-c14d1a4eabfb","resolution":{"observed_at":"2026-08-07T13:30:34.500231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.248117Z","title":"DoWG unleashed: A n efficient universal parameter-free gradient descent method","venue":null,"work_id":"b75606ac-9dab-4508-842e-abacaa5cef31","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.935152Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:441a8520d44e1fa08b9661bea959a63bddf82db6f6a05d40527cd79b69431fc1","observation_id":"cc97eaae-22fe-433a-a526-03e65b9c99e0","resolution":{"observed_at":"2026-08-07T13:30:34.345067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:26.009608Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.009608Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9d71b9ba2c28d8b342e9cce2e548e7c0215a66ee906b38fdaaa6899e388bc69a","observation_id":"3d872e16-63cf-40c7-8062-5de2ee988c80","resolution":{"observed_at":"2026-08-07T13:30:26.009608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T13:30:26.125015Z","title":"RoBERTa : A robustly optimized BERT pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.125015Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9d387c360032166ec45ce424ffd56e9b51a0724f0a4aa69af11926fcefe4d620","observation_id":"3a8ed22e-5ebb-4893-875d-715a7d6c99ab","resolution":{"observed_at":"2026-08-07T13:30:26.125015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.999278Z","title":"Stochastic polyak step-size for SGD : A n adaptive learning rate for fast convergence","venue":null,"work_id":"820ebdd1-8efa-4486-b836-e1277f3bbce2","year":2021},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.255069Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:73c9f07571546fce0f35f8e3fc98641828a17a21881e606b3b707bfd9574f849","observation_id":"8666a607-6920-4c21-8721-f33055dabb10","resolution":{"observed_at":"2026-08-07T13:30:34.051792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.817358Z","title":"Using statistics to automate stochastic optimization","venue":null,"work_id":"a49defef-4290-47cc-9af2-d6ed0b3da6da","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.386965Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:662fa34baaecd9f2594bbdf8ce7b07a9f1f6ec50fe5f7e4ec1ec4075a7c15a2f","observation_id":"6bb0fb86-b258-49aa-aa2b-d30b47fdaf7e","resolution":{"observed_at":"2026-08-07T13:30:33.896297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06101","last_updated":"2024-03-19T23:01:06Z","snapshot_observed_at":"2026-08-05T09:04:21.780090Z","submitted_at":"2023-06-09T17:59:35Z","title":"Prodigy: An Expeditiously Adaptive Parameter-Free Learner","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06101","snapshot_observed_at":"2026-08-07T13:30:26.479605Z","title":"Prodigy: A n expeditiously adaptive parameter-free learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.479605Z"},"links":{"cited_paper":"/paper/2306.06101","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:af4ef83e2d544d9637cfe358bff50fbd0fa12cabf1424481e373aedf3afc6dd8","observation_id":"ea3a5ea4-6857-4233-9231-459089494ea2","resolution":{"observed_at":"2026-08-07T13:30:26.479605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09529","last_updated":"2020-08-15T20:00:34Z","snapshot_observed_at":"2026-08-03T23:24:33.697070Z","submitted_at":"2019-10-21T17:49:29Z","title":"Adaptive Gradient Descent without Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09529","snapshot_observed_at":"2026-08-07T13:30:26.665057Z","title":"Adaptive gradient descent without descent","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.665057Z"},"links":{"cited_paper":"/paper/1910.09529","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:f2f8bdb1cb5d77af7f29f237e7a238dec4e272b24365c0883b81c7282241d636","observation_id":"62a50b7a-aa01-4eb5-a9bc-605cdc44fc4f","resolution":{"observed_at":"2026-08-07T13:30:26.665057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.661451Z","title":"Beating SGD saturation with tail-averaging and minibatching","venue":null,"work_id":"33437d73-e811-4f1d-b42d-857adeb7ee23","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.964874Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:41f91c9bb76e6057405209d343c323b0b0607b0dd665aedce9fcbfa9e8c16171","observation_id":"23103646-e9af-4aaf-8a31-f8b19b14b154","resolution":{"observed_at":"2026-08-07T13:30:33.733177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.466114Z","title":"Let's make block coordinate descent converge faster: F aster greedy rules, message-passing, active-set complexity, and superlinear convergence","venue":null,"work_id":"e96dc81d-9180-468b-9065-a1dcde4a0abf","year":2022},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.065084Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e81d252d9943771ea4204972977fcd6438cff6006381606cb6a298ccb14dd6f9","observation_id":"662b3f75-7b27-4b96-8588-01f6aa9ba61f","resolution":{"observed_at":"2026-08-07T13:30:33.571767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.258723Z","title":"Dynamics of SGD with stochastic P olyak stepsizes: T ruly adaptive variants and convergence to exact solution","venue":null,"work_id":"149704f5-7241-4eb7-ae4b-f021483b63f1","year":2022},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.182224Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:6296c61766cee7b485685bbf6d1f8ec1e09f9f7eb532c9a4260a181d3ccf95cb","observation_id":"fcb7d2fb-32de-4f7e-a141-c063f88ba817","resolution":{"observed_at":"2026-08-07T13:30:33.370986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.976074Z","title":"Training deep networks without learning rates through coin betting","venue":null,"work_id":"ea4edc94-35a3-4731-baf9-58baf6f530eb","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.414972Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e2b236d672f0d5ec734c95b7dfd1c914b1e318b826c649a95e27b6a7e3dcf393","observation_id":"efce4528-360d-4278-8025-944fffac552d","resolution":{"observed_at":"2026-08-07T13:30:33.098648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.750917Z","title":"On convergence-diagnostic based step sizes for stochastic gradient descent","venue":null,"work_id":"a68e361f-fb04-445d-88e9-4ee3236cd2aa","year":2020},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.584877Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:62cd611702a3a512f9d3902fd44d10922bab17c086a244fe730d16432ea1296f","observation_id":"b1f77e31-f3f6-4b17-aa45-471c6eeaebac","resolution":{"observed_at":"2026-08-07T13:30:32.885767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.551659Z","title":"On the determination of the step size in stochastic quasigradient methods","venue":null,"work_id":"687718c0-07f9-4f0c-bd1a-809b49af4bde","year":1983},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.666340Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:2cee1ea19f3927f24034643214d76e88a320b24d1cd660d77431c90ca2acd8e5","observation_id":"c25f0525-7fc9-440f-9ef4-81f3c216a59f","resolution":{"observed_at":"2026-08-07T13:30:32.639217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.315153Z","title":"Non-asymptotic confidence bounds for stochastic approximation algorithms with constant step size","venue":null,"work_id":"be01cb80-a933-4349-8144-bae3d6b61541","year":1990},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.774917Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:d87885a118729fb97722123f3365e2bcc5f1efa0f9809ade4d52911d68af0052","observation_id":"b6ffb9cd-dac4-46c0-8cec-a7c171abf7f7","resolution":{"observed_at":"2026-08-07T13:30:32.392834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.115072Z","title":"Py T orch: A n imperative style, high-performance deep learning library","venue":null,"work_id":"4f104921-dd87-4f76-99b4-1375bd6522a8","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.905036Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:478950b5ee46574b112e5d3cafcd0bfa3dbf1a3ba30a08d13589ace70dd0dd0e","observation_id":"359e5e04-282e-4398-89dc-05087705d8ab","resolution":{"observed_at":"2026-08-07T13:30:32.241807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.903550Z","title":"https://huggingface.co/microsoft/resnet-18, 2025","venue":null,"work_id":"a46f5626-ad03-44b7-ac99-b7c095567eaf","year":2025},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.010649Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3737128e4d239b9c27d1f67f782892777a8f4aa4e12c18d0c481e57f74147441","observation_id":"acf787f1-2a75-4fed-967d-d50e6342a6a0","resolution":{"observed_at":"2026-08-07T13:30:32.018044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.652589Z","title":"A stochastic approximation method","venue":null,"work_id":"d257af64-9ed2-434a-8499-0f47d46e3c14","year":1951},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.121239Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:92fe428504569aef67f4377d77d985324ecec62582b22498a51f606ea9858e09","observation_id":"6454f534-0c17-463f-9b38-3a1d916d3ddc","resolution":{"observed_at":"2026-08-07T13:30:31.783988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.446072Z","title":"https://huggingface.co/FacebookAI/roberta-base, 2025","venue":null,"work_id":"31e1e4b2-566d-4589-8c19-8f92282fed36","year":2025},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.463148Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:994503b43d91f4fcd14a0775bb94c09c7dfc240fb7c496176fac6a1ae6d1f2ea","observation_id":"4a60d70a-43fc-4b69-9cd4-e010c9f1012e","resolution":{"observed_at":"2026-08-07T13:30:31.514873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05083","last_updated":"2019-02-19T19:00:20Z","snapshot_observed_at":"2026-07-06T07:32:57.637394Z","submitted_at":"2019-02-13T19:00:25Z","title":"Anytime Tail Averaging","version":2},"cited_work":{"arxiv_id":"1902.05083","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.05083","snapshot_observed_at":"2026-08-07T13:30:29.463937Z","title":"Anytime Tail Averaging","venue":"cs.LG","work_id":"ce6eecf5-4338-4d25-bff3-a25802e7aaf3","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.540616Z"},"links":{"cited_paper":"/paper/1902.05083","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:59d7039dab125d7b3e1e0cd0749b2919ae62739817e1f52d1eb592ef71814b8f","observation_id":"7927b180-2727-410e-b59e-a6b26519e75e","resolution":{"observed_at":"2026-08-07T13:30:29.584753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1109.5647","last_updated":"2012-12-09T21:19:27Z","snapshot_observed_at":"2026-07-06T02:34:39.393517Z","submitted_at":"2011-09-26T17:24:52Z","title":"Making Gradient Descent Optimal for Strongly Convex Stochastic Optimization","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1109.5647","snapshot_observed_at":"2026-08-07T13:30:28.585346Z","title":"Making gradient descent optimal for strongly convex stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.585346Z"},"links":{"cited_paper":"/paper/1109.5647","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:cfc4764e67df677f118c327edc43a26b483708b1c251ae7d0d9323918657ef92","observation_id":"dbfa0b42-1d36-4900-9839-ef3ce529f51a","resolution":{"observed_at":"2026-08-07T13:30:28.585346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.238227Z","title":"Sticking the landing: S imple, lower-variance gradient estimators for variational inference","venue":null,"work_id":"1713d519-c6e7-4128-ab4a-de4655684828","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.687107Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3b1ac342d6fd7be6e0a90a2727181a804b7ea8e4c4f19fe84439cac5f15bd67c","observation_id":"2f10f48c-f16a-44cb-941d-d5d633ef795d","resolution":{"observed_at":"2026-08-07T13:30:31.347644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.043109Z","title":"SQuAD : 100,000+ questions for machine comprehension of text","venue":null,"work_id":"a3442975-fa35-4830-9100-e7c0755187b2","year":2016},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.737065Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:da3e12d1ec505cd539cf69addcfba870da29c3dad0837bc3d1d80a618fc649bb","observation_id":"14442b01-b4df-40e7-b73f-8a897ade788d","resolution":{"observed_at":"2026-08-07T13:30:31.130714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.904748Z","title":"Virtual library of simulation experiments: T est functions and datasets, 2013","venue":null,"work_id":"a0cf04c8-df59-442a-ba9b-b9e63c9a84d2","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.815036Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:81097048fb64efe35b708663e2ddbd03a815626ea96c6ed8bb74a8e4511dd18c","observation_id":"8d42f786-343b-4ec1-8444-9576d3126183","resolution":{"observed_at":"2026-08-07T13:30:30.933615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.691010Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":"82ddda2e-733e-483f-a7ea-287f4091e6e2","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.856405Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e454031fe085ffcbed1aca80d8c45f5f6fd6d14120bb49a270b925a76af2ac8e","observation_id":"0acc27dd-ad8a-41c7-8cbe-df18780bf2d4","resolution":{"observed_at":"2026-08-07T13:30:30.762131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.498515Z","title":"Stochastic gradient descent for non-smooth optimization: C onvergence results and optimal averaging schemes","venue":null,"work_id":"af98fa55-6619-4777-b0e8-f9b0177cadaf","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.911294Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e0b05f6c342668b803c54f2548c7a2d0fb17000edc79270458174e08b67dbafd","observation_id":"b597a55d-446a-46dd-83f6-c4175b93c23b","resolution":{"observed_at":"2026-08-07T13:30:30.583910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.340795Z","title":"Painless stochastic gradient: I nterpolation, line-search, and convergence rates","venue":null,"work_id":"5a788a95-7761-4c4f-a72f-13cb07f9ca6e","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.941336Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b065ad1c848eff1a950a1065811c831c993b262c16e289e06d70c73b8796845b","observation_id":"f81a50cd-0413-41b8-9408-88f6d4dd081f","resolution":{"observed_at":"2026-08-07T13:30:30.444768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.205962Z","title":"A framework for improving the reliability of black-box variational inference","venue":null,"work_id":"b96d3fab-fd1b-4d00-8850-a2d3cfb9a0f8","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:29.073747Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:5c494d3b23b70239142fec457a7d2113c7b077347fb2a6638ed9ef9221e8d866","observation_id":"19139d0b-134b-46c5-a154-68bf21d15add","resolution":{"observed_at":"2026-08-07T13:30:30.280853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.011232Z","title":"GLUE : A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":"3165a0ad-dcaa-4296-a795-2422325ef401","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:29.175993Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:44397ad1a521cf9250a482943ebdc6548fbc1e2dc60d9ebbc07bca607bd77a2e","observation_id":"f258329d-7b20-498c-a848-44bc1f716d5b","resolution":{"observed_at":"2026-08-07T13:30:30.093008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00004","last_updated":"2018-12-21T16:09:27Z","snapshot_observed_at":"2026-07-06T07:04:59.871975Z","submitted_at":"2018-09-28T18:00:00Z","title":"Fluctuation-dissipation relations for stochastic gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00004","snapshot_observed_at":"2026-08-07T13:30:29.286244Z","title":"Fluctuation-dissipation relations for stochastic gradient descent","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:29.286244Z"},"links":{"cited_paper":"/paper/1810.00004","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b84160461f35f440c05ed5abcb55e4de0d4611e0e6422ada66fbe63b4dc89fba","observation_id":"563ed8bc-d756-4a3a-a11e-8f9e3f48bb71","resolution":{"observed_at":"2026-08-07T13:30:29.286244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:23:29.160561Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2505.21651."}