{"as_of":"2026-08-10T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6633b7f2f57d2c34a3801e8224360359afb9bd64d9f576b3bb0c94d4c52c581e","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:12:15.164885Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:20:10.337814Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:07.503096Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16098","snapshot_observed_at":"2026-08-06T20:20:10.337814Z","title":"Dimension-adapted momentum outscales SGD","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03404","last_updated":"2025-07-17T12:47:46Z","snapshot_observed_at":"2026-08-09T07:19:45.545261Z","submitted_at":"2025-07-04T09:12:23Z","title":"On the Effectiveness of the z-Transform Method in Quadratic Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:20:10.337814Z"},"links":{"cited_paper":"/paper/2505.16098","citing_paper":"/paper/2507.03404"},"observation_digest":"sha256:cbbc5676a0cf83369a384f2fc3ad05a7a2137155e17385e6ee971df05a43a612","observation_id":"44912105-8972-45f5-bd1a-3dea9a2c6d61","resolution":{"observed_at":"2026-08-06T20:20:10.337814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"cited_work":{"arxiv_id":"2505.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16098","snapshot_observed_at":"2026-07-03T23:59:07.503096Z","title":"Dimension-adapted momentum outscales sgd","venue":null,"work_id":"9a9efd47-be3c-463a-8af6-1ddda26651c8","year":2025},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-03T01:34:12.578849Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2505.16098","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:c75f62796840c5c03b11ccbfbeefd6f7c6838cecc91b55655fc8fa03014d50c4","observation_id":"31c32ee6-facb-4999-9ef6-63415c928577","resolution":{"observed_at":"2026-05-16T07:00:43.304186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"cited_work":{"arxiv_id":"2505.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16098","snapshot_observed_at":"2026-07-03T23:59:07.503096Z","title":"Dimension-adapted momentum outscales sgd","venue":null,"work_id":"9a9efd47-be3c-463a-8af6-1ddda26651c8","year":2025},"citing_paper":{"arxiv_id":"2603.26554","last_updated":"2026-04-28T07:36:37Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T16:13:18Z","title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T23:37:33.106390Z"},"links":{"cited_paper":"/paper/2505.16098","citing_paper":"/paper/2603.26554"},"observation_digest":"sha256:e5f22282589d39224a6d6c58cf661f248ea96e578051ac3fa75a270900c1706d","observation_id":"df47034a-be6e-4c53-afd9-564ee5c509b1","resolution":{"observed_at":"2026-05-14T23:38:16.331834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"cited_work":{"arxiv_id":"2505.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16098","snapshot_observed_at":"2026-07-03T23:59:07.503096Z","title":"Dimension-adapted momentum outscales sgd","venue":null,"work_id":"9a9efd47-be3c-463a-8af6-1ddda26651c8","year":2025},"citing_paper":{"arxiv_id":"2605.09552","last_updated":"2026-05-10T14:11:22Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T14:11:22Z","title":"Phases of Muon: When Muon Eclipses SignSGD","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:05:08.899876Z"},"links":{"cited_paper":"/paper/2505.16098","citing_paper":"/paper/2605.09552"},"observation_digest":"sha256:612b141aa342b7b5211e7b02d6d77f4b1872f0c2681b6553bc2d5fc0c2d2f204","observation_id":"d37d3a63-dce6-4d09-9013-0ab343d350ce","resolution":{"observed_at":"2026-05-12T06:41:28.307342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"cited_work":{"arxiv_id":"2505.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16098","snapshot_observed_at":"2026-07-03T23:59:07.503096Z","title":"Dimension-adapted momentum outscales sgd","venue":null,"work_id":"9a9efd47-be3c-463a-8af6-1ddda26651c8","year":2025},"citing_paper":{"arxiv_id":"2606.19179","last_updated":"2026-06-17T15:19:20Z","snapshot_observed_at":"2026-08-02T17:17:56.626421Z","submitted_at":"2026-06-17T15:19:20Z","title":"Compute Efficiency and Serial Runtime Tradeoffs for Stochastic Momentum Methods","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T21:31:49.871520Z"},"links":{"cited_paper":"/paper/2505.16098","citing_paper":"/paper/2606.19179"},"observation_digest":"sha256:66f16a39f906d60c44beedd5bbb4fad954e17913c8d7ed1590e558eaad09f6aa","observation_id":"fffdd257-1a9c-455d-a040-f492590a1944","resolution":{"observed_at":"2026-07-03T23:59:07.505191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16098/citation-record","integrity":"/paper/2505.16098/integrity","json":"/paper/2505.16098/citation-record.json","paper":"/paper/2505.16098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:08.527123Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:08.527123Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:8aaba333c38e57698607e557ca8b0b9913156266006276ae8f5e491242861039","observation_id":"135d7407-2e46-4b23-95ae-82ae0c12539f","resolution":{"observed_at":"2026-08-07T15:12:08.527123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:08.576915Z","title":"Katyusha: The first direct acceleration of stochastic gradient methods.The Journal of Machine Learning Research, 18(1):8194–8244, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:08.576915Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:da9cf1e2cddc30ded502723aa856e5a7a2827d94cf4a1050b35ba2934fb988db","observation_id":"4b3083f2-db48-4dc8-a915-e94f9f8a4526","resolution":{"observed_at":"2026-08-07T15:12:08.576915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1407.1537","last_updated":"2016-11-07T19:30:37Z","snapshot_observed_at":"2026-08-02T04:55:45.852668Z","submitted_at":"2014-07-06T20:11:48Z","title":"Linear Coupling: An Ultimate Unification of Gradient and Mirror Descent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1407.1537","snapshot_observed_at":"2026-08-07T15:12:08.694344Z","title":"Linear coupling: An ultimate unification of gradient and mirror descent.arXiv preprint arXiv:1407.1537, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:08.694344Z"},"links":{"cited_paper":"/paper/1407.1537","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:fb440ca3af0c990dda665f01c26ab17fe519550574c24aa5fec5d3176b0ee3ce","observation_id":"cd054e22-f13c-4563-b0b7-1aace20353dd","resolution":{"observed_at":"2026-08-07T15:12:08.694344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:08.767724Z","title":"From high-dimensional & mean-field dynamics to dimensionless odes: A unifying approach to sgd in two-layers networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:08.767724Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:283798ca6acc4af3885607c5d8258256cb044ad8314c4ccdb5d19ce6a17a94b1","observation_id":"9f972708-9958-4532-961e-931db2e1ccf0","resolution":{"observed_at":"2026-08-07T15:12:08.767724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:08.841165Z","title":"Springer, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:08.841165Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:0b659954b123c84330c37aa44c65647d44a93bb85acfa2a97aa1c8eb4668fc80","observation_id":"a3f8aae9-6e33-4e9f-8243-142f6d0d7755","resolution":{"observed_at":"2026-08-07T15:12:08.841165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:08.926945Z","title":"On the Convergence of Nesterov’s Accelerated Gradient Method in Stochastic Settings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:08.926945Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:310999b44afc3ef87152f7700bc1d804f6ce88b27ece3b3626fbbbfe1d6a03f1","observation_id":"8c03353e-8ee7-4b72-8f47-120441cdf4a6","resolution":{"observed_at":"2026-08-07T15:12:08.926945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05074","last_updated":"2025-11-10T21:45:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T16:45:40Z","title":"Two-Point Deterministic Equivalence for Stochastic Gradient Dynamics in Linear Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05074","snapshot_observed_at":"2026-08-07T15:12:09.010950Z","title":"Two-Point Deterministic Equivalence for Stochastic Gradient Dynamics in Linear Models.arXiv preprint arXiv:2502.05074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.010950Z"},"links":{"cited_paper":"/paper/2502.05074","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:2118a1873539f536edfe9e3592f237fc2ff876d596bf87f2fa4a47354a389892","observation_id":"526148f6-bb78-4f65-b3de-8afaf67c239f","resolution":{"observed_at":"2026-08-07T15:12:09.010950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.079607Z","title":"Courier Corporation, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.079607Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:45965cdd9193f427dad310d1f8e0821e6ca6a709761d6fe058002b9b17d48bb3","observation_id":"e4cc7151-1178-42a3-8677-d51be66258a4","resolution":{"observed_at":"2026-08-07T15:12:09.079607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.110884Z","title":"Robust Accelerated Gradient Methods for Smooth Strongly Convex Functions.SIAM Journal on Optimization, 30(1):717– 751, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.110884Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:5ee12a4ec78973514b61f55a1105aa36c1c64aa72fa07687aafaa32b54b16f7b","observation_id":"462a3f89-3288-4fb6-87fc-4a29acc82343","resolution":{"observed_at":"2026-08-07T15:12:09.110884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.164143Z","title":"High-dimensional analysis of double descent for linear regression with random projections","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.164143Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:b821825bdb30c04b584e8b03ac39d5cdb9f12b0f168cec005c684c26b6bbdd74","observation_id":"650080e0-5667-4d06-9503-018e49422a33","resolution":{"observed_at":"2026-08-07T15:12:09.164143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.234465Z","title":"Explaining neural scaling laws.Proc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.234465Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:714f07cba4471eceb8aa34cdb95d00193389096ac5d83ad0ee94be9a0259df01","observation_id":"1f55e450-1b5b-418e-b8dc-222f45f8412a","resolution":{"observed_at":"2026-08-07T15:12:09.234465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.333488Z","title":"Springer, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.333488Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:7b394c63a6208fc2f0a48cccb615d52e76bc33dd2c38811a1e93e4eb54cacaa6","observation_id":"77e74779-7a35-47b5-a7f7-2bd72e9e8398","resolution":{"observed_at":"2026-08-07T15:12:09.333488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.392838Z","title":"Crowdsourcing with enhanced data quality assurance: An efficient approach to mitigate resource scarcity challenges in training large language models for healthcare","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.392838Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:d4659204e89e2570d04ff1d22ba7ec1108dc294d975b244418104c9f45eb9027","observation_id":"44a1d67d-5c64-4366-9fea-478d1d18c20d","resolution":{"observed_at":"2026-08-07T15:12:09.392838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.473339Z","title":"Bartlett, Philip M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.473339Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:8f36652554351cc5b05f70672739bda30402428782c152dc50f41b73946034b9","observation_id":"9e19fb14-41e6-4611-a6ca-3176d1904428","resolution":{"observed_at":"2026-08-07T15:12:09.473339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.521953Z","title":"On the fast convergence of minibatch heavy ball momentum.IMA Journal of Numerical Analysis, page drae033, 08 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.521953Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:b7ec1335d6237df81c84358ab145bb82ac32abe7d36549e1cb000c2605b5b96b","observation_id":"a2385f8f-3166-4e02-83ca-6c2623cf1d67","resolution":{"observed_at":"2026-08-07T15:12:09.521953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.592264Z","title":"A Dynamical Model of Neural Scaling Laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.592264Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:81cc36465b818e4a58cc0159f3f0cedd58bc2840a2dc196964a96cfcd24ce198","observation_id":"1819c13f-b5d5-425e-b31f-754e6daa4334","resolution":{"observed_at":"2026-08-07T15:12:09.592264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.664313Z","title":"How Feature Learning Can Improve Neural Scaling Laws .International Conference on Learning Representations (ICLR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.664313Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:771d6ee23a23941d810dd0f9e7482c750493b225c0e9604022287527fe391c75","observation_id":"10a4aa30-3857-4a5f-bf1c-0938f3b93a6d","resolution":{"observed_at":"2026-08-07T15:12:09.664313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.737834Z","title":"On ill-posed problems and the method of conjugate gradients","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.737834Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:850cc5bf7db7f59edc4b2a0c444b020a0e3cc3bab0c3fe22a79d346f338b57ed","observation_id":"2b87434e-c18b-41af-a5fb-a759f34c540e","resolution":{"observed_at":"2026-08-07T15:12:09.737834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.824962Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.824962Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:096564e84fdb76d9abe83473f03afbcf86d7b81e9f910d970ca25f1c80d2ba39","observation_id":"aea1b5b3-5a87-4445-982f-2370de10eb40","resolution":{"observed_at":"2026-08-07T15:12:09.824962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.879637Z","title":"Accelerated Linear Convergence of Stochastic Momentum Methods in Wasserstein Distances","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.879637Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:f667a3b1db7c7fd78b1468ec2e1bd4d4244bdcc07b5bd9c1ba2f06d5be957553","observation_id":"7000e894-ed7b-40f7-aae5-5fad5c4ae2d3","resolution":{"observed_at":"2026-08-07T15:12:09.879637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:09.975511Z","title":"Optimal rates for the regularized least-squares algorithm","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:09.975511Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:809f7924ade45aa1c7df6c18677dce202d2fcb7c7d45ee1134d3741fe3ef3ca5","observation_id":"7e3d9de1-ae97-494e-bda8-6b3e69108bf5","resolution":{"observed_at":"2026-08-07T15:12:09.975511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.055752Z","title":"Learning with sgd and random features","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.055752Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:7af31514634013259c3c61b5d9b62e78c288ee7537e2b22db678cb5188aebe03","observation_id":"de3d30bf-5114-4c5f-a072-52ee848a8a01","resolution":{"observed_at":"2026-08-07T15:12:10.055752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08571","last_updated":"2025-06-19T21:42:08Z","snapshot_observed_at":"2026-07-06T14:06:16.951816Z","submitted_at":"2022-10-16T16:01:05Z","title":"Dimension free ridge regression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08571","snapshot_observed_at":"2026-08-07T15:12:10.125690Z","title":"Dimension free ridge regression.arXiv preprint arXiv:2210.08571, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.125690Z"},"links":{"cited_paper":"/paper/2210.08571","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:1e51f887f25788fa604557860c661a1a9289cc0dd292353631d31eff05f31ced","observation_id":"c7787e8a-a1e4-4778-b4e4-08c33044e72e","resolution":{"observed_at":"2026-08-07T15:12:10.125690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.170892Z","title":"Coddington and Norman Levinson.Theory of ordinary differential equations","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.170892Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:4a45e6e688a984a582334b8b021c4b822b19b295944091b54f96c9710f854801","observation_id":"a41fc781-f9d5-409c-a1a2-f831ff7bc930","resolution":{"observed_at":"2026-08-07T15:12:10.170892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.227001Z","title":"Hitting the high-dimensional notes: an ODE for SGD learning dynamics on GLMs and multi-index models.Inf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.227001Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:0519ae494ad0b57901a421b107b73a070baa36ee0913923e635d932025f8eac6","observation_id":"ac9b2793-f9a0-4e7a-b954-6bd20fd7f1c7","resolution":{"observed_at":"2026-08-07T15:12:10.227001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.307710Z","title":"The High Line: Exact Risk and Learning Rate Curves of Stochastic Adaptive Learning Rate Algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.307710Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:11d2aff354d87dbb786f1a2b244bfa3889da1b96ca4522470e185c8a2f88be34","observation_id":"790518d9-d364-449e-88da-93c67eb14a99","resolution":{"observed_at":"2026-08-07T15:12:10.307710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.366249Z","title":"Cambridge University Press, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.366249Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:9e8722dbbb711c48930f93678d658887b268cc0f53d07211fe4ca76d9de20d5b","observation_id":"f7c0427a-6e67-4d3d-b310-bf1cbc3046a6","resolution":{"observed_at":"2026-08-07T15:12:10.366249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.426401Z","title":"Generalization Error Rates in Kernel Regression: The Crossover from the Noiseless to Noisy Regime.Advances in Neural Information Processing Systems (NeurIPS), 34, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.426401Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:514a117d4afe73f05fef8b61915472516e358bde14fa01c717fc32ab1fe54b0b","observation_id":"90b77e17-5eb8-41a6-8aa7-2cc1ae107f05","resolution":{"observed_at":"2026-08-07T15:12:10.426401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.472734Z","title":"(Accelerated) Noise-adaptive Stochastic Heavy-Ball Momentum.Transactions on Machine Learning Research (TMLR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.472734Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:57315f59a2914cbf176ca6b81fa4e4d1b75bd08575fa09d869d91be082cdd18d","observation_id":"87444500-5974-48eb-ac00-467802c81d47","resolution":{"observed_at":"2026-08-07T15:12:10.472734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.526543Z","title":"On the interplay between data structure and loss function in classification problems.Advances in Neural Information Processing Systems (NeurIPS), 34:8506–8517, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.526543Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:d7c7973133ed09f7e6c1e5e0acc4f394160c90a167c1731d6ebe4eb27072db67","observation_id":"f00fa926-2e61-4409-903f-5bce04aedc06","resolution":{"observed_at":"2026-08-07T15:12:10.526543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.624618Z","title":"The DeepMind JAX Ecosystem.http://github.com/google-deepmind, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.624618Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:1bd5e5e9da21165bae6e70f91d071c23402b705a168f62fc8af13a64af5e413c","observation_id":"348f4f41-1af2-4b44-98c2-da15f3a1eff7","resolution":{"observed_at":"2026-08-07T15:12:10.624618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.713595Z","title":"The Road Less Scheduled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.713595Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:1cf0de8dcb0d638214db38adefbfdbdd1440ad63d46a96aebf2617f5d2d98082","observation_id":"e0f9cfc1-ed8f-4e5e-90dc-4799a4aa70f9","resolution":{"observed_at":"2026-08-07T15:12:10.713595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.793847Z","title":"Dimension-free deterministic equiva- lents and scaling laws for random feature regression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.793847Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:c37cd3a0eea5a06ad54cfcc315b98fc3377b60c076f187da3540820fb7532a59","observation_id":"92442c35-2fa5-4657-ab2b-994eca8d95c4","resolution":{"observed_at":"2026-08-07T15:12:10.793847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.877038Z","title":"Optimal Distributed Online Prediction Using Mini-Batches.Journal of Machine Learning Research (JMLR), 13(1), 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.877038Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:31d0894f30d842051307da9b15dd9078950cb7d93bd2ccaac4c811dccef5903d","observation_id":"58af36ce-541e-4f04-b485-99986b505d88","resolution":{"observed_at":"2026-08-07T15:12:10.877038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:10.935650Z","title":"Nonparametric stochastic approximation with large step-sizes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:10.935650Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:6ebb75ce1f004e1d12fe5ad20c12cf0a2a136dad874581a52bc4321abd944d4b","observation_id":"a87f1d43-518a-4ed4-9935-8f9b44edd404","resolution":{"observed_at":"2026-08-07T15:12:10.935650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.009255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.009255Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:10129f86455e1fcacb7f2f31a44391dcea64574041db02d0a704faf209b296e8","observation_id":"21249281-31f1-444b-b491-55a492c5b1fb","resolution":{"observed_at":"2026-08-07T15:12:11.009255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.089930Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.089930Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:ca7fcf24a1707ee0d5d5d616466399d812aa5c17b93fdc8420b3a009d4017d17","observation_id":"74af29cc-1f9f-4140-b092-7a5de1bd12a4","resolution":{"observed_at":"2026-08-07T15:12:11.089930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.132857Z","title":"Continuized Accelerations of Deterministic and Stochastic Gradient Descents, and of Gossip Algorithms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.132857Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:ee69c71f38599965ed419fc956304260e43210d72b50b66a17b1eb8562e59ade","observation_id":"d166a2d0-48fc-4837-a036-9193b156bb76","resolution":{"observed_at":"2026-08-07T15:12:11.132857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.182001Z","title":"Scaling Exponents Across Parameterizations and Optimizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.182001Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:e45c0a71aff802143521c72cd0f55665075abaa2dec7cb35f221a5794b81630b","observation_id":"8924603d-bb9f-40c8-af38-93258402db7c","resolution":{"observed_at":"2026-08-07T15:12:11.182001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.222216Z","title":"From Averaging to Acceleration, There is Only a Step-size","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.222216Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:58dd4f61ff29a38846593cb5f93ff0a09e232a23c3b9c8967294f8acbbc907ea","observation_id":"93452301-bea5-44a9-bc7f-c061c3da20ed","resolution":{"observed_at":"2026-08-07T15:12:11.222216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04228","last_updated":"2016-10-21T12:19:06Z","snapshot_observed_at":"2026-07-06T05:10:46.719489Z","submitted_at":"2016-09-14T11:54:04Z","title":"Stochastic Heavy Ball","version":2},"cited_work":{"arxiv_id":"1609.04228","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.04228","snapshot_observed_at":"2026-08-07T15:12:20.813070Z","title":"Stochastic Heavy Ball","venue":"math.ST","work_id":"231f38cf-188a-4df9-bb44-1bf18d684134","year":2016},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.296943Z"},"links":{"cited_paper":"/paper/1609.04228","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:19ee29a562a949b4edecaab1ea2874ffbaa6fc2475b3e0bab673205c7fe45f8e","observation_id":"d1d87dba-f7a8-4a31-a705-74e48f03bfc5","resolution":{"observed_at":"2026-08-07T15:12:20.850939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.344746Z","title":"Rigorous dynamical mean-field theory for stochastic gradient descent methods.SIAM Journal on Mathematics of Data Science, 6(2):400–427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.344746Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:24cada332c227453538793dbf152b731f71782457d2717318a4de4e87cf4a735","observation_id":"50c41e64-a2f8-49cb-8e95-025f260656cb","resolution":{"observed_at":"2026-08-07T15:12:11.344746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.467818Z","title":"Optimal stochastic approximation algorithms for strongly convex stochastic composite optimization I: A generic algorithmic framework.SIAM J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.467818Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:1778aa08f4e3d0ef49f8bee267c2fe014266c41cf114252d8a858e9bb7acbbac","observation_id":"0d2727dc-b4d1-4586-b0b9-dbd08e96a619","resolution":{"observed_at":"2026-08-07T15:12:11.467818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.518856Z","title":"Optimal stochastic approximation algorithms for strongly convex stochastic composite optimization, II: Shrinking procedures and optimal algorithms.SIAM J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.518856Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:6195713a49536828b391d27c66761df6c147592ec9c72e3dc9393534f22ceb3e","observation_id":"fdbe9b44-19ee-4ba2-8b10-7f80e28d118e","resolution":{"observed_at":"2026-08-07T15:12:11.518856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.548955Z","title":"On the resolvents of nonconvolution Volterra kernels.Funkcial","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.548955Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:c414ed7716ce8ddc5920b392b8e19d08fb0d85e554fbaf99678be0d2c0155735","observation_id":"f5dd253b-ad3f-4f1b-ac87-bda8888def06","resolution":{"observed_at":"2026-08-07T15:12:11.548955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.591130Z","title":"Siegel, and Stephan Wojtowytsch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.591130Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:c51df4980ed4939f4f5670182eca1376f610ccec0dfc248fc07158d527ca47a7","observation_id":"7e2d3e58-0686-40e9-8ad9-b2419e1308a3","resolution":{"observed_at":"2026-08-07T15:12:11.591130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.639226Z","title":"Deterministic equivalents for certain functionals of large random matrices.Ann","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.639226Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:dfa1839803c3be7474005b2008a00426137e565d47162be6c52b4ec151be90db","observation_id":"917ab0be-184d-4a63-ae8e-6b06198a0975","resolution":{"observed_at":"2026-08-07T15:12:11.639226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-07T15:12:11.702952Z","title":"Deep learning scaling is predictable, empirically","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.702952Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:a5c437e10844c1d290e9510fc0ae2c4c7007b9144719ad30c0b4fac5b5a8a92c","observation_id":"a4ed0afd-719f-41f5-89ac-e0ad58ac7675","resolution":{"observed_at":"2026-08-07T15:12:11.702952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.792938Z","title":"Long short-term memory.Neural computation, 9(8):1735– 1780, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.792938Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:49bf9becc7a4af5c6b941995e82822f86aaceeb718b7b5e306cbf2c27323ec8f","observation_id":"a5df0178-1a81-4547-94e9-507b09eb407a","resolution":{"observed_at":"2026-08-07T15:12:11.792938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.854988Z","title":"An empirical analysis of compute-optimal large language model training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.854988Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:ade0cb454e3eedd1bb6370eba86778ff032ad78089ab803b4b61196a6a69322b","observation_id":"09a72713-82a4-4a73-b826-0d02955031ea","resolution":{"observed_at":"2026-08-07T15:12:11.854988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08160","last_updated":"2024-03-13T00:59:25Z","snapshot_observed_at":"2026-07-06T17:43:40.149644Z","submitted_at":"2024-03-13T00:59:25Z","title":"Asymptotics of Random Feature Regression Beyond the Linear Scaling Regime","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08160","snapshot_observed_at":"2026-08-07T15:12:11.889425Z","title":"Lu, and Theodor Misiakiewicz","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.889425Z"},"links":{"cited_paper":"/paper/2403.08160","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:478e6f842a5bcd8b27356081f920ef1c4d6e06b7bfbf8c7bc33651ac77cdbd14","observation_id":"c3d20e83-e61e-4c22-b254-495fdcce2470","resolution":{"observed_at":"2026-08-07T15:12:11.889425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:11.956822Z","title":"Accelerating Stochastic Gradient Descent for Least Squares Regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:11.956822Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:a68462686d9fe2d5b7650d0c666524941c887eac3d3cabdfdbcdf1d4205bde45","observation_id":"b9ca4e24-e1ec-4fbc-bd40-01b2b1fd814b","resolution":{"observed_at":"2026-08-07T15:12:11.956822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-07-06T04:45:24.152472Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-07T15:12:12.031145Z","title":"Exploring the limits of language modeling.arXiv preprint arXiv:1602.02410, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.031145Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:8170359f8be40bdee53d08c23e86cadee51cec7d28f2f57e18600a6b2a62340f","observation_id":"27aaf3e1-a0fe-48c2-a9c6-31b6fa71ae0c","resolution":{"observed_at":"2026-08-07T15:12:12.031145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T15:12:12.115991Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alex Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.115991Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:e45d47b14797dff54179e649922e7c145071e074160b27ae629d317ca396ddec","observation_id":"f48f75ad-cd49-42ec-bdfd-e016d1531285","resolution":{"observed_at":"2026-08-07T15:12:12.115991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.196547Z","title":"On the Insufficiency of Existing Momentum Schemes for Stochastic Optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.196547Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:24977f7919d5a2f56ca24522c3dbd61b34820a6f4cbb614154faf79972fe077d","observation_id":"44ca49ad-4458-4678-a80c-40aa0f5b67d6","resolution":{"observed_at":"2026-08-07T15:12:12.196547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.275151Z","title":"Adam: A method for stochastic optimization.International Conference on Learning Representations (ICLR), 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.275151Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:52892ccf1dce90b455c8ec1dfb23f635c9ac3a061ddce46649e4823a14b5ac14","observation_id":"d1c0c5a0-cde5-4c46-8efa-b7483f067e54","resolution":{"observed_at":"2026-08-07T15:12:12.275151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-07T15:12:12.331233Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing.arXiv preprint arXiv:1808.06226, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.331233Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:17fb7710cf13a11532a373caee98d54c453412382401e856c59fdc6fd6b3c2c7","observation_id":"a8653e32-f538-4173-aeeb-1fecf1bfae3c","resolution":{"observed_at":"2026-08-07T15:12:12.331233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.411067Z","title":"A Generic Acceleration Framework for Stochastic Composite Optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.411067Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:bf4d47739dce70344f8a64882ec4f9a10bef13078a470aa9f36c9528fe5e7db8","observation_id":"9c76b7e3-52eb-40cd-af19-d71941e38dd4","resolution":{"observed_at":"2026-08-07T15:12:12.411067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.492599Z","title":"A Lyapunov analysis for accelerated gradient methods: from deterministic to stochastic case","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.492599Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:e39835294efebd03ebe1ad760edcf9d801488666c89a671714be804c22c9fc29","observation_id":"e1fb9b7c-1016-4c56-8781-2c078332e103","resolution":{"observed_at":"2026-08-07T15:12:12.492599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.558599Z","title":"Trajectory of mini-batch momentum: batch size saturation and convergence in high dimensions.Advances in Neural Information Processing Systems (NeurIPS), 35:36944–36957, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.558599Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:56a956467807cd5b778143f67fdcb570bb0c53a2201e50ffc55240882a558339","observation_id":"5159dc25-5322-41be-a2c4-5b5d25608b1f","resolution":{"observed_at":"2026-08-07T15:12:12.558599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14222","last_updated":"2023-11-23T23:02:10Z","snapshot_observed_at":"2026-07-06T16:51:44.144280Z","submitted_at":"2023-11-23T23:02:10Z","title":"Risk Bounds of Accelerated SGD for Overparameterized Linear Regression","version":1},"cited_work":{"arxiv_id":"2311.14222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.14222","snapshot_observed_at":"2026-08-07T15:12:20.528685Z","title":"Risk Bounds of Accelerated SGD for Overparameterized Linear Regression","venue":"cs.LG","work_id":"eeda2a2c-c6f4-424b-9903-19ddfa5f8c8c","year":2023},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.627811Z"},"links":{"cited_paper":"/paper/2311.14222","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:8d598592f9b98d17ddc24cc16a6586b39c2a3b80558f7eec4a53ca118510b3f9","observation_id":"ddb9b113-f8f5-4485-af76-c1c6b863ce7b","resolution":{"observed_at":"2026-08-07T15:12:20.612228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05013","last_updated":"2020-12-19T06:28:07Z","snapshot_observed_at":"2026-07-06T09:27:12.792882Z","submitted_at":"2020-06-09T02:05:40Z","title":"A Random Matrix Analysis of Random Fourier Features: Beyond the Gaussian Kernel, a Precise Phase Transition, and the Corresponding Double Descent","version":2},"cited_work":{"arxiv_id":"2006.05013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.05013","snapshot_observed_at":"2026-08-07T15:12:20.298743Z","title":"A Random Matrix Analysis of Random Fourier Features: Beyond the Gaussian Kernel, a Precise Phase Transition, and the Corresponding Double Descent","venue":"stat.ML","work_id":"974c5606-a3a3-4852-a668-8ca2fbad3eed","year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.694161Z"},"links":{"cited_paper":"/paper/2006.05013","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:64e9ac5c947a335bcfc1cc36560a3fdbe23b190bb0c9400ad4853e97fec8f089","observation_id":"852ad403-c7e9-4df9-81d7-649f7e54efc6","resolution":{"observed_at":"2026-08-07T15:12:20.425938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.753963Z","title":"Kakade, Peter L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.753963Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:6901490992c36d705afb31c2c476d6a3c11670e28741961236182d5c4eff65f1","observation_id":"053ca2cf-fcc8-4ea1-aa0f-45b7e3a37dac","resolution":{"observed_at":"2026-08-07T15:12:12.753963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.805747Z","title":"Accelerating SGD with momentum for over-parameterized learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.805747Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:4a9024ea63f2dc6609546f207b096680b40b464b703f76adf13b8c9ccd1fc6dd","observation_id":"9a357859-210e-41cf-842c-84b57ef82f5d","resolution":{"observed_at":"2026-08-07T15:12:12.805747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.834325Z","title":"Liu, Roman Novak, Jaehoon Lee, Mitchell Wortsman, Lechao Xiao, Katie Everett, Alexander A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.834325Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:298d002ad3d95009d382bc4bfa9dbe258f9df9fadd43af7cff6407fbc48e9f88","observation_id":"ec817234-2db1-430c-b069-b3f92cd2387c","resolution":{"observed_at":"2026-08-07T15:12:12.834325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09047","last_updated":"2025-02-13T08:02:15Z","snapshot_observed_at":"2026-08-07T22:45:21.641418Z","submitted_at":"2025-02-13T08:02:15Z","title":"Optimal Algorithms in Linear Regression under Covariate Shift: On the Importance of Precondition","version":1},"cited_work":{"arxiv_id":"2502.09047","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09047","snapshot_observed_at":"2026-08-07T15:12:20.060396Z","title":"Optimal Algorithms in Linear Regression under Covariate Shift: On the Importance of Precondition","venue":"stat.ML","work_id":"1a1cf874-5977-4e73-9c6f-45288a9a2335","year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.868390Z"},"links":{"cited_paper":"/paper/2502.09047","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:bc9c5d017b154fccf8319f6179963d87ade18ec5ebc8ae7f65627a76480b618a","observation_id":"7fbbc842-53b4-430d-9c47-7e925129935c","resolution":{"observed_at":"2026-08-07T15:12:20.139288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.896773Z","title":"Momentum and stochastic momentum for stochastic gradient, Newton, proximal point and subspace descent methods.Comput","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.896773Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:3996b8aa2559110e92183e4089f1091f7caf2dbc8f823ed424c455ebf353850e","observation_id":"d5c9818a-74f5-4015-a8fa-0ef5e3521dc9","resolution":{"observed_at":"2026-08-07T15:12:12.896773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:12.924813Z","title":"Learning curves of generic features maps for realistic datasets with a teacher-student model.Advances in Neural Information Processing Systems (NeurIPS), 34:18137–18151, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.924813Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:04ccc8fbcc63541eaaa26b4f355eaf85a28adada1b44fc25d723e843b7ba2401","observation_id":"0b454634-09f7-43e0-a13a-46ef805a4678","resolution":{"observed_at":"2026-08-07T15:12:12.924813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-07-06T14:12:14.561840Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-07T15:12:12.952767Z","title":"Roberts, and James Sully","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:12.952767Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:bcbeb0209369a2c79d584d73c3264be91a483dc0a3427ec4b2e384624a0bd4c1","observation_id":"f0eff303-0a79-4b5f-8810-45bc0ad8a5f2","resolution":{"observed_at":"2026-08-07T15:12:12.952767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-07T15:12:13.002974Z","title":"An empirical model of large-batch training.arXiv preprint arXiv:1812.06162, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.002974Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:732c09663a2b6ec7b43d4830911d343633d13b48e5f0beb741b91c6109e7e431","observation_id":"0564592b-6aeb-4422-a246-903804105d8e","resolution":{"observed_at":"2026-08-07T15:12:13.002974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.026255Z","title":"The generalization error of random features regression: Precise asymptotics and the double descent curve.Communications on Pure and Applied Mathematics, 75(4):667–766, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.026255Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:53446b973b7238e02258c2f4c8290a21e47e6793838dde69e19e01a2aa0e694e","observation_id":"1fa36a36-80c2-4131-aa76-98d55d5d16e8","resolution":{"observed_at":"2026-08-07T15:12:13.026255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.069131Z","title":"Anisotropic random feature regression in high dimensions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.069131Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:00374a96fe104f6d553ba02bb0988c76a68d246f5de66091a2b413fd6ff38e31","observation_id":"a3cf97ad-e2d2-4aa4-8540-793666d902a5","resolution":{"observed_at":"2026-08-07T15:12:13.069131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02431","last_updated":"2025-02-04T15:55:35Z","snapshot_observed_at":"2026-08-09T12:08:00.954352Z","submitted_at":"2025-02-04T15:55:35Z","title":"Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02431","snapshot_observed_at":"2026-08-07T15:12:13.131802Z","title":"Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants.arXiv preprint arXiv:2502.02431, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.131802Z"},"links":{"cited_paper":"/paper/2502.02431","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:40b296332f16845c987ca47bcc8a32104773d245f8c419b6ecc0d7987479afb6","observation_id":"6f9e2bb9-eab8-45bf-99ca-c4ae33ed39ad","resolution":{"observed_at":"2026-08-07T15:12:13.131802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.262004Z","title":null,"venue":null,"work_id":"0d537150-493d-4393-b2d7-a7869296629d","year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.177664Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:7bcdbcc3c09b8e73cb6f1a3e44f20a0afcbe4468d78538f153fabd62d7106e1d","observation_id":"f1acd3e5-95d2-4e0d-be42-e42c917f542f","resolution":{"observed_at":"2026-08-07T15:12:31.391972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.197630Z","title":"Springer, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.197630Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:928b5620450a5532f011ef213cc7d35b63f063068d725d1ae77d232f5ac4db3f","observation_id":"8f40a6a2-8f2f-4f2f-a624-4762c0f8e9ad","resolution":{"observed_at":"2026-08-07T15:12:13.197630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.067539Z","title":"The Role of Memory in Stochastic Optimization","venue":null,"work_id":"2869d779-4f73-45dd-a548-a63b7af0dadd","year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.242381Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:059b5dc0cfc47f36cf7650d4bf4b4a97897e7579b40298dc0626aed669cd830e","observation_id":"17281a23-901b-431b-9b98-601a6c53c8b0","resolution":{"observed_at":"2026-08-07T15:12:31.152731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.270556Z","title":"SGD in the Large: Average-case Analysis, Asymptotics, and Stepsize Criticality","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.270556Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:c62ea87ac8a2a916f854383a96b0a5e37cbbb8c6ff0f93c2c3c39c1fdfa6ba5c","observation_id":"1b5b3379-0054-4b11-a828-1934b8148ae4","resolution":{"observed_at":"2026-08-07T15:12:13.270556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.770026Z","title":"Dynamics of stochastic momentum methods on large-scale, quadratic models.Advances in Neural Information Processing Systems (NeurIPS), 34:9229–9240, 2021","venue":null,"work_id":"21ca2a3d-4c14-482f-a30d-019356599bda","year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.304324Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:b36e9315c5d9c69f3a9d6c1844c24446c07f57815e3906219602ce599ad7bb4e","observation_id":"40dd3cbe-f1e1-4cb5-b94c-1215bf77e574","resolution":{"observed_at":"2026-08-07T15:12:30.912642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07069","last_updated":"2022-05-14T14:10:08Z","snapshot_observed_at":"2026-08-06T15:01:42.337669Z","submitted_at":"2022-05-14T14:10:08Z","title":"Homogenization of SGD in high-dimensions: Exact dynamics and generalization properties","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07069","snapshot_observed_at":"2026-08-07T15:12:13.351237Z","title":"Homogenization of SGD in high-dimensions: exact dynamics and generalization properties.arXiv preprint arXiv:2205.07069, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.351237Z"},"links":{"cited_paper":"/paper/2205.07069","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:9ef755ceaa20434a51986b8a46e11838c16ce263de85b6629471104698d57b96","observation_id":"5a90cde5-1b9b-43b0-bb7b-8309618bf4c7","resolution":{"observed_at":"2026-08-07T15:12:13.351237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.536456Z","title":"4+3 Phases of Compute- Optimal Neural Scaling Laws","venue":null,"work_id":"33ae50ff-2ece-47ce-b876-f29b5f5381cc","year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.427922Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:8d0293f2a6480b16dc7f63f4a0405c432bbb93f09ffb1acb57b08928f25960db","observation_id":"f0ff3332-5124-4878-b902-c01cf276292e","resolution":{"observed_at":"2026-08-07T15:12:30.621066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.501661Z","title":"Statistical optimality of stochastic gradient descent on hard learning problems through multiple passes.Advances in Neural Information Processing Systems (NeurIPS), 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.501661Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:b6b51fbe95a3908aa40c161a440778cae8370b3353a3a20ba970397ddbcbf8a9","observation_id":"737976b7-4bf5-4059-bbcb-55ed4fb19100","resolution":{"observed_at":"2026-08-07T15:12:13.501661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.547316Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.547316Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:642e75df66b10548c3fea4815204b9d1bf7e1991fe9b8696b5b28d4688997ec5","observation_id":"004d037a-1373-4d55-9a63-488ea162624e","resolution":{"observed_at":"2026-08-07T15:12:13.547316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.317963Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","venue":null,"work_id":"69f19c42-97d8-45b3-aa84-93df15215170","year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.641022Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:6d315adc92d783851fa0dda1314351b72e39047833b98530903629df1462d9e9","observation_id":"44f3b326-0904-4cd7-89d8-fb0b1f9453d8","resolution":{"observed_at":"2026-08-07T15:12:30.411915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:13.741983Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.741983Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:195fce3f98b6eaba9dc11b36d61bf1fb6767df6666cad1910177ffb77484d70f","observation_id":"bca4adeb-9671-435b-b112-fa47a97f5fa2","resolution":{"observed_at":"2026-08-07T15:12:13.741983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.050923Z","title":"Generalization properties of learning with random features","venue":null,"work_id":"97ebbaa8-7913-4672-a169-06ae0835be92","year":2017},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.882567Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:e4f798492eb9ed0eec2d0ccf73d67bda12fc7702f7b94ec9f025a7a18d45ca75","observation_id":"2ff89abe-ac04-4103-96ae-0b8d61779263","resolution":{"observed_at":"2026-08-07T15:12:30.160450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.822725Z","title":"Almost sure convergence rates for Stochastic Gradient Descent and Stochastic Heavy Ball","venue":null,"work_id":"802f416b-c099-4c90-a62e-c485355f5117","year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:13.979761Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:8831b1c4e12bc626be61851dcbb5c290c5b02d438281f491b7672e4b8b722f11","observation_id":"da9a3bf2-2b7b-4c54-a4cf-ae3d2b390b60","resolution":{"observed_at":"2026-08-07T15:12:29.911458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.582028Z","title":"Shallue, J","venue":null,"work_id":"70e97d38-ca14-467a-b60f-b1d79527e3a7","year":2019},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.015657Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:b3419050b7d152f6e5bd918e22f91f37a93393544228b771ce19367e74139541","observation_id":"c7476da7-977f-4d7a-80f9-eb68268aaa3b","resolution":{"observed_at":"2026-08-07T15:12:29.697320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:14.134729Z","title":"Stochastic gradient descent for non-smooth optimization: Convergence results and optimal averaging schemes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.134729Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:3e192123640791d86afcb2f80f032a0e126918076cc77fb01ea45b2a8cfa1156","observation_id":"04779a5a-4676-4426-b882-3889dc35c8ea","resolution":{"observed_at":"2026-08-07T15:12:14.134729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.421959Z","title":"Scaling Laws from the Data Manifold Dimension.Journal of Machine Learning Research (JMLR), 23(9):1–34, 2022","venue":null,"work_id":"8f1f6f4d-2334-415d-a752-0aa00604e59e","year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.271925Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:bfdd7df86f0c47440c2669a53012bb4700e1441cd750ec261ccda2025452919f","observation_id":"f1c1bf81-5dc2-46bc-9fd5-1c3f213da4b7","resolution":{"observed_at":"2026-08-07T15:12:29.472616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:14.344996Z","title":"On the empirical distribution of eigenvalues of a class of large dimensional random matrices.Journal of Multivariate analysis, 54(2):175–192, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.344996Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:77ede5cdb0c887b179f28c68bbf754236d669095841f163c1d00f6fbd131dc09","observation_id":"924cc582-c9b3-413e-bde0-820d311f6044","resolution":{"observed_at":"2026-08-07T15:12:14.344996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.236029Z","title":"Simon, Dhruva Karkada, Nikhil Ghosh, and Mikhail Belkin","venue":null,"work_id":"f5f5c972-1fa9-44f4-b0d8-f71857289cfa","year":2024},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.434103Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:c24c26cbb0684b855da15a531612253c01a777f472bad5075c337ee3e9c5333c","observation_id":"3eea8b76-a2cd-4b0e-add9-05caa17752ba","resolution":{"observed_at":"2026-08-07T15:12:29.321907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.016945Z","title":null,"venue":null,"work_id":"dfa73ff4-9a95-4178-a7ee-b64f0d5dfe6c","year":2016},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.542758Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:6243fed4f8275dae182e4448f5f14482e7e53ec6d724fe0d11a35a676d585aa3","observation_id":"dd0133e4-f898-4aba-b79a-ba895ba901ba","resolution":{"observed_at":"2026-08-07T15:12:29.141930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.777325Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"49f79490-a394-447f-933c-e536f86faaf2","year":2013},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.619884Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:484a23f6f3540cd2f5eee919ae90274289582620d5cb5ad4d0ba93a7c2075140","observation_id":"9ccf918c-11fa-4acc-80cc-78ec84093e4b","resolution":{"observed_at":"2026-08-07T15:12:28.875096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.580596Z","title":"Accelerated sgd for non-strongly-convex least squares","venue":null,"work_id":"01abd8a1-2a1d-4971-a2e7-9adff8822d7e","year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.690619Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:31c75a23ebec8d7ff2618c8e177e79c8085c895889aea1b744f2f6cec59efb16","observation_id":"07a5a365-add0-4146-9573-b58485d9b9bb","resolution":{"observed_at":"2026-08-07T15:12:28.676049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.307786Z","title":"Last iterate convergence of SGD for Least-Squares in the Interpolation regime","venue":null,"work_id":"ee909039-16b6-48f2-b80f-bfaa3325eeb4","year":2021},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.798858Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:df6bf2c239881ae22f92c10cad28ef4b13d84626b8536ae7e3ac10bfb5ce4998","observation_id":"946bd2b3-490b-42d0-a693-83bce87abccb","resolution":{"observed_at":"2026-08-07T15:12:28.393259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.097724Z","title":"Fast and Faster Convergence of SGD for Over- Parameterized Models and an Accelerated Perceptron","venue":null,"work_id":"e658091a-ba97-408c-9eed-3375615b30f8","year":2019},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.917913Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:5c65a0ea7eb7219d6c2c84d550df408152f3d1624359ec0a01bc982755912efa","observation_id":"56854e95-7532-46c1-b2a4-5a93d425c62f","resolution":{"observed_at":"2026-08-07T15:12:28.207439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-09T20:41:07.756820Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T15:12:14.992638Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data.arXiv preprint arXiv:2211.04325, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.992638Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:a63bdb373585c16acd19178c055ccac380f1ff96ff0377c3625c38b8f6be3ccb","observation_id":"4612b370-df80-40a7-9d47-d1e2a4e3af3a","resolution":{"observed_at":"2026-08-07T15:12:14.992638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.01585","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:19.749282Z","title":"Re-examining Double Descent and Scal- ing Laws under Norm-based Capacity via Deterministic Equivalence.arXiv preprint arXiv:2502.01585, 2025","venue":null,"work_id":"705007a7-7499-490a-b9da-75635cd9a8a9","year":2025},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:15.073857Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:fabe2dd46ab106181b99f879467a8d04dc32abf6b2846a072d6156739df05f66","observation_id":"01a48e64-08ec-4a3a-af88-c318190e731b","resolution":{"observed_at":"2026-08-07T15:12:19.859626Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.920894Z","title":"A variational perspective on accelerated methods in optimization.proceedings of the National Academy of Sciences, 113(47):E7351–E7358, 2016","venue":null,"work_id":"8ffe6392-c218-45e9-9ee4-655087dfb0d0","year":2016},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:15.119825Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:9385edcc2f1e052906d182f450f4db8fb53b059f042cac740d0c836c330733e8","observation_id":"b6b2e15e-b637-493a-8a6f-0431bb7db6d5","resolution":{"observed_at":"2026-08-07T15:12:28.007177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.737003Z","title":"Small-scale proxies for large-scale Transformer training instabilities","venue":null,"work_id":"95faec9a-5da7-4515-92e1-469d9f1f1d79","year":2023},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:15.164885Z"},"links":{"citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:71afe773d11f7f33493dce9e692c83ed013a5bdb5cb3b355c202859fa020be8d","observation_id":"689c7404-5308-42fd-b8be-6aa24e82590a","resolution":{"observed_at":"2026-08-07T15:12:27.820816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-09T03:47:30.048690Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":5,"verified_fuzzy":15},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 5 inbound Pith citation observations for arXiv:2505.16098."}